AI 早报 2026-06-18

本页合并来源:Juya AI 早报 + AI HOT 日报。Juya 保留完整精选,AI HOT 作为补充来源;已按链接和标题做基础去重。

概览

Juya · 要闻

  • OpenAI 推出 ChatGPT 计划任务功能,将在 14 天内下线 Pulse #1
  • Codex团队修复容量超载问题并发放双重重置 #2

Juya · 开发生态

  • Vercel 推出 eve:文件系统优先的开源 Agent 框架 #3
  • GitHub Copilot 桌面应用正式发布 #4
  • Firecrawl 免 API key 开放免费试用,已上线 MCP 及 API #5
  • Exa 推出高性价比 Web 研究 API Exa Agent #6
  • OpenRouter推出Cost Simulator成本估算工具 #7

Juya · 产品应用

  • Anthropic 更新 Claude Design:支持设计系统导入与代码同步 #8
  • Databricks 团队开源 Omnigent,支持多 Agent 实时协作与调度 #9
  • 微信支付推出 AI 专属卡 支持授权 Agent 代付款 #10

Juya · 模型发布

  • SpaceXAI 发布 Grok Imagine Video 1.5:API 及移动端全面可用 #11
  • Ai2 发布开源 3D 运动预测模型 MolmoMotion #12
  • HappyOyster 1.0 模型升级新增冒险与导演模式 #13
  • 中国电信6款星辰语音大模型上线模力方舟 #14

Juya · 技术与洞察

  • OpenAI 展示 GPT-5.4 在药物化学中的近自主实验能力 #15
  • OpenAI推出生命科学评测基准LifeSciBench #16
  • Google 开源 Agentic Resource Discovery 规范 #17
  • Cloudflare 发布 The Cloudflare One stack 赋能 Agent 部署 #18

Juya · 行业动态

  • G7峰会商业领袖与各国政要探讨AI断供风险拟设信任伙伴计划 #19
  • Transformer 作者 Noam Shazeer 宣布加入 OpenAI #20
  • OpenAI 投资 60 万美元支持 Rust Foundation #21
  • 广东上线试运行全国首个省级政务智能中枢“湾擎” #22
  • Odyssey 完成3.1亿美元B轮融资 估值达14.5亿美元 #23

Juya · 前瞻与传闻

  • 传美国政府暂缓拉黑 DeepSeek,微软探索引入其模型降本 #24
  • 美国政府限制 Anthropic 模型,要求彻底阻断 jailbreak #25

AI HOT 补充

  • MolmoMotion:语言引导的3D运动预测模型 #A1
  • Grok 4.3 在 Amazon Bedrock 正式可用 #A2
  • Vercel 发布开源 AI 智能体框架 Eve:每个智能体就是一个文件目录 #A3
  • Omnigent开源:AI智能体团队元框架 #A4
  • Google发布99美元Gemini智能音箱 #A5
  • Wolfram 语言和 Mathematica 15 版发布:内置 AI 助手、符号音乐等新功能 #A6
  • 阿里云发布HappyOyster 1.0:一句话生成可实时交互的数字世界 #A7
  • Anthropic与DeepMind CEO呼吁G7组建AI联盟排除中国 #A8
  • 泄露文件显示OpenAI年营收130亿但亏损远超收入 #A9
  • 消息称 OpenAI 今年一季度现金消耗达 37 亿美元,超同期收入的一半 #A10
  • 中国加紧筹建世界人工智能合作组织 #A11
  • 谷歌发布Agentic Resource Discovery(ARD)开放规范 #A12

Juya 早报精选

要闻

OpenAI 推出 ChatGPT 计划任务功能,将在 14 天内下线 Pulse #1

OpenAI 官方宣布,正在向 ChatGPT 的 Web 端和移动端用户推出全新的“计划任务”功能。该功能现已面向 Go{、|"、"}Plus、Pro、Business 和 Enterprise 用户开放,支持定时提醒与循环任务,同时现有的 Pulse 功能将在 14 天内下线。

OpenAI 官方宣布,正在向 ChatGPT 推出重新设计的“计划任务”功能,现已面向 Web 端和移动端的 Go、Plus、Pro、Business 和 Enterprise 用户逐步开放。用户可通过侧边栏全新的 Scheduled 页面集中管理任务,设定具体时间或时段来发送提醒、处理重复工作或监控变化,任务运行频率被限制为每小时最多一次。官方表示,全新的系统将在未来 14 天内取代现有的主动任务功能 Pulse,用户可迁移至新系统获取每日简报。

相关链接:


Codex团队修复容量超载问题并发放双重重置 #2

Codex团队修复了导致部分用户遭遇"model at capacity"高错误率的问题,并为所有计划用户执行了一次完全使用次数重置和一次可储存日后使用的banked reset。

Codex团队成员Tibo确认,部分Codex用户此前遭遇"model at capacity"高错误率问题,该问题已被修复。团队随后执行了一次"双重重置":一次面向所有计划用户的完全使用次数重置,以及一次存入重置存储库、供用户自行选择时机使用的banked reset。用户将同时获得本次全局重置和banked reset两项。

相关链接:


开发生态

Vercel 推出 eve:文件系统优先的开源 Agent 框架 #3

Vercel 发布开源 Agent 框架 eve,现处公开预览,该框架将每个 Agent 定义为文件目录,内置持久化执行、沙箱计算和审批等能力。

Vercel 发布开源 Agent 框架 eve,以 npm 包形式提供,采用 Apache-2.0 许可证,目前处于公开预览阶段。该框架采用"文件系统优先"设计,每个 Agent 即磁盘上的一个目录,目录中每个文件对应一项能力,最小可运行的 Agent 仅需两个文件——一个配置模型,一个编写指令。框架内置持久化执行、沙箱计算、人在环中审批、安全连接、多渠道以及追踪与评估六项生产级能力。Vercel 官方称已在生产环境中运行超过 100 个基于 eve 的 Agent,开发者可通过 npx eve@latest init 快速启动项目,并通过 vercel deploy 部署至生产环境。

相关链接:


GitHub Copilot 桌面应用正式发布 #4

GitHub 官方宣布GitHub Copilot 桌面应用正式发布,支持 macOS、Windows 和 Linux 系统。该应用主打 Agent 驱动开发,支持跨代码库运行并行会话。

GitHub 官方宣布其桌面端应用 GitHub Copilot app 现已正式发布(GA)。该应用原生构建于 GitHub,专为 Agent 驱动开发设计,允许用户从 issue、PR 或提示词开启会话,并在不同分支或代码库中运行并行会话。自技术预览版以来,该应用新增了可视化双向操作界面 Canvases、云端周期性任务调度,以及通过 MCP servers 自带模型和外部工具的能力,同时支持与 VS Code 无缝切换且不丢失上下文。目前该应用支持三大主流桌面系统,但若要在 Copilot Business 或 Enterprise 套餐中使用,组织或企业管理员必须在策略设置中启用 Copilot CLI。

相关链接:


Firecrawl 免 API key 开放免费试用,已上线 MCP 及 API #5

Firecrawl 官方宣布,即日起用户无需 API key 即可免费体验网页搜索、爬取及 PDF 解析等功能,目前已在其 MCP、CLI 和 API 上线。

Firecrawl 官方宣布,即日起开放免 API key 的免费试用。用户无需任何设置即可使用其 MCP、CLI 和 API 端点,进行网页搜索、爬取、交互以及将 PDF 解析为 Markdown。官方表示,用户可以先开始使用,仅在需要扩展规模时才需要进行注册。不过,多位社区用户反馈称尚未在文档中找到关于该项免费试用的具体速率限制说明。

相关链接:


Exa 推出高性价比 Web 研究 API Exa Agent #6

Exa推出Web研究API Exa Agent。它混合高性价比模型与token高效技术,大幅降低成本与延迟。该API现已全面开放。

Exa 正式发布 Exa Agent,这是一个面向深度研究、列表构建和实体丰富的 Web 研究 API。官方称,该 API 通过混合多种高性价比模型并应用 token 高效技术,在 WideSearch 等基准测试中表现出最佳性价比,成本不到 GPT 5.5 和 Opus 的一半。该 API 提供从 0.012 美元到 1.00 美元不等的五档定价,支持结构化输出,现已全面开放。

相关链接:


OpenRouter推出Cost Simulator成本估算工具 #7

OpenRouter官方推出Cost Simulator实验室工具,可基于用户实际流量数据与端点中位数定价,估算使用不同模型时的成本节省,目前已开放试用。

OpenRouter通过官方社交账号宣布,在其实验室项目中推出了一款名为Cost Simulator的简单工具。该工具的核心功能是结合用户的实际流量数据,使用端点中位数定价,来估算用户在切换到不同模型后可能实现的成本节省。官方在发布时提供了试用入口,用户可以直接体验。

相关链接:


产品应用

Anthropic 更新 Claude Design:支持设计系统导入与代码同步 #8

Anthropic 更新了 Claude Design,使其能够在跨项目中严格遵循导入的设计系统,并支持与 Claude Code 进行双向同步。新版本引入了精细化的画布编辑控件,并将使用额度与其他claude产品共享。

Anthropic 更新了 Claude Design,引入多项新功能以提升设计与代码的协同效率。本次更新核心内容包括:一是支持导入设计系统,Claude 会基于真实组件构建并在输出前自动对照检查,团队管理员可锁定标准系统以保合规;二是实现与 Claude Code 的双向同步,开发者可通过相关命令直接拉取设计、移交项目或将代码转换为原型,无需基于截图重建;三是升级了画布精细化布局控件并修复数百个稳定性问题;四是使用额度与 Claude Chat、Code 等工具共享,官方称平均 token 消耗减少且错误率下降;五是支持导出至 PDF 和 PowerPoint,并集成 Adobe、Canva 等第三方工具。

相关链接:


Databricks 团队开源 Omnigent,支持多 Agent 实时协作与调度 #9

Databricks 开源 AI Agent 框架 Omnigent Alpha版本。该框架提供了一个统一的 meta-harness 编排层,允许用户在单个实时会话中协同调度 Claude Code、Codex 等多种 Agent,支持多模型辩论、跨设备同步及移动端控制。

Omnigent 是一款基于 Apache 2.0 协议的开源 AI Agent 框架与 meta-harness,目前处于 Alpha 阶段。它允许用户在一个共享会话中编排并监督多个 AI Agent,如 Claude Code、Codex、Cursor 和 Pi,无需重写代码即可切换底层 harness,甚至能配置“监督 Agent”让不同模型相互审查代码或进行辩论。该框架支持通过 API key、订阅或第三方兼容网关接入模型,并在 Linux 和 macOS 上强制执行系统级沙箱隔离与细粒度权限策略。用户可通过终端、浏览器或 macOS 桌面端 App 进行操作,且会话数据能实时同步至手机等移动设备,同时支持多人实时协作与云端沙箱运行。

相关链接:


微信支付推出 AI 专属卡 支持授权 Agent 代付款 #10

微信支付正式发布 AI 专属卡。目前该功能已在 Mac 端 WorkBuddy 上线,支持用户通过 Agent 下单支付,其消费与主账户隔离,且每笔订单均需用户本人授权确认。

微信支付发布了 AI 专属卡,允许用户在与 Agent 的对话中提出消费需求,由 Agent 协助完成下单和支付。目前该功能已在 Mac 端 WorkBuddy 中开放,用户可将客户端升级至 5.1.1 版本进行体验。在安全机制上,AI 专属卡与用户的微信支付主账户完全隔离,卡内额度由用户自定义并支持随时调整,且每一笔订单都必须经过用户本人的最终授权确认。

相关链接:


模型发布

SpaceXAI 发布 Grok Imagine Video 1.5:API 及移动端全面可用 #11

SpaceXAI 宣布正式发布视频模型 Grok Imagine Video 1.5 及 Video 1.5 Fast。相比上一代,新模型在音频同步、运动连贯性和物理效果上均有显著提升,相关模型已上线 API 和面向消费者的网页及移动端。

SpaceXAI 官方宣布正式推出视频生成模型 Grok Imagine Video 1.5 和 Video 1.5 Fast。相比上一代,新模型在音频同步、运动连贯性和物理效果上均有显著提升,其中 Video 1.5 Fast 生成 6 秒 720p 视频的时间从 40 多秒降至约 25 秒。目前,Imagine Video 1.5 已在 SpaceXAI API 中结束预览并全面可用,而 Video 1.5 Fast 则面向消费者在 grok.com、iOS 和 Android 应用上推出。此外,官方计划在未来几天内为 Grok Imagine 推出 Projects、多 Agent 并行生成以及媒体库搜索等新功能。

相关链接:


Ai2 发布开源 3D 运动预测模型 MolmoMotion #12

Ai2 发布并开源了基于 Molmo 2 的 3D 运动预测模型 MolmoMotion。该模型结合视觉历史、物体查询点与语言指令预测 3D 轨迹,同步开源了 MolmoMotion-1M 数据集与 PointMotionBench 基准。

Ai2 发布并开源了基于 Molmo 2 视觉语言骨干的 3D 运动预测模型 MolmoMotion,同步释出包含 116 万条视频的 MolmoMotion-1M 数据集与 PointMotionBench 基准。该模型能够根据视觉历史、查询点及语言指令预测物体的未来 3D 轨迹,官方称其在机器人抓放规划测试中显著提升了成功率,并能作为引导信号提升图生视频的准确性。目前模型提供了预测离散坐标的自回归(AR)变体和生成连续轨迹的流匹配(FM)变体,权重及相关资源已在 Hugging Face 等平台以 Apache License 2.0 协议开放下载。

相关链接:


HappyOyster 1.0 模型升级新增冒险与导演模式 #13

阿里巴巴宣布升级其实时交互模型 HappyOyster {1.0|一点零},新增 Adventure 和 Directing 模式。官方称,该模型现支持更丰富的环境交互与可回溯故事情节。

阿里巴巴宣布升级了实时交互模型 HappyOyster 1.0,引入了 Adventure 和 Directing 两种新模式。官方表示,该增强模型目前提供更丰富的环境交互、扩展的玩家控制以及可回溯的故事情节。这些功能更新将为游戏、互动剧、直播和文化旅游领域带来新的发展机遇。

相关链接:


中国电信6款星辰语音大模型上线模力方舟 #14

中国电信宣布6款星辰语音大模型上线模力方舟平台,向公有云开发者开放API调用,支持中英及60种方言混合识别与5种方言实时合成。

中国电信星辰通用人工智能实验室将6款星辰语音大模型主力模型上线至开源中国旗下模力方舟平台,正式向公有云开发者提供多方言语音服务。此次上线的模型包含2款ASR模型和4款TTS模型,ASR模型采用单一架构支持中英文及60种方言混合识别,TTS模型覆盖非实时、实时及双向流式合成,其中一款支持5种方言实时合成。官方称,该系列模型目前已在真实生产场景中规模化落地,月调用量超4亿次,开发者可通过标准API在模力方舟平台低门槛调用上述能力。

相关链接:


技术与洞察

OpenAI 展示 GPT-5.4 在药物化学中的近自主实验能力 #15

OpenAI 与 Molecule.one 合作,将GPT-5.4连接到名为Maria的Agent,该系统在三个月内独立运行上万次实验,近乎自主地改进了药物化学中的Chan-Lam偶联反应。官方补充,目前该系统尚未具备完全独立运行能力,其泛化效果仍有待独立实验室验证。

OpenAI 与 Molecule.one 合作,将 GPT-5.4 连接到名为 Maria 的化学 Agent 及高通量实验室中,以改进药物化学中的 Chan-Lam 偶联反应。系统在约三个月内独立审查文献、提出假设并运行了 10,080 次实验,发现使用温和氧化剂 TEMPO 可使近 90% 的测试底物产率显著提升。人类化学家在此过程中进行了指导、提案筛选以及手工复现验证。目前该结果仅为早期阶段,系统尚未具备完全端到端的独立运行能力,其能否泛化到其他反应仍有待独立实验室验证。

相关链接:


OpenAI推出生命科学评测基准LifeSciBench #16

OpenAI发布了名为LifeSciBench的基准测试,旨在评估AI系统处理真实世界生命科学研究任务的能力。据官方数据,GPT-Rosalind表现超越了GPT-5.5。

OpenAI发布了名为LifeSciBench的基准测试,旨在评估AI系统处理真实世界生命科学研究任务的能力。该基准由173名科学家参与开发,包含涵盖七个生物研究工作流的750个任务,且多数需要多步推理。官方数据显示,GPT-Rosalind在此基准上的整体通过率提升至36.1%,但处理复杂科学图表的能力仍较薄弱。

相关链接:


Google 开源 Agentic Resource Discovery 规范 #17

Google正式推出并开源了Agentic Resource Discovery开放规范。该规范利用Catalogs目录和Registries搜索引擎,帮助Agent跨平台发现并验证所需的AI工具,兼容MCP与OpenAPI协议。

Google 宣布推出 Agentic Resource Discovery(ARD)开放规范,用于在网络中发布、发现和验证 AI 能力。该架构包含组织域名托管的 Catalogs 和用作搜索引擎的 Registries,支持通过加密信任元数据在连接前验证发布者身份,兼容 MCP 和 OpenAPI 等多种原生协议。ARD 规范基于 Apache 2.0 许可开源,现已可用,并将在未来几个月内获得 Gemini Enterprise Agent Platform 的原生支持。

相关链接:


Cloudflare 发布 The Cloudflare One stack 赋能 Agent 部署 #18

Cloudflare 发布了 The Cloudflare One stack。这是一套 Agent skills 库,旨在为任何 AI Agent 提供规划、部署和管理 Zero Trust 环境所需的知识,并支持从旧安全供应商进行迁移。

Cloudflare 官方宣布推出 The Cloudflare One stack,这是一个允许任何 AI Agent 配置、部署和管理 Zero Trust 环境的技能集合。该堆栈包含 cloudflare-onecloudflare-one-migration 两个轻量级技能文件,涵盖了利用 Cloudflare Access 保护网络与数据安全,以及从 Zscaler 和 Palo Alto Networks 等供应商进行迁移的详细指导。客户和合作伙伴现已可在 Cloudflare Skills 仓库中获取并使用该堆栈;当其与 Cloudflare code mode MCP server 结合使用时,Agent 可获得与 Cloudflare API 交互的类型化接口,从而直接查询账户、检查配置并执行更改。未来,Cloudflare 计划随着产品的演进继续扩展该堆栈,以支持更多迁移来源和高级故障排除工作流。

相关链接:


行业动态

G7峰会商业领袖与各国政要探讨AI断供风险拟设信任伙伴计划 #19

据媒体报道,在近期的G7峰会上,多国政要与 Sam Altman、Dario Amodei、Demis Hassabis等前沿AI领域的商业领袖同台讨论建立“信任伙伴”计划,以保障非美国家获取前沿模型。

据媒体报道,在近期举行的G7峰会上,前沿AI领域的商业领袖与各国政要同台讨论了AI安全与地缘政治问题。参加此次会议的AI企业高管及代表包括Sam Altman、Dario Amodei、Demis Hassabis等人。 多国领导人对美国随时可能切断其AI访问权限表达担忧。此前美国政府以国家安全为由,阻止了Anthropic最新Mythos 5和Fable 5模型的出口。作为应对,G7领导人讨论建立一项“信任伙伴”计划,以允许非美国家在建立更强防御的前提下继续获取这些模型。 同时据媒体报道,Anthropic CEO Amodei 在会上探讨了由美国主导、将中国排除在外的AI技术与芯片出口联盟。

相关链接:


Transformer 作者 Noam Shazeer 宣布加入 OpenAI #20

Transformer 架构奠基论文的共同作者、Gemini 前技术联合负责人 Noam Shazeer 在社交媒体上宣布将离开 Google 加入 OpenAI。

据报道,Transformer 架构奠基论文《Attention Is All You Need》共同作者、Google DeepMind 前研究员兼 Gemini 技术联合负责人 Noam Shazeer 将离开 Google 加入 OpenAI。值得注意的是,Shazeer 曾在 2024 年随 Character.AI 与 Google 的非独家技术授权及人才回流交易重返 Google;该交易据称价值约 27 亿美元。

相关链接:


OpenAI 投资 60 万美元支持 Rust Foundation #21

OpenAI 宣布向 Rust Foundation 承诺 60 万美元,包含 Platinum 会员资格以及对 Rust 生态系统维护者工作的额外支持。

OpenAI 宣布向 Rust Foundation 承诺 60 万美元,其中包括 Platinum 会员资格与对 Rust 生态系统维护者工作的额外支持。Charlie Marsh 表示,Rust 通过 Codex 等项目对 OpenAI 越来越重要,长期社区成员 @predrag 将加入 Rust Foundation 董事会担任 OpenAI 代表。

相关链接:


广东上线试运行全国首个省级政务智能中枢“湾擎” #22

据报道,全国首个省级政务智能中枢“湾擎”上线试运行,并预发布政务版AI Agent湾擎·WorkBuddy。该产品即将在广东省直单位开展试点,后续面向全省公务员开放。

据媒体报道,广东省政务服务和数据管理局打造的全国首个省级政务智能中枢平台“湾擎”上线试运行,同时预发布基于腾讯自研产品打造的政务版AI Agent“湾擎·WorkBuddy”。该Agent定位于可直接交付成果的办公智能体,覆盖公文辅助、材料校核和政策检索等六大场景,依托沙箱隔离技术实现数据不出域。该产品目前即将在广东省直多个单位开展试点,后续将面向广东全省公务员持续铺开。

相关链接:


Odyssey 完成3.1亿美元B轮融资 估值达14.5亿美元 #23

世界模型初创公司Odyssey宣布完成3.1亿美元B轮融资,估值达14.5亿美元。该轮融资由Natural Capital领投,Amazon、AMD等参投。

据媒体报道,世界模型初创公司 Odyssey 官方宣布完成 3.1 亿美元 B 轮融资,估值达到 14.5 亿美元,使其累计融资额升至 3.37 亿美元。该轮由 Natural Capital 领投,Amazon、AMD Ventures、GV 及与 CIA 有关联的 IQT 等机构参投,并吸引了 Google 首席科学家 Jeff Dean 等多位知名个人投资者。Odyssey 专注于开发模拟物理规律和空间关系的“世界模型”,应用场景涵盖游戏开发和机器人等领域。此外,该公司将与 Amazon 深入合作,使用 AWS 作为首选云服务提供商,并将其模型优化以在 Trainium 芯片上运行。

相关链接:


前瞻与传闻

传美国政府暂缓拉黑 DeepSeek,微软探索引入其模型降本 #24

据路透社报道,美政府暂缓将 DeepSeek 等上百家公司列入实体清单。同时,消息称微软正探索使用 DeepSeek 模型,以降低 Copilot Cowork 的推理成本。

据路透社报道,美国政府已暂缓将中国 AI 初创公司 DeepSeek、存储芯片制造商长鑫存储以及上百家被标记为国家安全风险的公司列入实体清单,试图避免加剧与北京的紧张关系。与此同时,据媒体报道,在刚全面上线并转为按使用量计费的 Copilot Cowork 中,微软正在探索使用微调版的 DeepSeek V4 或其他开源模型,以替代成本高昂的 Anthropic 和 OpenAI 模型。

相关链接:


美国政府限制 Anthropic 模型,要求彻底阻断 jailbreak #25

据媒体报道,特朗普政府正限制 Anthropic 重新发布最新模型 Fable 5,要求必须确保其防护措施无法被绕过。安全专家称这在技术上无法实现,而 Anthropic 员工则指责该限制为政治性针对。

据报道,美国政府官员向媒体表示,如果 Anthropic 希望重新发布前沿模型 Fable 5,必须确保该模型的 guardrails 不能被绕过,但安全专家认为这根本无法实现。还有报道称,Anthropic 员工指责特朗普政府的这一限制措施为政治性针对。此事引发了业界对于闭源模型供应链风险及政策不可预测性的担忧。

相关链接:


提示:内容由AI辅助创作,可能存在幻觉错误

AI HOT 补充资讯

模型发布/更新

MolmoMotion:语言引导的3D运动预测模型 #A1

来源:官方 Hugging Face:Blog(RSS)

MolmoMotion基于Molmo 2骨干网络,输入视频帧、物体上的3D点标记及文字动作指令(如“移动并旋转桌上放水果的木碗”),预测未来数秒内这些点的3D轨迹。提供两个变体:自回归的MolmoMotion-AR逐步预测坐标,流匹配的MolmoMotion-FM通过连续空间变换处理多可能性运动。同时发布MolmoMotion-1M数据集(含116万视频的3D点轨迹及动作描述)和PointMotionBench基准测试(2700个人工验证视频片段)。模型权重、数据集和基准测试均已开源。

Grok 4.3 在 Amazon Bedrock 正式可用 #A2

来源:官方 xAI:News(网页)

6 月 17 日,xAI 宣布 Grok 4.3 在 Amazon Bedrock 上全面可用。该模型在前沿模型中达成最低幻觉率,支持 100 万 token 上下文窗口,并提供可配置推理努力(none/low/medium/high)。在 Artificial Analysis Omniscience 基准排名第一,在 Tau2 Telecom 基准评估客服智能体真实工具调用性能排名第一,在 Vals AI Case Law 和 Corporate Finance 基准的复杂文档理解任务排名第一。定价为输入每百万 token 1.25 美元、输出每百万 token 2.50 美元,每美元智能度是其他前沿模型的 2–10 倍。

产品发布/更新

Vercel 发布开源 AI 智能体框架 Eve:每个智能体就是一个文件目录 #A3

来源:综合资讯 MarkTechPost(RSS)

Vercel 发布开源 AI 智能体框架 Eve(npm 包,Apache-2.0 许可)。Eve 采用文件系统优先设计:每个智能体对应一个磁盘目录,目录结构直接映射模型、指令、工具、技能、连接、子智能体等能力,无需额外注册代码。内置六大生产级能力:持久执行(每步检查点,崩溃后可恢复)、沙箱计算、人机审批、安全连接(支持 MCP 和 OpenAPI)、多通道(Slack、Discord、Teams 等)以及追踪与评估(OpenTelemetry)。Vercel 内部运行了上百个智能体,包括数据分析工具 d0(月处理超3万查询)、自动销售代理 Lead Agent(年费约5000美元、回报32倍)和支持智能体 Vertex(自主解决9…

Omnigent开源:AI智能体团队元框架 #A4

来源:X·KOL X:Yuchen Jin (@Yuchenj_UW)

编程的未来不是单一智能体,而是一个完整的AI团队。 Omnigent让你在一个实时会话中运行一个智能体团队:Claude Code、Codex、Cursor、Pi,以及你自己的智能体。 它是一个面向AI智能体的元框架,基于我们内部的Databricks开发工具构建,现已开源给所有人。 由传奇人物@matei_zaharia和Databricks AI团队打造。没错,Matei仍然编写大量代码,包括Omnigent和我们产品的前端代码。

Google发布99美元Gemini智能音箱 #A5

来源:综合资讯 TechCrunch:AI(RSS)

Google推出首款专为Gemini打造的智能音箱Google Home Speaker,售价99.99美元。支持自然语言请求和多步指令,可在说话中途纠正,并具备连续对话功能。内置10种新声音。高级AI功能需订阅Google Home Premium(月费10美元或年费100美元),包括Gemini Live自由对话、Nest摄像头活动摘要等。即日起预售,本月发货。

Wolfram 语言和 Mathematica 15 版发布:内置 AI 助手、符号音乐等新功能 #A6

来源:综合资讯 Hacker News 热门(buzzing.cc 中文翻译)

在 Mathematica 诞生近 38 年后,Wolfram 语言与 Mathematica 发布 Version 15。每个笔记本内置 AI 助手,支持从 AI 环境中直接调用 Wolfram 技术。新增符号音乐系统、大规模时间序列与事件序列处理、分类数据计算、模型拟合超函数 ModelFit。笔记本支持千兆字节级大小与实时查找,首次引入侧边栏、视觉主题及弃用功能样式。强化了表格连接、多点可视化、图形刻度绘制与轨道运行计算等功能。DSolve 拐角处获得 AI 方法辅助,支持偏微分方程曲线坐标求解。扩充了矩阵分解、多元 zeta 函数与调和数、流线型部分分式分解。强化了 WebSocket 实时连接、Python 交互改进,支持…

阿里云发布HappyOyster 1.0:一句话生成可实时交互的数字世界 #A7

来源:综合资讯 IT之家(RSS)

6月17日,阿里云发布开放式世界模型HappyOyster 1.0(快乐生蚝)。该产品基于原生多模态架构,支持多模态输入与音视频联合生成,可在生成过程中持续接收用户指令并实时响应画面。它深度学习物理世界状态转移规律,保持人物和环境长程一致性。官网开放“实时导演”与“世界探索”两种玩法:前者可随时叫停改写故事、与虚拟男友实时互动等;后者支持自由漫游、滑板冲刺、翼装滑翔、骑马奔驰、攻击打怪等交互。该产品已于今年4月16日开放内测,即日起至7月17日官网不定期掉落体验积分。

行业动态

Anthropic与DeepMind CEO呼吁G7组建AI联盟排除中国 #A8

来源:X·KOL X:Kim (@kimmonismus)

Dario Amodei(Anthropic)与Demis Hassabis(Google DeepMind)在G7闭门会议上呼吁组建美国主导的联盟,为人工智能制定全球规则和标准。Amodei指出,该联盟应以前沿模型和硬件(包括芯片及其他关键组件)的访问权限为手段,将中国排除在外。这一主张被评论为高技术新冷战的开端,竞争方将从根本上被剥夺参与权。

泄露文件显示OpenAI年营收130亿但亏损远超收入 #A9

来源:综合资讯 Hacker News 热门(buzzing.cc 中文翻译)

OpenAI 2025年营收130.7亿美元(2024年37亿),但研发成本达191.8亿(含向微软支付105.9亿),收入成本(推理计算)75亿,销售营销成本57.3亿,运营亏损209.2亿。2025年净亏损约390亿,扣除约300亿一次性会计费用后约80亿。2025年3月获1220亿融资(估值8520亿)。ChatGPT周活超9亿,付费约5000万。为控制成本已关闭Sora视频模型并削减非核心业务。

消息称 OpenAI 今年一季度现金消耗达 37 亿美元,超同期收入的一半 #A10

来源:综合资讯 IT之家(RSS)

OpenAI 在 2026 年第一季度现金消耗达 37 亿美元,超过同期 57 亿美元收入的一半。数据来自一份向股东披露的文件,直观体现 AI 大模型研发与规模化落地的巨额成本。OpenAI 正筹备上市,已在美国保密递交 IPO 申请,最早或于 9 月完成,估值最高可达 1 万亿美元。头部 AI 企业持续重金投入算力、模型研发与人才招募以维持竞争优势。

中国加紧筹建世界人工智能合作组织 #A11

来源:综合资讯 IT之家(RSS)

中国正加紧筹建世界人工智能合作组织,欢迎各方加入。2025年7月26日,中国政府倡议成立该组织,作为践行多边主义、推动共商共建共享全球治理的举措,旨在弥合数字和智能鸿沟、促进人工智能向善普惠发展。初步考虑总部设在上海。同日,2025世界人工智能大会发表《人工智能全球治理行动计划》,呼吁各方遵循向善为民、尊重主权、发展导向、安全可控、公平普惠、开放合作的原则,协力推进全球人工智能发展与治理。

谷歌发布Agentic Resource Discovery(ARD)开放规范 #A12

来源:官方 Google Developers Blog(RSS)

Agentic Resource Discovery(ARD)是一项开放规范,用于在Web上发布、发现和验证AI工具、技能与智能体。它基于两个原语:组织在其自有域名下托管catalog描述可用能力,registry作为搜索引擎索引catalog并响应发现请求。ARD支持加密验证,使客户端与端点连接前确认发布者身份,然后直接通过原生协议调用能力。Google Cloud的Gemini Enterprise Agent Platform通过Agent Registry提供企业级支持,包括URN命名、出站策略、工具固定和基于Agent Identity的信任验证。该规范现已发布,开发者可通过托管 ai-catalog.json 文件使其服…

论文研究

NVIDIA GEAR实验室发布ENPIRE:8个Codex智能体自主控制机器人完成物理实验 #A13

来源:X·KOL X:Jim Fan (@DrJimFan)

NVIDIA GEAR实验室推出ENPIRE系统,首次实现物理世界自主研究。系统让8个Codex智能体控制8台机器人,配备GPU和token预算。安全方面采用硬运动极限切断和扭矩受限夹爪两层硬件保障,支持通宵无人运行。奖励函数通过视觉分类器离线固定并冻结,防止智能体作弊。实时监测机器人利用率(MRU)、token利用率(MTU)和GPU利用率,以Tokens-to-Success和Time-to-Success评估效率。ENPIRE自主完成扎带、整理细针、安装GPU等高精度任务,发现8机器人并行探索显著更快。系统将开源。

用SGLang-JAX在TPU上优化Ling-2.6-1T:一个Pallas核将MoE数据移动隐藏在计算中 #A14

来源:学术机构 LMSYS:Blog(Chatbot Arena 团队)

SGLang-JAX现已支持inclusionAI的Ling-2.6-1T(1T稀疏MoE,63B激活参数,256路由专家,top-8路由加共享专家)在TPU v7x上高效推理。团队开发了Fused MoE V2——一个融合scatter、专家FFN和gather的Pallas核,通过将MoE数据移动隐藏在计算中,使MoE预填充延迟从5.16ms降至2.42ms(降幅53%),解码核延迟从0.249ms降至0.211ms(降幅约15%)。仅替换MoE核即提升预填充吞吐量24.8%,解码吞吐量18.5%–35.3%。在SGLang解码基准测试中,16块TPU v7x芯片输出吞吐量达16块H200 GPU的1.29倍(mc=128)至1…

LifeSciBench 发布 #A15

来源:官方 OpenAI:官网动态(RSS · 排除企业/客户案例)

2026 年 6 月,OpenAI 联合 173 位博士级生命科学家发布 LifeSciBench 评测基准,涵盖 750 个真实研究任务,覆盖证据处理、分析、设计优化等七个工作流及七个生物领域。每项任务配有约 25 条细化评分标准(共 19,020 条),评估模型的科学正确性与实用价值。79% 的任务需多步推理,53% 要求解读图表、PDF 等附件数据,旨在衡量 AI 在复杂、不确定的研究任务中的实际能力,而非仅回答结构化问题。

Google 医学推理 AI 系统 AMIE 新研究:从诊断迈向长期疾病管理 #A16

来源:官方 Google Blog:AI(RSS)

今日发表在《自然》杂志上的研究展示了 Google 的医学推理 AI 系统 AMIE(Articulate Medical Intelligence Explorer)从单次诊断对话演进到长期疾病管理的能力。AMIE 利用 Gemini 模型的长上下文能力,整合共情对话智能体和深度思考管理推理智能体,可交叉引用数百页临床指南。在盲测中,AMIE 与 21 名初级保健医生相比,在整体管理推理上匹配临床医生,在计划精确性和指南一致性上得分显著更高。

OpenAI 与 Molecule.one 合作:GPT‑5.4 自主优化 Chan‑Lam 偶联反应 #A17

来源:官方 OpenAI:官网动态(RSS · 排除企业/客户案例)

OpenAI 将 GPT‑5.4 接入 Molecule.one 的自主化学智能体 Maria,用于优化药物化学中的 Chan‑Lam 偶联反应。GPT‑5.4 独立识别伯磺酰胺为高价值挑战性底物,并建议使用 TEMPO 等温和氧化剂。经两轮实验,88% 的硼酸和 83% 的磺酰胺底物产率提升,平均产率从 16.6% 升至 25.2%,产率超 30% 的反应占比从 15.6% 增至 37.5%。人类化学家后续验证,14 对底物中 11 对产率提高,多数提升超两倍。

技巧与观点

Matt Pocock 开源 skills v1:将技能描述 Token 成本降低 63% #A18

来源:X·KOL X:阿易 AI Notes (@AYi_AInotes)

Matt Pocock(Total TypeScript 作者)开源了 skills v1,将技能描述的 Token 成本降低 63%。该工具包将技能分为模型可调用和用户可调用,新增 /codebase-design、/domain-modeling、/grilling 三项技能;重写 /writing-great-skills;将 /diagnose 更新为 /diagnosing-bugs 并改为模型可调用;新增 /ask-matt 路由技能,帮助 AI 自动判断时机触发合适工程流程。主推文评价其将 prompt 从咒语拆解为纪律性流程。

baoyu-design 本地动画视频导出功能更新 #A19

来源:X·KOL X:宝玉 (@dotey)

baoyu-design(本地运行 Claude Design 的 Skill)新增动画视频导出功能。其声明式动画引擎基于 f(t) 设计:任意时间点 t 可绝对确定画面状态。导出采用无头 Chromium 逐帧截图 + ffmpeg 编码,每帧等待两帧 requestAnimationFrame 确保渲染完成。截图以 2 倍 DPR(3840×2160)再缩回 1080p,保证细节清晰。95 秒 30fps 动画需 2850 次截图循环,帧帧精确。项目已开源(MIT),获 1.2K star。此前 baoyu-design 已支持 PPT 本地生成和导出可编辑 PPTX。

Google 分享 A2UI 与 MCP Apps 三种集成架构模式 #A20

来源:官方 Google Developers Blog(RSS)

Google 分享了三种集成 A2UI 与 MCP Apps 的架构模式,旨在结合两者优势。A2UI 采用声明式框架,通过 JSON payload 定义 UI,由宿主原生渲染,确保一致性与安全性,但受限于预定义组件库。MCP Apps 在 iframe 中使用标准 Web 技术提供自定义界面,但存在设计碎片化、性能与安全挑战。三种模式包括:通过 MCP 服务器提供 A2UI,利用 MCP Resources 或 Tool 调用传递 JSON,实现“一次编写,原生渲染”的跨平台能力;以及静态与动态交付方案。Google 正考虑扩展 MCP 以原生支持 A2UI。

预训练还不够“苦涩” #A21

来源:学术机构 CMU:Machine Learning Blog

Richard Sutton的“苦涩教训”通常被解读为警告不要在AI系统中编码过多人类知识,最终胜出的方法是能吸收更多算力和数据的一般性方法。现代基础模型预训练表面上是这一教训的胜利:采用通用架构、海量数据、简单的自监督目标(语言模型预测下一个token,视觉模型重建掩码块等)。但问题在于,训练目标仍由人类在训练循环外选定——完成一次大规模预训练后评估下游表现,再调整方案重新运行。这个控制环路非常粗糙。该论文探讨能否让这一环路变得更高效。

博客现状,2026年中 #A22

来源:大咖博客 Nathan Lambert:Interconnects(RSS)

Nathan Lambert 在 Interconnects 博客创办约三年后更新规划。他当前三大目标:为前沿模型演进提供清晰度、创建开放模型生态、建立支撑机构。博客定位为原始、高辨识度的独立声音,避免成为全职分析平台。已披露与 Arcee AI 和 Mercor 签署咨询协议,以深入后训练领域并推动透明评测与开放生态。订阅者突破 7 万,付费约 900 人;运营实体 Interconnects AI, LLC 已成立,但银行账户数月余额接近零,收入再投入业务,近期不打算全职运营。


提示:内容由 AI 辅助整理,可能存在错误,请以原始出处和官方信息为准。