AI 早报 2026-10-07

本页合并来源:Juya AI 早报 + AI HOT 日报。Juya 保留完整精选,AI HOT 作为补充来源;已按链接和标题做基础去重。

概览

Juya · 要闻

  • Mistral Large 4 上线,月底开放权重 ↗ #1
  • Google 发布 Nano Banana 2.1,图像生成与编辑全面升级 ↗ #2
  • 谷歌开源 EmbeddingGemma 2 多模态嵌入模型 ↗ #3
  • OpenAI 公开内部前沿模型的一批数学研究成果 ↗ #4

Juya · 开发生态

  • OpenAI 免费开放 Auto-review,不占订阅额度 ↗ #5
  • OpenAI 向所有开发者开放 Decisions API 公测 ↗ #6
  • OpenAI 将 API 付费层级从五档精简为三档 ↗ #7
  • Space Bunny 免费期将结束,OpenCode 赞助再免费几天 ↗ #8
  • Anthropic扩展CVP:三档开放高级网络能力 ↗ #9

Juya · 模型发布

  • 复旦腾讯浙大开源 Prism,原生 2K 音视频联合生成 ↗ #10
  • 亚马逊 AGI 团队开源发布 ALoDLM-8B ↗ #11
  • Perplexity 发布决策模型 pplx-decider 新版本 ↗ #12
  • EmpirioLabs发布决策模型Aplomb 1 ↗ #13

Juya · 产品应用

  • OpenAI dots 团队称上线一周推出一批改进 ↗ #14
  • ChatGPT 推出 Meetings 插件,自动记录会议笔记 ↗ #15
  • Claude 网页与桌面端悄然上线简繁中文界面 ↗ #16
  • Claude 上线 Google Workspace 插件 ↗ #17
  • 谷歌 Docs 与云盘原生支持 .md 文件,可实时编辑评论 ↗ #18
  • ElevenLabs 发布对话式 Agent 专家 Architect ↗ #19

Juya · 技术与洞察

  • Claude Code 云端会话实战指南发布 ↗ #20
  • Sierra 联合 Meta、Stripe 和沃尔玛等开发个人 Agent 开放标准 ↗ #21
  • OpenAI 联手 Ironclad 用合同工作流训练 AI agent ↗ #22
  • GitHub 重建 Git 基础设施,面向 Agent 开发 ↗ #23
  • SemiAnalysis 实测:Anthropic 订阅价值约为 OpenAI 五倍 ↗ #24
  • a16z 消费 AI 百强榜首次新增支出排名 ↗ #25
  • Nous Research 发布 Hermes Index 智能体模型榜 ↗ #26
  • 世卫非洲团队借 Google Earth AI 快速锁定埃博拉暴露区 ↗ #27
  • Opus 5.5 Agent 三天找出两种室温磁性半导体 ↗ #28

Juya · 行业动态

  • 五角大楼确认停用 Anthropic 全部产品 ↗ #29
  • Anthropic 扩大 Claude Startups 计划 ↗ #30

Juya · 前瞻与传闻

  • OpenAI 计划合并 Chat 与 Work 开关 ↗ #31

AI HOT 补充

  • Mistral Large 4 进入 Code Arena: WebDev 排名第45,得分1534 ↗ #A1

Juya 早报精选

要闻

Mistral Large 4 上线,月底开放权重 #1

Mistral AI 发布旗舰模型 Mistral Large 4 的公开预览版,官方昵称 Le Chonk,目前已通过 API 向所有用户开放。这是一款原生多模态的混合专家模型,总参数约 一万亿,每个 token 激活 四百九十亿。官方称它在网络安全等关键负载上处于开源权重模型前沿,模型权重计划 十月底 开放。

Mistral AI 发布 Mistral Large 4 公开预览版,昵称 Le Chonk,即日起通过 API 向所有用户开放,开源权重计划本月底放出,Hugging Face 页面显示预计 10 月 31 日上线。

模型为原生多模态的细粒度 MoE 架构,总参数 1.05T,每个 token 激活 49B 参数,含嵌入和输出层为 52B,官方称原生支持 160 多种语言。

官方评测中,它在 Artificial Analysis Cyber Index 位列全球前五,漏洞复现与修复测试得分 82% 为所有模型最高;在与 Surge AI 合作的编码盲测中以 3.74 分排名第二,仅次于 Claude Opus 5。官方称其在视觉定位上超过 GPT-6-Astra,vals.ai 的法律与金融任务评测也均领先。

安全方面,模型在 Lakera 公开测试中抵御 93.3% 的攻击。该模型在欧洲端到端训练,可通过 Mistral Cloud 从欧洲部署,OpenCode 已上线该模型并在两周内半价。

相关链接:


Google 发布 Nano Banana 2.1,图像生成与编辑全面升级 #2

Google 发布图像生成与对话式编辑模型 Nano Banana 2.1,已在 Gemini API 正式可用,并陆续推送到 Gemini 应用、搜索 AI Mode、AI Studio 和 Google Ads 等产品。官方称新模型在视觉设计、蒙版编辑和主体一致性上超过上一代,输出分辨率最高 4K。第三方 Arena 榜单显示,该模型在文生图、图像编辑和多图编辑榜分别排在第五、第六和第四。

Google 发布图像生成与对话式编辑模型 Nano Banana 2.1,模型代码 gemini-nano-banana-2.1,已在 Gemini API 正式可用,并陆续推送到 Gemini 应用、搜索 AI Mode、Google AI Studio、Flow等产品。该模型是 Nano Banana 2 的升级版,官方称在视觉质量、提示词遵循、多轮角色一致性和文本渲染上显著改进,输出覆盖 1K、2K、4K 三档分辨率,并修复了超宽画幅在 2K 和 4K 下的拼接瑕疵。

新模型支持最多 14 张参考图的多图融合、Google 搜索 grounding 以及可配置的 Thinking 档位。Google 员工 Logan Kilpatrick 表示,这一版本图像质量更高、修复了大量旧模型 bug,价格也更低。第三方 Arena 榜单显示,该模型在多图编辑、文生图和图像编辑榜分别列第四、第五和第六,较 Nano Banana 2 提升 38 至 80 分。

相关链接:


谷歌开源 EmbeddingGemma 2 多模态嵌入模型 #3

谷歌发布了 EmbeddingGemma 2,这是一款面向设备端场景优化的轻量级多模态嵌入模型,可将文本、代码、图像、视频和音频映射到统一嵌入空间;模型采用740M参数模块化编码器,并支持灵活的向量维度。权重已开放下载,采用 Apache 2.0 许可。

谷歌 DeepMind 发布开源嵌入模型 EmbeddingGemma 2,将上一代的纯文本能力扩展为原生多模态,把文本、代码、图像、视频和音频统一映射到 768 维向量空间。

模型基于 Gemma 4 架构,总参数量 7.4 亿,采用模块化设计:纯文本任务只需 2.7 亿参数,视觉编码器 1.7 亿、音频编码器 3 亿可选加载。上下文窗口 8192 token,为上一代的 4 倍,单次可处理约 5.5 分钟音频或 29 张图像。

官方评测中,MTEB Code 得分从 68.76 提升至 78.68,多语言文本性能保持前代水平,并称其在子 10 亿参数多模态嵌入模型中取得领先分数。

量化后在谷歌 Pixel 11 Pro 上纯文本权重约占 191MB 运行内存,完整多模态约 567MB;借助 MRL 截断,向量存储最高可缩减 6 倍。

模型以 Apache 2.0 许可发布,权重现已在 Hugging Face 和 Kaggle 开放下载。

相关链接:


OpenAI 公开内部前沿模型的一批数学研究成果 #4

OpenAI 公开了一批由内部前沿模型产出的新数学成果,722 份手稿连同部分证明的 Lean 形式化一起发布在 GitHub 仓库。OpenAI 称模型在评测中被提出了约四千个开放研究问题,平均每个成果耗约三小时的 ChatGPT Pro 思考算力。这批成果处于不同验证阶段,未形式化的部分可能存在问题。

OpenAI 发布一批由内部前沿模型产出的新数学成果,722 份手稿按 372 个成果族整理后公开在 GitHub 仓库,并附论文修订与引用协议。

发布方式参考了高等研究院数学与人工智能独立咨询小组的建议和公开推荐。仓库公开了许多证明的 Lean 形式化、10 份模型推理摘要,以及尝试问题数量等统计,形式化将随取得继续补充。

OpenAI 称绝大多数成果由同一未发布的内部模型以固定流程取得,模型在评测中被提出约 4000 个问题,平均每个成果约耗 3 小时 ChatGPT Pro 思考算力。

这批成果处于不同验证阶段,未形式化的成果可能存在问题。OpenAI 还计划资助围绕理解 AI 重大成果的研讨会等活动,并表示正努力负责任地发布产出这些成果的模型。

相关链接:


开发生态

OpenAI 免费开放 Auto-review,不占订阅额度 #5

Codex 负责人 Tibo 宣布,Auto-review 功能现在对所有通过 ChatGPT 账号登录的用户免费开放,而且不消耗订阅方案的额度。这个功能会让第二个 agent 审查主 agent 在长任务中的每一项操作,拦截高风险和偏离用户意图的动作。

OpenAI 负责 Codex 与 ChatGPT 的 Tibo 宣布,Auto-review 现在对所有通过 ChatGPT 账号登录的用户免费开放,且不消耗订阅方案的用量,可在设置 → 权限 → auto-review 中开启。

该功能让用户在运行长任务时,由第二个 agent 审查主 agent 的全部操作,以阻止高风险动作、防范偏离用户原始意图的操作。

Tibo 称它改进了默认沙箱设置,后者要求逐项批准所有操作,容易造成决策疲劳,除非花时间配置具体规则。他还建议用 Auto-review 替代 full-access 权限,称这已不再是取舍。

相关链接:


OpenAI 向所有开发者开放 Decisions API 公测 #6

OpenAI 宣布 Decisions API 向所有开发者开放公开测试,可让应用在近实时条件下选择合适的模型、工具或动作。这个接口由 GPT-6 Luna 驱动,支持文本和图像输入。

OpenAI 宣布 Decisions API 进入公开测试,向所有开发者开放,用于让应用在近实时条件下选择合适的模型、工具或动作。该接口由 GPT-6 Luna 驱动,接受文本和图像输入,支持三类输出:Predicates 估算陈述为真的概率,Choices 从预定义选项中选择并给出置信度,Scores 按数值区间评估输入。

OpenAI 称其决策速度比通过 Responses API 调用 GPT-6 Luna 最快快 10 倍。输入 token 按每 100 万个 0.1 美元计费,且只收输入费用,没有缓存和输出 token 收费。

官方列举的用途包括把请求路由到合适的模型、工具或 Agent,为大规模输入生成标签和评分,分析图像或从截图中决定动作,以及标记高风险工具调用。

相关链接:


OpenAI 将 API 付费层级从五档精简为三档 #7

OpenAI 把 API 付费用量层级从五档合并为 Build、Launch 和 Grow 三档,新最高档 Grow 只需累计 500 美元 API 付款即可获得资格。已在付费层级上的组织会自动迁移到对应的新层级。

OpenAI 宣布降低获取更高 API 速率限制的门槛,五个付费用量层级合并为 Build、Launch 和 Grow 三档。新的最高层级 Grow 只需累计 500 美元 API 付款即可获得资格,此前最高层级的要求是 1000 美元。已在付费层级上的组织会自动迁移到对应的新层级,无需手动操作。各层级的资格条件与速率限制详情发布在 OpenAI 平台的组织限制设置页。

相关链接:


Space Bunny 免费期将结束,OpenCode 赞助再免费几天 #8

Space Bunny 模型的免费期即将结束,开源编程 Agent OpenCode 表示,将在自家免费档位中赞助这款模型,让它再免费提供几天。OpenCode 同时透露,这款模型正在调优,正式亮相之前还会继续调整。

Space Bunny 模型的免费期即将结束。开源编程 Agent OpenCode 在 X 上宣布,将在自家免费档位中赞助 Space Bunny,让它再免费提供几天。OpenCode 同时透露,这款模型正在调优,正式亮相之前还会继续调整。

相关链接:


Anthropic扩展CVP:三档开放高级网络能力 #9

Anthropic 宣布把 Project Glasswing 和原有的 CVP 整合为扩展版的网络安全验证计划,按防御、红队、专项三个档位向通过审核的安全从业者开放,各档都能使用 Claude Opus 5.5、Sonnet 5.5 和 Mythos 5.1 等模型。红队档仅限组织申请,专项档需由 Anthropic 与美国政府共同深度审核。

Anthropic 发布扩展版 Cyber Verification Program(CVP),把此前并行运行的 Project Glasswing 与 CVP 整合为一个项目,向通过审核的安全从业者分三档开放,各档均可用 Claude Opus 5.5、Claude Sonnet 5.5、Claude Mythos 5.1 及后续新模型。

Defense Access 面向安全运营、事件响应、恶意软件逆向等防御工作,企业、关键基础设施运营方、开源维护者和有漏洞报告记录的个人研究者可申请,官方称目标几天内回复。

Red Team Access 增加授权渗透测试和红队演练,仅限组织申请,仍实时拦截部署勒索软件、破坏物理系统等可能造成人身伤害或大规模破坏的行为,审核需数周。

Specialized Access 拦截最少,留给获准测试飞行操作系统、电网、银行间转账基础设施等系统、并经与美国政府共同深度审核的少数组织,现有 Glasswing 成员可直接过渡。加入计划的组织需接受数据留存以监测滥用。

相关链接:


模型发布

复旦腾讯浙大开源 Prism,原生 2K 音视频联合生成 #10

复旦大学、腾讯混元和浙江大学团队开源了音视频联合生成框架 Prism,可以在 720p、1080p 到 2K 的分辨率下原生生成并训练带声音的视频。

复旦大学、腾讯混元与浙江大学团队开源了 Prism,一个用于原生 2K 音视频联合生成的动态稀疏注意力框架,技术报告、训练与推理代码和预览权重同步放出,许可证为 MIT。

预览模型支持 720p、1080p 和 2K 分辨率下的原生音视频联合生成与训练,文生视频和图生视频均可,提示词支持 music、sfx、speech 标签以分别控制配乐、音效和台词。

官方实验显示,Prism 较全注意力训练提速 2.5 倍,生成质量也超过后者。权重包含偏稳定的 preview-alpha 和偏运动的 preview-beta 两版,基于 MOVA-360p 底座,Prism-pro 尚未发布。

算力上,720p 推理只需单张 80GB 显存 GPU,1080p 和 2K 推理需要 4 张以上,2K 原生训练至少需要 64 张。

相关链接:


亚马逊 AGI 团队开源发布 ALoDLM-8B #11

亚马逊 AGI 团队发布扩散语言模型 ALoDLM,同时公开了 17 亿和 80 亿参数两档权重以及训练推理代码。这种模型在并行生成的同时按难度分配计算,有把握的 token 提前确定并作为上下文,较难的 token 最多循环精炼 四轮。

亚马逊 AGI 团队发布扩散语言模型 ALoDLM,在 Hugging Face 公开 ALoDLM-1.7B 与 ALoDLM-8B 权重,并在 GitHub 开源训练与推理代码。

模型由 Qwen3-1.7B 和 Qwen3-8B 直接 SFT 训练而来,核心改动是在每个去噪步内按 token 难度分配计算:置信度足够的 token 提前提交并作为上下文,其余 token 保留潜在状态继续精炼,最多循环 4 轮。

论文评测显示,11 项基准的平均分在两个规模分别为 65.5 和 80.3,均超过对应的 Qwen3 自回归基线(63.8 和 78.5),也高于全部参评扩散模型。

ALoDLM-8B 在 GSM8K 上的吞吐约为 vLLM 部署的 Qwen3-8B 的 2.7 倍,准确率相当或更高。

权重采用 CC BY-NC 4.0 协议,面向非商业研究;官方提示其首 token 延迟可能高于自回归模型,推理速度随输入变化。

相关链接:


Perplexity 发布决策模型 pplx-decider 新版本 #12

Perplexity 发布更新的开放权重多模态决策模型 pplx-decider 新版本,官方称它在新版 Hugging Face Decision Index 基准上得分最高。Decision API 价格同时降为此前一半。

Perplexity 宣布,更新的开放权重多模态决策模型 pplx-decider-v1.1-27b 现已可用,官方称其在新版 Hugging Face Decision Index 0.3 基准上得分最高,Decision API 定价降为 v1 的一半,每百万输入 token 收 0.02 美元。

模型卡显示其 Decision Index 总分从 v1 的 56.4 升至 61.56,领先 Jev 逾 3.5 分,骨干仍基于 Qwen3.8-27B,26B 参数、BF16 精度。

官方称提升主要来自解除因果掩码以及在更多数据上训练,其中包括 tasksource 数据。

相关链接:


EmpirioLabs发布决策模型Aplomb 1 #13

EmpirioLabs 发布了旗下第一个模型 Aplomb 1,这是一款决策模型,支持把文本、图像、视频和音频放进同一个请求。模型已上线 API,权重开放在 Hugging Face。

EmpirioLabs 发布模型 Aplomb 1,这是一款决策模型:对是非、2 至 255 个选项的选择、2 到 10 级打分和工具调用四类问题返回校准概率,而不生成文本。它支持文本、JSON、图像、视频和音频混合输入,状态加问题最长 100 万 token,单次请求最多 128 个相互独立的问题,还能按问题返回输入中不含答案的概率。

模型基于 Qwen3.5-4B,参数量 53 亿,已上线 EmpirioLabs API 和 Playground,权重按 EmpirioLabs Model License 开放在 Hugging Face。

相关链接:


产品应用

OpenAI dots 团队称上线一周推出一批改进 #14

OpenAI 的 dots 产品上线满一周,官方称已根据用户反馈推出一批改进,包括更快的云端浏览和侧栏加载、等待回复时更少的停顿,并修复了浏览器字符渲染、Outlook 配置卡住以及审批按钮显示等多项问题。他还预告,接下来会持续提升语音可靠性,扩大 dot 对 Codex 应用的控制能力,并支持把 dot 连接到多台电脑。

OpenAI dots 项目成员 Rohan Varma 发帖称,dots 上线一周以来,团队根据用户反馈推出了一批改进。

性能方面包括更快的云端浏览、等待回复时更少的停顿、更快的侧栏加载和更流畅的动画。

修复项涵盖使用 ChatGPT 时手机端的多余通知、Safari 和 Firefox 的字符渲染、Outlook 配置卡住、审批按钮被裁切和过大的 Gmail 预览遮挡审批,以及 Web 端和启动语音时的企业访问问题。

团队还让 Web 端安全横幅更稳定,提供更清晰的计划指引,并为活动加载失败增加了重试方式。

接下来的计划包括持续提升语音可靠性、扩大 dot 对 Codex 应用的控制,以及支持 dot 连接多台电脑、改进 Windows 上的本地电脑控制支持。

相关链接:


ChatGPT 推出 Meetings 插件,自动记录会议笔记 #15

ChatGPT 上线测试版 Meetings 插件,能在会议中自动记笔记,并根据它与用户既往协作的内容生成个性化摘要和后续步骤,保存到 ChatGPT Space。

ChatGPT 推出测试版 Meetings 插件,在会议中为用户记录笔记,并根据 ChatGPT 对用户本人及既往协作内容的了解,生成个性化摘要和后续步骤,保存到 ChatGPT Space。

笔记可以保持私密,也可以分享给团队,之后还能让 ChatGPT 更新项目计划或起草跟进内容。

该功能目前面向 Pro 和 Business 用户,需在 macOS 版 ChatGPT 桌面应用中使用,官方称 Enterprise 版即将支持。

使用时先下载桌面应用,再在插件目录中搜索 Meetings 安装。

相关链接:


Claude 网页与桌面端悄然上线简繁中文界面 #16

Anthropic 的 Claude 网页版和桌面客户端日前悄然上线了简体中文和繁体中文界面,用户在设置里即可切换。另有用户发现 Claude 的订阅升级页面显示支持银联国际的银行卡,有用户尝试支付但订单被拒绝。

多名用户发现,Anthropic 的 Claude 网页版与桌面客户端新增了简体中文与繁体中文界面,网页和客户端都可以在设置中手动切换,有用户的界面还自动变成了中文。

差不多同一时间,另有用户发现 Claude 网页版升级订阅时在部分地区可以选择中国地址,页面显示支持银联国际卡,有用户尝试支付但订单被拒绝。

相关链接:


Claude 上线 Google Workspace 插件 #17

Anthropic推出Claude for Google Workspace插件公开测试版,仅面向付费用户,Claude能在Google Docs、Sheets、Slides中直接编辑,同步推出的配套连接器还能在Claude对话中创建相关文件。

Anthropic 推出 Claude for Google Workspace,以公开测试版登陆所有付费订阅方案。

装上插件后,Claude 在 Google 文档、表格、幻灯片旁的侧边栏中读取当前文件和选中内容并直接编辑,默认每次修改需用户批准,也可切换为自动应用。

它可以在文档中就地改写、以建议卡片提交大改,在表格中写公式、建数据透视表和原生图表,在幻灯片中按现有版式生成新页。

同批推出的 Google Docs、Sheets、Slides 连接器测试版支持在 Claude 对话中创建和编辑 Google 文件,文件在对话旁打开,权限沿用谷歌共享设置。

企业方案中的 Compliance API、CMEK 和审计导出同样适用于该插件。

相关链接:


谷歌 Docs 与云盘原生支持 .md 文件,可实时编辑评论 #18

谷歌为 Google Docs 和 Google Drive 引入 Markdown 原生支持,点开 .md 文件就能看到渲染好的链接和表格,还能实时编辑和评论。

谷歌为 Google Docs 和 Google Drive 应用加入 Markdown 文档格式原生支持,可直接打开、编辑和使用 .md 文件。

点开文档即可看到渲染完成的 Markdown,包含可点击链接和结构化表格,支持实时编辑和评论。

谷歌表示,该功能可让 AI 智能体协作编辑文档,并可与 Gemini Notebook 同步;谷歌员工 Chandu Thota 称 Markdown 已成为人类与 AI 智能体之间的通用语言。

该功能自 10 月 5 日起开始推送,部分用户可能需等待最多 15 天。

相关链接:


ElevenLabs 发布对话式 Agent 专家 Architect #19

ElevenLabs 发布 ElevenAgents Architect,一个内置在 ElevenAgents 中的专家功能,通过语音或文字对话就能创建和改进 AI Agent。

ElevenLabs 发布 ElevenAgents Architect,这是内置在 ElevenAgents 中的专家功能,通过语音或文字对话即可创建和改进 AI Agent。它了解 ElevenAgents 的全部配置选项,掌握知识库、prompt、工作流、语音设置、procedures、guardrails、工具和模拟测试方面的最佳实践,可以分析对话记录、找出问题根因并提出修改。它还能在数千段对话中推理,寻找团队容易遗漏的改进机会,返回的每项提案都已构建完成并在模拟测试中验证。除在 ElevenAgents 内使用外,它还能从 Claude、Claude Code、ChatGPT、Cursor 和 Grok Bot 调用,并带入 Agent 的完整上下文。该功能目前以 Alpha 版开放。

相关链接:


技术与洞察

Claude Code 云端会话实战指南发布 #20

ClaudeDevs 发布了 Cloud sessions 功能(云端运行 Claude Code)实战指南,介绍七种适合云端会话的工作流和首次成功连接 GitHub 的方法。

Anthropic 开发者账号 ClaudeDevs 发布 Cloud sessions 实战指南,涵盖七种适合云端会话的工作流和首次成功连接 GitHub 的方法。Cloud sessions 在 Anthropic 的基础设施上运行 Claude Code,每个任务使用一个全新的 VM,可同时启动多个任务,关闭笔记本后继续执行,并已包含在 Pro 和 Max 订阅方案中,支持网页、桌面端、CLI 和移动端。

官方同时提醒,9 月 23 日活动开始时持有有效订阅的个人 Pro 和 Max 用户,可在 10 月 7 日 11:59pm PT 前领取一次性奖励额度,Pro 为 100 美元,Max 为 250 美元,额度 11 月 4 日过期。云端会话优先消耗该额度且不计入方案用量限制。

相关链接:


Sierra 联合 Meta、Stripe 和沃尔玛等开发个人 Agent 开放标准 #21

Sierra 与 Meta 联合 Shopify、Stripe、沃尔玛等公司宣布开发开放标准 Personal Agent Protocol,为个人 Agent 与企业的交互定义统一方式。协议让消费者决定授予个人 Agent 哪些权限,企业自行设定 Agent 能做什么。首版 v0.1 规范计划本月晚些时候公布。

Sierra 与 Meta 宣布正在联合 Genesys、Instinct、Rocket、Shopify、Stripe 和沃尔玛开发开放标准 Personal Agent Protocol,定义个人 Agent 与企业交互的方式,对任何人开放实现。

该协议用于处理身份验证、让消费者掌控权限,并让企业了解个人 Agent 通过其网站、API 或企业自有 Agent 所做的操作。原则上,消费者决定授予个人 Agent 什么访问权限,企业设定这些 Agent 能做什么。

Sierra 计划本月晚些时候发布 v0.1 规范、举办设计工作坊并公布参考实现,更细粒度权限、推送通知和支付扩展是协议未来可能支持的方向。

相关链接:


OpenAI 联手 Ironclad 用合同工作流训练 AI agent #22

OpenAI 宣布与合同管理软件公司 Ironclad 合作,把复杂合同工作流变成 AI agent 的训练和评测任务。GPT-6 Astra 是首个在这些任务上训练的前沿模型。

OpenAI 宣布与合同管理软件公司 Ironclad 开展研究合作,把复杂合同工作流转化为 AI agent 的训练和评测任务,以提升模型使用专业软件解决复杂业务问题的能力,Ironclad 是首个合作伙伴。

双方确定了 11 项覆盖法律、商务和采购的任务,例如设置保密协议和创建采购审批流程,估计有经验的用户平均每项需 30 到 40 分钟,每项按 8 到 50 条标准评估。

GPT-6 Astra 是首个在这些任务上训练的前沿模型,官方研究评测中其平均得分比 GPT-5.6 Sol 高 32%,估计每次尝试时间低 48%,分别为 55.0% 对 41.6%、19.2 分钟对 37.0 分钟。

OpenAI 称结果仅覆盖这 11 项研究任务,时间为模拟估计而非实测客户节省的时间。OpenAI 同时邀请少量软件公司申请类似的研究合作。

相关链接:


GitHub 重建 Git 基础设施,面向 Agent 开发 #23

GitHub 宣布正在重建它的 Git 基础设施,用来支撑开发者和大量 AI Agent 并发读写仓库的负载。官方称,新架构的写入吞吐量最高可以达到原来的 35 倍,这项重建工作目前已经在进行中。

GitHub 宣布正在重建其 Git 基础设施,为开发者和 AI Agent 并发工作的规模化负载打基础。改造在平台持续运行的同时推进,用户无需改变现有的构建方式。

过去一年,GitHub 月度 Git 事件总量从 2182 亿增至 4733 亿,达到原来的两倍多;9 月单月提交数达 73.8 亿次,是一年前的五倍多;推送量同比增长 4.9 倍至每月 33.5 亿次。

GitHub 称,现有 Spokes 架构把持久化和读扩展耦合在一起,增加读副本会拖慢写入,在高活跃仓库上成为上限。

新架构把协调范围缩小到真正需要一致性的引用更新,压缩和垃圾回收等维护工作移出服务路径,权威数据存入 Azure Blob Storage,读容量改由可随流量增减的轻量缓存节点提供。

内部基准测试中,新架构写入吞吐量最高达到原来的 35 倍,读容量可独立扩展。官方表示这一基础已在落地,系列后续文章将详述新架构。

相关链接:


SemiAnalysis 实测:Anthropic 订阅价值约为 OpenAI 五倍 #24

研究机构 SemiAnalysis 发布订阅限额实测报告,覆盖 Anthropic、OpenAI、智谱、MiniMax、Moonshot等企业的订阅。报告指出,Claude 订阅跑 Opus 5.5 的 API 等值价值约为 OpenAI 跑 GPT 6.1 Sol 的 5 倍;旗舰档 Fable 5.1 与 GPT-6 Astra 限额接近。中国厂商的订阅每美元等值价值平均略低于 OpenAI 的水平。

研究机构 SemiAnalysis 发布订阅限额实测报告,覆盖 Anthropic、OpenAI、Meta、SpaceXAI、智谱、MiniMax、Moonshot、Cursor 和 Cognition,并上线仅供 Tokenomics Model 订阅者使用的订阅看板。

报告指出,Claude 订阅跑 Opus 5.5 的 API 等值价值约为 OpenAI 跑 GPT 6.1 Sol 的 5 倍;旗舰档 Fable 5.1 与 GPT-6 Astra 限额接近,但 Fable 5.1 只能占用 50% 限额,200 美元的 Claude 方案用掉约 2485 美元后仍剩一半额度,OpenAI 同档方案用掉约 2897 美元即告耗尽。

OpenAI 上周将 200 美元方案的等值价值砍半并推出 500 美元新档,削减前购入的方案保留旧限额至 10 月 29 日,实测显示新档的 Astra 用量仅比旧 200 美元方案多 21%,Pro 三档的每美元 token 已拉平。

Anthropic 未随 Fable 5.1 上调限额,但随 Opus 5.5 降价将 Max 方案限额上调约 20%、Pro 方案约 50%,仍未完全抵消降价影响。

报告还估算订阅约占 Anthropic 收入的 10%,却占用超过 40% 的推理算力;中国厂商的订阅仍有补贴,每美元等值价值平均略低于 OpenAI 的水平。

相关链接:


a16z 消费 AI 百强榜首次新增支出排名 #25

a16z 发布第七期消费级 AI 应用百强榜,首次根据美国消费者的刷卡数据,在流量排名之外新增消费支出排名。数据显示,消费者支出高度集中,头部 10% 的付费用户贡献了约一半消费额。ChatGPT 在流量和(消费者)支出上继续领跑。

a16z 发布第七期消费级 AI 应用百强榜,继续按网页月度访问量和移动端月活跃用户各排 50 名,并首次借助 YipitData 的美国消费者刷卡数据新增支出排名。

YipitData 面板显示,8 月有 4.5% 符合条件的美国消费者订阅 ChatGPT、Gemini 或 Claude 之一,高于一年前的 2.1%,但支出高度集中:前 1% 付费者贡献 19.5% 的观测消费额,超过后 50% 付费者的总和,月均刷卡 903 美元。

ChatGPT 保持领先,8 月网页访问量约为 Gemini 的两倍、Claude 的六倍,美国付费订阅用户约为 Claude 或 Gemini 的三倍;Claude 确立第三位,今年早些时候已在美国付费订阅用户数上超过 Gemini。

流量与支出明显分化,支出榜前 50 名厂商中有 29 家未出现在任何流量榜单,同时进入三个榜单的只有 7 家公司。

相关链接:


Nous Research 发布 Hermes Index 智能体模型榜 #26

Nous Research 上线了名为 Hermes Index 的智能体模型榜单,用四个基准套件的平均分和平均每任务成本,比较各模型在 Hermes Agent 框架下的表现。

Nous Research 推出智能体模型榜单 Hermes Index,以四个基准套件的平均分和平均每任务成本衡量模型在 Hermes Agent 中的表现。该公司表示,目的是帮助用户选型,并向各实验室展示模型在 Hermes 中的运行情况。

四个套件为自建新基准 Hermes Bench、Terminal-Bench 4.0、Terminal-Bench Science 和 SkillsBench。所有评测均为 pass@1,各模型运行同一 harness,reasoning effort 在支持时设为 high。

榜单显示 Claude Opus 5.5 以 63.31 分、每任务约 4.99 美元居首,GPT 6 Astra 以 56.25 分、11.61 美元排第二。

Hermes Bench 含 150 项任务、25 个类别,在预置真实文件的工作区中评测;部分 SkillsBench 运行使用了公开仓库的解答,榜单按剔除后的 clean 分数计。

相关链接:


世卫非洲团队借 Google Earth AI 快速锁定埃博拉暴露区 #27

Google 介绍新研究,把 Google Earth AI 用于公共卫生,用卫星影像、人口动态等数据辅助疾病预测。在埃博拉疫情中,世卫组织非洲区域办事处团队用原型工具在几分钟内定位了 四十八个暴露定居点和超过 四万五千五百名风险人群。相关的人口动态基础模型已经以预览形式在 Google Maps Platform 商业化提供,部分用例可以申请免费访问。

Google 发布与全球卫生伙伴合著的新研究,展示 Google Earth AI 在公共卫生中的应用:它结合卫星影像、移动性数据与环境信号,以及 AlphaEarth Foundations 和 PDFM 等基础模型,并通过原型 Geospatial Reasoning agent 和 planetary prediction engine 支持对话式空间制图与自主疾病预测。

在刚果民主共和国正在进行的埃博拉疫情中,世卫组织非洲区域办事处团队用该 agent 在数分钟内定位 48 个暴露定居点和超过 45,500 名风险人群,以往该过程通常需要数周。

PDFM embeddings 已以 Population Dynamics Insights 的名称在 Google Maps Platform 以 Preview 形式商业化提供,部分用例可申请免费访问,合格组织还可申请 Google Earth credits。

相关链接:


Opus 5.5 Agent 三天找出两种室温磁性半导体 #28

评测机构 Vals AI 发布博文称,九十多个 Claude Opus 5.5 Agent 在三天内运行数百次量子力学模拟,找到两种室温磁性半导体候选,其中一种早在1999 年就被合成过。

LLM 评测机构 Vals AI 发布博文称,90 多个 Claude Opus 5.5 Agent 在 3 天内于云端运行数百次量子力学模拟,找出两种室温磁性半导体候选,属于净磁矩为零却能按自旋分选电子的 Luttinger 补偿磁体,面向自旋电子学存储。

第一个候选是新设计的 YBaMnFeO₅,预测带隙 2.35 eV、磁序保持到约 420 K,但合成时所需的原子棋盘排列易被打乱,可能难以制备。

第二个候选 KV[Cr(CN)₆] 于 1999 年首次合成,当年实测磁序保持到 376 K,本次预测其带隙约 2.1 eV,两条带边同处一个自旋通道。

Vals AI 强调这些是理想晶体的预测,带隙与自旋分选均未被测量,下一步是重新合成 KV[Cr(CN)₆] 并实测,全部计算数据和一键校验程序已公开在 GitHub。

相关链接:


行业动态

五角大楼确认停用 Anthropic 全部产品 #29

据 BBC 报道,美国国防部向 BBC 确认,已经停止使用 Anthropic 的全部产品。该部门今年2月将 Anthropic 列为国家安全供应链风险,要求8月底前完成停用,但知情人士向 BBC 透露,直到上周,Claude 仍被用于情报分析和对伊朗的军事行动。

据 BBC 报道,美国国防部向 BBC 确认,已停止使用 Anthropic 的产品。该部门今年2月将 Anthropic 列为国家安全供应链风险,并要求8月底前停用,但多名知情人士称,直到上周 Claude 仍被用于情报分析和对伊朗的军事行动。

Claude 长期嵌入 Palantir 运营的 Maven 情报系统,用于处理卫星图像和无人机画面、识别潜在军事目标,研究者称深度集成后难以快速移除。

冲突起因是五角大楼要求 Anthropic 移除安全护栏遭拒;Anthropic 称该认定前所未有且违法,已起诉特朗普政府。诉讼期间,五角大楼转向与谷歌、SpaceXAI、OpenAI签约。

相关链接:


前瞻与传闻

OpenAI 计划合并 Chat 与 Work 开关 #31

OpenAI Codex 负责人 Tibo 在播客访谈中表示,公司计划把 Chat 和 Work 开关合并,因为用户喜欢 Work 的能力,但有时更想用更快的 Chat。他还透露未来会把 Dots 的智能体能力逐步集成到 ChatGPT,目前这些调整都还是计划。

OpenAI 负责 ChatGPT 和 Codex 相关工作的 Tibo Sottiaux 在播客访谈中确认,公司计划将 ChatGPT 与 Codex 中的 Chat 和 Work 开关合并,让用户既能使用 Work 的能力,也能保留更轻快的体验。

他还表示,未来计划把 Dots 的智能体能力逐步无缝集成到 ChatGPT 中。访谈预告同时提到,模型选择器很可能被取消,产品将向更简单的交互演进。

相关链接:


AI HOT 补充资讯

AI 模型

Mistral Large 4 进入 Code Arena: WebDev 排名第45,得分1534 #A1

来源:X:Arena (@arena)

Arena 宣布 Mistral Large 4 登陆 Code Arena: WebDev,以 1534 分排名第 45,比 Mistral Large 3(第130名)高 304 分,比 Mistral Medium 3.5 高 271 分。


提示:内容由 AI 辅助整理,可能存在错误,请以原始出处和官方信息为准。