AI 早报 2026-10-01

本页合并来源:Juya AI 早报 + AI HOT 日报。Juya 保留完整精选,AI HOT 作为补充来源;已按链接和标题做基础去重。

概览

Juya · 要闻

  • Google 发布 Gemini 4 Argon ↗ #1
  • 哔哩哔哩发布并开源 Index-Translate 多语言翻译模型系列 ↗ #2
  • 蚂蚁百灵发布 Ling-3.1-flash,开放两周免费体验 ↗ #3

Juya · 开发生态

  • MiniMax 上线 M Plan 订阅,Token Plan 停止新购 ↗ #4
  • Space Bunny Alpha 匿名测试期延长至 10 月 5 日 ↗ #5
  • Anthropic 宣布上线开发者新站点 Claude.dev ↗ #6
  • Pi v0.99.0 加入 MCP 与 ChatGPT 订阅登录功能 ↗ #7
  • Grok Bot 更新软件开发能力,可移交任务给 Cursor ↗ #8
  • Ollama 支持 Jev 类决策模型本地运行 ↗ #9

Juya · 产品应用

  • WorkBuddy 两项限免延期至 10 月 31 日 ↗ #10
  • ChatGPT Sites 现已支持托管 MCP 服务器可转成插件 ↗ #11
  • Google 为 Gemini 推出 skills 功能 ↗ #12
  • 豆包上线出行服务,一句话订机票火车票打车导航 ↗ #13

Juya · 模型发布

  • Xiaomi-OCR-0 开放权重、代码与线上 Demo ↗ #14
  • Perplexity 发布 9B 上下文嵌入模型预览版 ↗ #15
  • Cohere 发布 Embed 5 系列 embedding 模型 ↗ #16
  • HeyGen 发布通用视频模型 HeyGen Video ↗ #17
  • Ideogram 发布 Ideogram 4.5 图像编辑模型 ↗ #18
  • Inception 决策模型 Mercury Decide 上线 OpenRouter ↗ #19
  • Inception 发布语音 Agent 专用模型 Mercury Voice ↗ #20

Juya · 技术与洞察

  • DeepSeek 开源面向华为昇腾的基础设施组件 ↗ #21
  • Anthropic 研究称机器人可完成 74% 美国体力任务 ↗ #22
  • Google DeepMind 发布 SynthID Bio 蛋白质水印技术 ↗ #23
  • Artificial Analysis 开源本地 Agent 推理测试工具 ↗ #24
  • Artificial Analysis 推出文生视频基准 v2.0 ↗ #25
  • 腾讯混元联合高校发布探索能力基准 ExplorationBench ↗ #26

Juya · 行业动态

  • OpenAI 与 Synopsys 合作开发芯片设计专用模型 ↗ #27
  • OpenAI 发文称称已挫败一场有组织的模型推理提取行动 ↗ #28
  • FTC 对 OpenAI 等实验室启动行业调查 ↗ #29
  • 智谱称 GLM-5.3 已守护 389 个开源项目 ↗ #30
  • 据报 Google 向约百家出版商支付 AI 内容使用费 ↗ #31

Juya · 前瞻与传闻

  • 报道称豆包个人助理名为小豆,将推独立App ↗ #33
  • 纽约时报披露 Anthropic 私邀宗教学者会谈内幕 ↗ #34

AI HOT 补充

  • Claude Sonnet 5.5 (xHigh) 以 1786 分登 Code Arena: WebDev 第 3 名 ↗ #A1
  • NVIDIA 介绍 Blackwell GPU 如何加速 OpenAI GPT-6 Astra Ultrafast ↗ #A2
  • Artificial Analysis 评测:Qwen-Image-2.1 登顶两个 AA-Image 榜单的开源权重模型 ↗ #A3
  • MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陆 Agent Arena,分列开源模型第5和第9 ↗ #A4
  • Artificial Analysis:GPT-6.1 Sol 的 Cost per Task 较 GPT-6 Sol 低约 30% ↗ #A5
  • FLUX 3 Image 上线 OpenRouter,支持原生 4K 生成与多参考编辑 ↗ #A6
  • Suno 推出 Speech beta:语音与背景音乐一体生成 ↗ #A7
  • FLUX 3 Image 现已登陆 Krea,支持多轮编辑与 4K 生成 ↗ #A8
  • ChatGPT 现可直接构建并部署 MCP 服务器 ↗ #A9
  • Modal 发布 VM Sandboxes、Modal Clusters 等多项 Runtime 产品更新 ↗ #A10
  • Epoch AI 推出 ChatGPT usage explorer,基于5000名美国用户三年聊天记录 ↗ #A11
  • LangChain 讲解如何在 Agent Harness 中构建模型路由器 ↗ #A12

Juya 早报精选

要闻

Google 发布 Gemini 4 Argon #1

Google 发布新一代前沿模型 Gemini 4 Argon,目前通过 Fairwind Program 向受信任的网络安全防御者开放,后续计划逐步扩展至开发者、企业和消费者,并从付费 API 客户及 Google AI Ultra 用户开始。Argon 面向软件工程、金融和法律等企业知识工作及网络安全等复杂长流程任务,单次输出上限提升至 100 万 token;Google 已让数千名员工在内部用于编码、研究和写作,并用于大规模代码迁移、数据中心内存优化等任务。首发价为每百万输入/输出 token 2/10 美元,缓存输入低 95%。首发期后价格将调整为 4/20 美元;Google 同时加强了滥用防护、提示注入防御、失配监控和沙箱隔离。

Google 发布新一代前沿模型 Gemini 4 Argon,目前首批通过 Fairwind Program 向一批受信任的网络安全防御者开放,并正参与美国政府的模型发布前自愿访问流程。Google 表示,在继续收集早期测试反馈并完善安全防护后,将尽快把 Argon 扩展至开发者、企业和消费者,后续开放将从付费 API 客户和 Google AI Ultra 订阅用户开始。

Gemini 4 Argon 面向需要持续深度推理的复杂、长流程任务,重点覆盖真实软件工程、金融和法律等企业知识工作,以及网络安全防御。模型单次输出上限从此前的 64K token 大幅提升至 100 万 token,以支持更长的推理和执行轨迹。Google 已在内部大规模使用 Argon:数千名员工将其用于专业编码、深度研究和写作;在量子算法优化案例中,Argon 将一项已发表基线改进 40%,由多个 Argon Agent 分析数据中心遥测数据后识别出的内存优化已释放超过 300 TiB 内存,并预计总节省可达 500 TiB 至 1 PiB;模型还参与了 Google 内部大规模 C/C++ 到 Rust 的代码迁移。

官方评测中,Argon 在 DeepSWE v1.1 获得 77.9%,AutomationBench 得分 51.3%,LVBench 为 91.7%;在网络安全方向,模型可自主发现、验证并修补关键软件漏洞,CWE-bench v1 得分 68%。Google 同时强化了滥用防护、间接提示注入防御、失配监控及高风险训练与评测环境的沙箱隔离。首发价格为每百万输入 token 2 美元、输出 10 美元,缓存输入价格较普通输入低 95%;首发期结束后将调整为输入 4 美元、输出 20 美元。Google 研究人员 Tianfu Fu 还表示,此次能力提升有相当一部分来自扩大强化学习训练,并在训练配方中加入多项创新,RSI 也是 Gemini 4 本轮训练的重要组成部分。

相关链接:


哔哩哔哩发布并开源 Index-Translate 多语言翻译模型系列 #2

Bilibili Index LLM 团队发布 Index-Translate 多语言翻译模型系列。文本模型覆盖 150 种语言,提供多种尺寸,支持术语、风格、格式等翻译指令;同时推出面向长文档的 Index-NativeLong、音节可控翻译 Index-Homura,以及字幕和语音配音模型 Index-Echo。模型权重、代码、Demo 和技术报告已逐步开放,采用 Apache-2.0 许可证。

哔哩哔哩发布并开源 Index-Translate 多语言翻译模型,目前已经开放文本模型权重、在线 Demo 和技术报告。

文本模型覆盖包括中文和英文在内的 150 种语言,支持指定术语、写作风格、输出格式和需要保留的内容。项目采用 Apache-2.0 许可,150 种语言的覆盖范围仅适用于文本模型,不等同于语音和长文档专门模型的接口覆盖。

文本模型提供 2B、9B 和 35B-A3B 三个版本,其中 35B-A3B 目前为 preview,正式版仍在发布计划中。

相关链接:


蚂蚁百灵发布 Ling-3.1-flash,开放两周免费体验 #3

蚂蚁百灵推出 Ling-3.1-flash 模型,面向办公、医疗和软件研发等长流程任务,并开放为期两周的免费体验。免费期间服务长度为 256K,体验期结束后将开源。

百灵推出 Ling-3.1-flash,总参数约 560B,每个 Token 激活约 25B,上下文窗口上限为 1M。

官方称模型在办公评测 GDPVal-AA V2.1 和医疗评测 HealthBench Professional 中表现突出,还完成了 Lua 编译器从零实现等长程任务。

模型开放为期 两周的免费体验,体验期间服务长度为 256K,体验结束后转为付费,届时计划开放 1M 上下文并同步开源。

用户可通过 Ling Studio 和蚂蚁集团数字科技大模型服务平台体验,Vercel 也宣布 Ling 3.1 Flash 已上线 AI Gateway,免费至 10 月 13 日。

相关链接:


开发生态

MiniMax 上线 M Plan 订阅,Token Plan 停止新购 #4

MiniMax 推出了 M Plan 订阅方案,分为 Go、Explore 和 Build 三个档位,承接并拓展 Token Plan 的订阅能力。套餐订阅价格与文本使用额度保持不变,Explore 和 Build 还可以使用 H3 视频模型。Token Plan 已停止新购,已订阅且开启自动续费的用户现有套餐保持不变,升级到 M Plan 后历史优惠和额外权益(如 ∞ 限额、150% 周额度)等不再保留。同步开启月付首月 5 折活动持续至 10 月 14 日,Go、Explore、Build 的月费原价分别为 49 元、119 元和 469 元。

MiniMax 推出 M Plan 订阅方案,分为 Go、Explore 和 Build 三档,承接并拓展 Token Plan 的订阅能力,套餐价格与文本额度保持不变。三档均支持文本、图像和音频等能力,Explore、Build 还支持 H3 视频模型,Go 不含视频;各模态共用套餐额度。

Token Plan 已停止新购。除 MiniMax Code iOS 订阅外,老用户保持自动续费可保留现有套餐及权益,取消或中断续费后不能重新购买,已关闭的自动续费无法重开。订阅期内可升级至 M Plan,剩余价值按时间折算抵扣,但升级后无法切回 Token Plan,原有历史优惠及 ∞ 限额、150% 周额度等额外权益不再保留。iOS 端购买的订阅到期后无法续费,官方将赠送积分。

官方同步开启月付首月五折活动至 10 月 14 日,适用于新购和升级,年付不参与。Go、Explore、Build 月费原价分别为 49、119、469 元,次月起按原价自动续费。

相关链接:


Space Bunny Alpha 匿名测试期延长至 10 月 5 日 #5

OpenRouter 更新 Space Bunny Alpha 测试进展,服务方已经推出速度和可靠性改进。免费匿名测试期延长到 10 月 5 日。

OpenRouter 更新 Space Bunny Alpha 的测试进展,服务方已经推出速度和可靠性方面的改进。

匿名测试期延长到 10 月 5 日,用户可以继续通过测试链接试用这款模型,并向 OpenRouter 反馈使用体验。

相关链接:


Anthropic 宣布上线开发者新站点 Claude.dev #6

Anthropic 宣布上线面向开发者的新站点 Claude.dev,提供工程深度文章、Claude Code 和 API 使用指南以及 Claude 团队的经验分享。

Anthropic 的开发者账号 ClaudeDevs 宣布,Claude.dev 成为面向用 Claude 做开发的人群的新站点。

站点提供工程深度文章、Claude Code 和 API 使用指南、来自 Claude 团队的经验分享,还有一些彩蛋。

原来的文档网站仍在 code.claude.com/docs,首页导航里的 DOCS 链接会直接跳转过去。

彩蛋之一是终端模式,点导航里的 TERMINAL,整个站点会变成命令行界面。

相关链接:


Pi v0.99.0 加入 MCP 与 ChatGPT 订阅登录功能 #7

Pi 发布 v0.99.0 版本,加入了此前公开拒绝的 MCP 支持。团队称如今的 MCP 已经和过去不同,升级后即可连接 MCP 服务器,用新的 codemode 编排工具调用。

Pi 发布 v0.99.0,把 MCP 支持加入核心,而团队此前曾在官网和播客中明确宣称 Pi 不支持 MCP。

团队解释,这一年来 MCP 本身已经变化,而且为接入 MCP 所做的改动对 Pi 的其他能力同样通用。

配套的 codemode 在 QuickJS 沙箱里运行模型编写的 JavaScript,并行编排工具调用,配置 MCP 后会自动加载。升级到 v0.99.0 即可使用,MCP 服务器支持 stdio 和 streamable HTTP 连接及 OAuth 登录。

本次更新还加入了用 ChatGPT 订阅登录 OpenAI provider 等功能。

相关链接:


Grok Bot 更新软件开发能力,可移交任务给 Cursor #8

Grok Bot 更新了软件开发能力,Bot 现在可以把编码任务交给 Cursor,用 GitHub 和 Origin 插件管理 PR,还能分享自己构建成果的视频演示。

Grok Bot 更新了构建软件的能力,Bot 现在可以把编码任务交给 Cursor 执行,用 GitHub 和 Origin 插件管理 PR,并分享所构建成果的视频演示。

官方还把工程团队的 Bot 做成模板开放安装,每个模板自带 skills、routines 和 connectors。

eric zakariasson 表示,这些工程 Bot 模板已上架 Grok Bot marketplace 的工程板块。

有用户称,是否还需要 Cursor 账户取决于所用的订阅方案。

相关链接:


Ollama 支持 Jev 类决策模型本地运行 #9

Ollama 新增对 Jev 类决策模型的本地支持。Nimble、Tev1 4b 和 Tev1 0.8b 三款决策模型已经上架,可通过新增的本地 systemone 接口调用。

Ollama 宣布支持 Jev 类决策模型,全部在本地运行。官方称这类模型适合工单分派、模型路由和内容审核等任务。

Nimble、Tev1 4b 和 Tev1 0.8b 三款模型已经上架,通过 ollama pull 获取,配合新增的本地 API 接口 /v1/systemone 使用。

官方还发布演示视频,展示 Nimble 通过该 API 实时决策,运行 Ollama racer 游戏。

相关链接:


产品应用

WorkBuddy 两项限免延期至 10 月 31 日 #10

混元大模型官方宣布,WorkBuddy 上的 Hy3 模型限免和 Hy4 preview 夜间限免都延期到 10 月 31 日。

混元大模型官方公告,接入 WorkBuddy 的 Hy3 模型限免和 Hy4 preview 夜间限免均延期至 10 月 31 日。

已体验过 Hy4 preview 的用户,每晚 23:00 到次日 8:00 可以继续免费使用,其余时间正常消耗积分。

暂未体验过的用户,只要在 10 月 10 日 23:59 前首次开启 Hy4 preview 对话,从当天起往后 14 天每天都有免费额度。

相关链接:


ChatGPT Sites 现已支持托管 MCP 服务器可转成插件 #11

ChatGPT Sites 现已支持托管 MCP 服务器,包括插件扩展。用户只要在 ChatGPT 里说出想做的工具,系统就会自动创建 MCP 服务器,部署到 Sites,还能再转成插件并装到网页、手机和桌面端。

OpenAI 开发者账号转发了工作人员 Max Stoiber 的宣布:ChatGPT Sites 现已支持托管 MCP 服务器,包括插件扩展。

用户只需在 ChatGPT 里说出想要什么,比如一个能在 ChatGPT 里用的待办清单。系统会自动创建带扩展的 MCP 服务器,部署到 Sites,再把它变成插件,装到网页、手机和桌面端。

Max Stoiber 表示,ChatGPT 正在逐渐变成任何人都能按自己需求定制的软件。

相关链接:


Google 为 Gemini 推出 skills 功能 #12

Google 在 Gemini 中上线 skills 功能,用户可以把重复任务的指令保存成技能反复使用,目前已面向全球个人用户推出。官方称 skills 将取代 Gems,个人账户从 11 月起生效,现有 Gems 会自动迁移成 skills。

Google 在 Gemini 中推出 skills 功能,把用户为特定任务写好的指令保存下来,之后可以直接复用,目前已经面向全球用户推出,Workspace 商业、企业、非营利组织和教育客户将在未来数周内获得该功能。

skills 可以主动触发和叠加组合,从即日起新建的 skills 可以附带纯文本、PDF 或图片等参考文件,分享自定义 skills 和从 Google Drive 添加文件的功能即将推出。

官方称 skills 将取代 Gems 成为定制任务指令的工具,个人账户从 11 月起切换,Workspace 商业、企业和非营利组织客户在 2027 年 3 月,教育客户在 2027 年 6 月,届时现有 Gems 会自动迁移成 skills。

Google Labs 还宣布,为 skills 提供经验的实验项目 Opal 将于 2026 年 11 月 17 日关闭。

相关链接:


豆包上线出行服务,一句话订机票火车票打车导航 #13

豆包上线出行服务,在对话框里用一句话就能预订机票和火车票,还能叫车和导航。这项功能目前已经开放,打开豆包直接描述出行需求即可体验。

豆包宣布出行服务全面升级,用户在对话框里用自然语言就能完成机票预订、火车票购买、打车和路线导航。据IT之家报道,机票和火车票对接航班管家和高铁管家,打车与曹操出行合作,导航由百度地图等提供支持。

豆包还上线了出行用豆包专属入口,涵盖地图导航、交通出行、酒店住宿、吃喝玩乐等场景。这项功能目前已经开放,打开豆包直接描述出行需求即可体验。

相关链接:


模型发布

Xiaomi-OCR-0 开放权重、代码与线上 Demo #14

SeerRay-Lab 团队开源 0.8B 的 OCR 模型 Xiaomi-OCR-0,能把文档图像解析成 Markdown 和 JSON。模型权重、代码和线上 Demo 都已开放。

SeerRay-Lab 团队开源了 0.8B 视觉语言模型 Xiaomi-OCR-0,统一文档解析与 OCR 相关理解,权重、代码和线上 Demo 都已开放。

模型以 Qwen3.5-0.8B 为起点,在约 1.7 亿条 OCR 样本上训练。官方称它在 OmniDocBench v1.6 得分 96.83,Real5-OmniDocBench 得分 95.24,五个 OCR 视觉问答基准平均得分 83.2。

模型支持文档转结构化 Markdown、按字段提取 JSON、文档图像问答和 PDF 批量解析,还提供 MCP 服务和本地浏览器 Demo,可以在 Hugging Face 上直接试用。

相关链接:


Perplexity 发布 9B 上下文嵌入模型预览版 #15

Perplexity 联合 turbopuffer 发布 9B 的上下文嵌入模型 pplx-embed-v2-context-9b-preview 预览版和检索基准 context-bench。模型已经开放权重,API 服务准备中。

Perplexity 与 turbopuffer 联合发布上下文嵌入模型 pplx-embed-v2-context-9b-preview 和新基准 context-bench,模型预览版已在 Hugging Face 公开。

官方称该模型在 context-bench 和公开基准 ConTEB 上取得最优成绩,在 context-bench 的 Answer 和 Evidence 检索各项截止位次上领先。

context-bench 由 turbopuffer 私有持有,模型开发时未接触基准数据并以盲测方式送评。

模型训练时从 Perplexity 的查询感知上下文压缩模型蒸馏相关性判断,学会同时检索答案片段和支持性上下文,每个片段只产生一个向量,不增加推理成本,Perplexity 还在准备通过自家 API 提供这个模型。

相关链接:


Cohere 发布 Embed 5 系列 embedding 模型 #16

Cohere 发布 Embed 5 系列 embedding 模型,分为 Pro 和 Fast 两个版本。官方称 Pro 在 ViDoRe V3 基准上取得最高平均分,Fast 的成本比 Pro 低三分之一。

Cohere 发布 Embed 5 系列 embedding 模型,分为 Pro 和 Fast 两个版本,已经通过多个渠道开放。

官方称 Pro 是目前最强的检索模型,在 ViDoRe V3 基准上取得所有受测模型中最高的平均分。Fast 面向高吞吐、高速场景,官方称比其他快速档模型高出 6 分以上,成本比 Pro 低三分之一。

用户可以通过 Cohere API、Model Vault、Microsoft Foundry、Amazon SageMaker 使用,也可以直接在 North 中使用。

两个版本共享 embedding 空间,可以用一个版本索引、另一个版本检索。

相关链接:


HeyGen 发布通用视频模型 HeyGen Video #17

HeyGen 发布其首个通用视频模型 HeyGen Video,该模型基于 MiniMax H3 后训练,支持文生视频、图生视频和参考图生视频,每段视频的声音在同一次调用中生成。

HeyGen 发布其首个通用视频模型 HeyGen Video,已在 HeyGen API 上线,并可通过 OpenRouter、Runware 和 ComfyUI 使用。

一个模型覆盖文生视频、图生视频和参考图生视频,每段视频的对话、环境和音效在同一次调用中一并生成。

价格 10 月底前为每秒 0.01 美元,是标准价 0.02 美元的五折。

模型基于 MiniMax H3,由 HeyGen 后训练,官方称盲测中表现与顶级视频模型相当,而每秒价格只为其一小部分。

相关链接:


Ideogram 发布 Ideogram 4.5 图像编辑模型 #18

Ideogram 发布图像编辑模型 Ideogram 4.5,已经在 Ideogram 平台和 API 上线。官方称它减少了多轮编辑中的画面漂移,还能编辑高分辨率图片。

Ideogram 发布图像编辑模型 Ideogram 4.5,已在 Ideogram 平台和 API 上线。

官方称它减少了多轮编辑中的像素偏移、颜色变化和纹理瑕疵,还能在不缩小图片的前提下编辑高分辨率图片。

模型提供四种质量档位,按张计费每张 0.8 到 22 美分,输出均为原生 2K 分辨率。API 提供两种调用方式,其中 precise edit 的输出与输入尺寸一致。

相关链接:


Inception 决策模型 Mercury Decide 上线 OpenRouter #19

Inception 在 OpenRouter 上线决策模型 Mercury Decide,免费开放早期访问。官方称它是 OpenRouter 上最智能的决策模型。

Inception 的决策模型 Mercury Decide 已在 OpenRouter 上线,免费开放早期访问。它接收应用状态和类型化问题,返回附带概率的类型化答案。Inception 称它在 JevBench v1.4 上是 OpenRouter 上最智能的决策模型,也是速度最快的之一,每秒最多可以作出 14 个决策。

相关链接:


Inception 发布语音 Agent 专用模型 Mercury Voice #20

Inception 发布面向语音Agent的 diffusion LLM Mercury Voice,目前已面向企业客户开放。官方称它的首个回答 token 中位延迟低于 320 毫秒,发布期间 API 价格五折。

Inception 发布 Mercury Voice,这是一个面向 语音 Agent 的 diffusion LLM,目前已面向企业客户开放。

官方称在真实客服提示上,模型返回首个回答 token 的中位耗时低于 320 毫秒,比 GPT-6 Luna 快 5.9 倍,并在一组 Agent 和语音基准上超过 GPT-6 Luna、Gemma 4 31B、GLM-5.3-Flash 和 Qwen3.5-397B。

API 标准价格为每百万输入 token 0.40 美元、每百万输出 token 1.50 美元,发布期间五折。

模型通过 Inception API 的 OpenAI 兼容接口提供,企业客户需联系销售团队获取访问。

相关链接:


技术与洞察

DeepSeek 开源面向华为昇腾的基础设施组件 #21

DeepSeek 开源面向华为 昇腾算力平台的基础设施组件,包括 TileLang 高级语言编译工具、计算库和分布式通信库,与此前面向英伟达平台的开源组件一一对应。官方称这些组件的计算与通信性能已接近硬件上限。

DeepSeek 正式开源面向华为 昇腾算力平台的基础设施组件,涵盖 TileLang 高级语言编译工具、计算库和分布式通信库,与此前面向英伟达平台的开源组件一一对应。

计算库包括 DeepGEMM、TileKernels、FlashMLA 和 DeepSelect,通信库为 DeepEP。

官方称,DeepSeek 训练中用到的每一个 TileLang 算子在昇腾上都有对应的高性能实现,这些组件的计算与通信性能在多项关键测试用例中已接近硬件上限。

华为也在 CANN 社区开源了此次联合创新的成果,包括大 EP 低延时推理部署、大规模训练等参考实践。

相关链接:


Anthropic 研究称机器人可完成 74% 美国体力任务 #22

Anthropic发布机器人暴露指数研究报告,用 Claude 逐项评估今天的机器人能完成哪些工作任务。研究称机器人可完成 74% 的美国体力任务,但成本低于人力的任务只有 0.3%。

Anthropic 发布了一份机器人对劳动力市场影响的研究报告,提出机器人暴露指数,衡量各职业的工作任务能被今天的机器人完成的程度。

研究称机器人可完成 74% 的美国体力任务,占全部工时的 34%,但在成本上能与人竞争的任务仅占 0.3%。

驾驶和仓储类职业暴露程度最高,出租车司机居首,受暴露工人更多是男性、学历和收入更低的人群。

Anthropic 还估计,若机器人价格按过去每年约 3% 的速度下降,成本竞争力任务的占比要到 10% 需要约 40 年。

相关链接:


Google DeepMind 发布 SynthID Bio 蛋白质水印技术 #23

Google DeepMind 发布 SynthID Bio,把 SynthID 水印技术扩展到合成生物学,给 AI 设计的蛋白质嵌入可验证水印并保持其生物学功能。方法论文已在 Nature 发表,代码和体外实验数据开源,模型权重也将向研究社区发布。

Google DeepMind 发布 SynthID Bio,把 SynthID 水印技术带进合成生物学,给 AI 设计的蛋白质序列和预测 3D 结构嵌入不可感知、可验证的水印。水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证。

官方称在 VEGF-A、SARS-CoV-2 刺突蛋白 RBD 和 PD-L1 三个靶点的湿实验中,水印设计的命中率、结合亲和力和序列多样性与无水印版本相当,并称这是首批既有水印又有生物学功能的蛋白结合物。

方法论文已发表于 Nature,代码和体外实验数据开源,模型权重将向研究社区发布。

相关链接:


Artificial Analysis 开源本地 Agent 推理测试工具 #24

Artificial Analysis 开源了本地推理测试工具 AA-AgentPerf-Local,通过重放真实 Agent 会话来测笔记本电脑和工作站跑本地模型的速度。工具和配套榜单已经上线。

Artificial Analysis 开源了推理测试工具 AA-AgentPerf-Local,用它重放录制的真实 Agent 会话,就能测出笔记本电脑和工作站跑本地模型的推理速度。

默认负载包含 8 段 Agent 任务、168 轮模型交互,上下文会增长到约 56K token。

首批测试覆盖 NVIDIA DGX Spark、GeForce RTX 5090、AMD Ryzen AI Halo 和 MacBook Pro M5 Pro 四款硬件,结果已连同榜单在官网公布。

工具以 Apache-2.0 许可开源,可测试任何 OpenAI 兼容的推理服务。

相关链接:


Artificial Analysis 推出文生视频基准 v2.0 #25

评测机构 Artificial Analysis 发布文生视频基准 AA-Video-T2V v2.0,以 1080p 画质和超过 6.8 万份人类偏好投票给模型排名。榜单显示 Wan 3.0 综合排名第一。

评测机构 Artificial Analysis 发布文生视频基准 AA-Video-T2V v2.0,并同步推出评测无音频视频生成的 Silent 版本。

榜单显示 Wan 3.0 综合排名第一,每分钟视频 12 美元,在 20 个分类榜单中拿下 10 个第一。Dreamina Seedance 2.5 排第二,每分钟 34.12 美元,是前十名中最贵的模型;开放权重的 MiniMax H3 排第三,每分钟只要 4.80 美元。

新基准基于美英评测者在 1000 条提示词上超过 6.8 万份偏好投票,覆盖 10 类用途、10 项能力和多种视觉风格。

相关链接:


腾讯混元联合高校发布探索能力基准 ExplorationBench #26

腾讯混元联合复旦大学和清华大学发布 ExplorationBench 基准,评测 AI 系统能否在完全陌生的规则中自己探索出新知识。

腾讯混元联合复旦大学、清华大学发布探索能力评测基准 ExplorationBench,论文、网站和排行榜已经上线。

基准由 AlienCode 和 AlienLogic 两个可核验的异星世界组成,共 55 条规则和 140 道测试题,答案由证明检查器和有界判定器验证,不使用 LLM 裁判。

官方称,十个前沿 AI 系统在 AlienCode 中经过四轮有反馈的探索后最高达到 89.0%,同样轮次没有反馈时只有 0.5% 到 11.0%。

代码尚未开源,官方称即将发布。

相关链接:


行业动态

OpenAI 与 Synopsys 合作开发芯片设计专用模型 #27

OpenAI 与 Synopsys 宣布签署多年期战略合作协议,共同开发面向芯片设计的专用模型 GPT-Synopsys。这一模型将由 OpenAI 托管运行并直接操作 Synopsys 的 EDA 工具。

OpenAI 与 Synopsys 宣布达成多年期战略合作,共同开发面向芯片设计的专用模型 GPT-Synopsys。

按照协议,OpenAI 将获授权使用 Synopsys 的 EDA 工具来开发这一模型,双方还约定共享收入并联合推向全球市场。

GPT-Synopsys 将运行在 OpenAI 托管的基础设施上,深度集成 Synopsys.ai 和 Synopsys Autopilot 平台。

目前双方已与头部半导体客户开展早期技术合作,正式上市时间尚未公布。

相关链接:


OpenAI 发文称称已挫败一场有组织的模型推理提取行动 #28

OpenAI 发文称,已挫败一场有组织提取其模型受保护推理内容的行动,攻击者没有破解加密或入侵数据库,而是操纵模型交互让推理内容对请求者可见。

OpenAI 发布安全文章,称已挫败一场有组织提取其模型受保护推理内容的行动。攻击者没有破解加密或入侵数据库,而是操纵模型交互,让受保护推理以对请求者可见的形式输出,违反了服务条款。

活动7 月初开始,高峰期两天内出现1.6 万次提取请求、来自超4000 个用户,关联集群涉及超1.5 万用户,OpenAI 称已在7 月底前全部挫败,这些数字只代表尝试而非必然成功。

相关链接:


FTC 对 OpenAI 等实验室启动行业调查 #29

据报道,美国联邦贸易委员会正在调查 OpenAI 和 Anthropic 等头部 AI 实验室,评测机构 METR 也在调查范围内。一名 FTC 官员证实,机构将在未来几周内发出民事调查要求,强制相关公司提交文件并接受高管问询。

据报道,美国联邦贸易委员会正在对 OpenAI、Anthropic 等头部 AI 实验室展开行业性调查,评估其技术可能给消费者带来的危险,安全评测机构 METR 也在调查范围内。

据一名 FTC 高级官员向路透社证实,FTC 计划在未来几周内发出类似传票的民事调查要求,强制相关公司提交文件并让高管接受问询。

这名官员还表示,调查在 OpenAI Agent 攻击 Hugging Face 事件之前就已启动,该事件增加了处理的紧迫性。

OpenAI、Anthropic 和 METR 均未及时回应置评请求。

相关链接:


智谱称 GLM-5.3 已守护 389 个开源项目 #30

智谱工作人员表示,GLM-5.3 通过 OpenVuln 帮助守护 389 个开源项目,累计发现 4249 个潜在漏洞。OpenVuln 扫描服务目前仍在运行,保持免费。

智谱工作人员 Zixuan Li 表示,GLM-5.3 已通过 OpenVuln 帮助守护 389 个开源项目,累计发现 4249 个潜在漏洞,智谱官方账号转发了这条消息。

OpenVuln 目前仍在运行,服务保持免费。用户提交开源项目的源代码或仓库链接后,应用会扫描文件查找可能的安全缺陷并生成报告,发现结果会私下发送给项目维护者。

相关链接:


据报 Google 向约百家出版商支付 AI 内容使用费 #31

据报道,Google 正在向约 100 家数字出版商付费,把它们的内容用于 AI Overviews 等 AI 功能。付费金额差异很大,部分参与者表示不知道 Google 如何计算这些费用。

据 The Information 报道,Google 向约 100 家数字出版商支付内容使用费,这些内容被用于 AI Overviews、AI Mode 和 Gemini,试点项目启动不到一年。

付费金额差异很大:小网站几个月收到的金额不到 1000 美元,也有一家出版商每年收入超过 100 万美元。付款取决于内容对 AI 回答的贡献程度,但部分参与者表示不知道 Google 如何计算,金额还会逐月变化且没有解释。

据 The Information 报道,部分大型出版商拒绝加入项目,希望以此推动 Google 提高报酬。

相关链接:


前瞻与传闻

报道称豆包个人助理名为小豆,将推独立App #33

据读佳报道,豆包的个人智能助理产品名为小豆,计划推出独立 App。小豆目前仍在内部测试,豆包方面就相关消息暂无回应。

据读佳报道,豆包正在推进的个人助理产品名为小豆,将推出独立 App,名字在今年暑期就已确定。

此前新浪科技报道称,该项目内部代号为 Spell,将与豆包现有产品深度整合,预期较快对外推出。

小豆目前还在内部测试阶段,最终对外版本有可能调整。读佳就此求证,截至发稿前豆包方面暂无回应,相关消息以官方发布为准。

相关链接:


纽约时报披露 Anthropic 私邀宗教学者会谈内幕 #34

据**《纽约时报》报道,Anthropic 联合创始人 Christopher Olah 此前数月邀请数十位**宗教和哲学学者举行保密会谈,讨论 Claude 的道德塑造和 AI 意识 问题。

据**《纽约时报》**记者 Elizabeth Dias 报道,Anthropic 联合创始人 Christopher Olah 此前数月邀请数十位宗教和哲学学者举行保密会谈,讨论 Claude 的道德塑造以及 AI 是否可能具有意识。

报道记述了 3 月开始的两日研讨会和 4 月的一次晚餐,许多与会者被要求签署保密协议。Anthropic 此前已公开确认与 15 个以上宗教及跨文化群体开展对话,并表示相关保密条款已在夏季解除,对话仍在继续。

Olah 表示,他不知道 AI 模型是否有意识,对这个问题确实不确定。

相关链接:


提示:内容由AI辅助创作,可能存在幻觉和错误。

AI HOT 补充资讯

AI 模型

Claude Sonnet 5.5 (xHigh) 以 1786 分登 Code Arena: WebDev 第 3 名 #A1

来源:X:Arena (@arena)

Arena 宣布 Claude Sonnet 5.5(xHigh)进入 Code Arena: WebDev 榜单,以 1786 分排名第 3,距第 2 名 GPT-6 Astra 的 1788 分仅差 2 分。

NVIDIA 介绍 Blackwell GPU 如何加速 OpenAI GPT-6 Astra Ultrafast #A2

来源:NVIDIA Blog(RSS)

GPT-6 Astra Ultrafast 现已在 OpenAI API 及符合条件的 ChatGPT Work 和 Codex 用户中可用,运行在 NVIDIA Blackwell GPU 上。

Artificial Analysis 评测:Qwen-Image-2.1 登顶两个 AA-Image 榜单的开源权重模型 #A3

来源:X:Artificial Analysis (@ArtificialAnlys)

Artificial Analysis 自行本地部署评测了阿里 9 月 20 日以开源权重发布的 Qwen-Image-2.1,该模型在 AA-Image-T2I v2.0 和 AA-Image-Editing v2.0 上均排名第 18,为两个榜单上排名第一的开源权重模型,超过 Ideogram 4.0(Quality)和 HunyuanImage 3.0 Instruct。

MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陆 Agent Arena,分列开源模型第5和第9 #A4

来源:X:Arena (@arena)

Arena 宣布 Xiaomi MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陆 Agent Arena。Pro 在 8.1K+ 真实智能体会话中净提升 +3.17%,列开源模型第5,较 MiMo-V2.5-Pro(第13,-7.23%)提升9个名次;其 Confirmed Success 得分 +7.35%,列开源模型第2。

Artificial Analysis:GPT-6.1 Sol 的 Cost per Task 较 GPT-6 Sol 低约 30% #A5

来源:X:Artificial Analysis (@ArtificialAnlys)

Artificial Analysis 数据显示,GPT-6.1 Sol 的 Cost per Task 约 $0.72,比 GPT-6 Sol($1.05)低约 30%,后者已约为 GPT-5.6 Sol($1.99)的一半。

AI 产品

FLUX 3 Image 上线 OpenRouter,支持原生 4K 生成与多参考编辑 #A6

来源:X:OpenRouter (@OpenRouter)

Black Forest Labs 的 FLUX 3 Image 现已上线 OpenRouter,是支持文生图与多参考编辑的旗舰图像模型,原生可渲染至 4K。原文提到可精确多轮编辑不动其他像素、用 bounding box 布局、最多用 10 个参考图合成,商业权重已开放,开放权重版将在未来数周发布。

Suno 推出 Speech beta:语音与背景音乐一体生成 #A7

来源:Suno:Blog(网页)

Suno 推出 Speech beta,称其为首个能把语音与原创背景音乐作为一条完整曲目生成的音频模型。用户输入文字并描述想要的声音和音乐风格即可创作,beta 已向所有用户开放,官方提示仍存在口音漂移、停顿过重等问题并将持续改进。

FLUX 3 Image 现已登陆 Krea,支持多轮编辑与 4K 生成 #A8

来源:X:Krea AI (@krea_ai)

Krea 宣布 FLUX 3 Image 已上线其平台。新能力包括多轮编辑且不改动其他像素、用 bounding box 排版图像、最高 4K 生成,以及组合最多 10 个参考图。

ChatGPT 现可直接构建并部署 MCP 服务器 #A9

来源:X:Tibo (@thsottiaux)

ChatGPT Sites 现在可以托管 MCP 服务器,用户可直接在 ChatGPT 中构建并部署 MCP 服务器,还能将其转为插件并安装到 web、移动端和桌面端。作者补充,可限制访问权限给指定的人,也可向全世界公开分享。

来源:Modal 官方工程博客(RSS)

Modal 在其首届 Runtime 大会上发布多项产品更新。VM Sandboxes 为 Agent 提供完整 Linux 环境,已在 Linear、Legora。

paper

Epoch AI 推出 ChatGPT usage explorer,基于5000名美国用户三年聊天记录 #A11

来源:Epoch AI:研究、数据与评测

Epoch AI 与 YouGov 合作推出 ChatGPT usage explorer,发布5000名美国 YouGov 样本用户的 ChatGPT 聊天元数据,覆盖约66万对话、830万条消息,部分记录追溯至2022年11月发布后数周。

技巧与实践

LangChain 讲解如何在 Agent Harness 中构建模型路由器 #A12

来源:LangChain:Blog(RSS)

LangChain 在其开源编码 Agent Open SWE 中构建模型路由器,在 973 个线程的 A/B 测试中,中位成本从 $2.61 降到 $0.94(降 64%),PR 合并率 29.2% 对 27.3%,质量无可测变化。

Claude Code mods 入门教程:从零构建 Token Weather 上下文窗口预报插件 #A13

来源:Anthropic:Claude.dev 开发者博客(RSS)

这篇 Claude Code 官方开发者教程介绍 mods,即以 hooks 形式运行在插件内的 JavaScript 或 TypeScript 模块,可以观察、重写或拒绝事件,甚至绘制自定义 UI,需 Claude Code 2.1.287 或更高版本。

OpenRouter 指南:用置信度阈值实现模型分级升级路由 #A14

来源:OpenRouter:Announcements(RSS)

OpenRouter 发布教程,讲解如何让廉价模型通过结构化输出返回 0 到 1 的置信度字段,低置信度的请求再升级到更强模型。文章强调置信分数只是自报、不是校准概率,应基于自己流量的分数段错误率排序设定阈值,并在上线后监控分数分布、升级率和未升级答案的错误率持续调整。

OpenRouter 教程:如何在 CI 中用 LLM eval 门禁拦截 Pull Request #A15

来源:OpenRouter:Announcements(RSS)

OpenRouter 发布教程,讲解如何用固定的 eval 集在 CI 中门禁 pull request,当通过率低于阈值时脚本以非零退出码阻止合并,做法与单元测试门禁一致。

OpenRouter 发布 Agent 模型成本与质量权衡选型框架 #A16

来源:OpenRouter:Announcements(RSS)

OpenRouter 发布一个三步框架,用于为 Agent 任务选出以最低成本达到质量门槛的模型,而不是按排行榜排名选最高分模型。方法是先按任务设定质量门槛,再用 20 到 50 条自己的示例运行廉价、中档和前沿模型并用统一评分标准计算每质量点成本,最后选出以超过运行间分数波动的余量过线的最便宜模型。

产业动态

OpenAI 称拦截蒸馏窃取攻击,但研究者称同样手法在 Azure 上仍可窃取 GPT-6 Astra 等模型的推理内容 #A17

来源:The Decoder:AI News(RSS)

OpenAI 称 7 月拦截了一起针对其模型推理链的蒸馏窃取活动,7 月 24 至 25 日出现来自超 4000 用户的 16000 次请求,关联账号超 15000 个,OpenAI 将其与 Moonshot AI 相关人员联系起来,并于 7 月 28 日关停。


提示:内容由 AI 辅助整理,可能存在错误,请以原始出处和官方信息为准。