AI 早报 2026-10-09

本页合并来源:Juya AI 早报 + AI HOT 日报。Juya 保留完整精选,AI HOT 作为补充来源;已按链接和标题做基础去重。

概览

Juya · 开发生态

  • OpenAI 为 GPT-6.1 Sol 推出 Ultrafast 模式 ↗ #1
  • OpenAI 为桌面应用中的 Codex 推出更快的 steering ↗ #2
  • 阶跃星辰:Step 5 Preview 多平台免费一周 ↗ #3
  • Vercel AI Gateway 上线 Glyph Cluster,匿名期免费 ↗ #4

Juya · 产品应用

  • Claude 推出 Dashboards 和 Motion 两项测试功能 ↗ #5
  • Google Cloud 发布 Gemini 工作智能体 ↗ #6
  • 腾讯 WorkBuddy 上线独立文件浏览器 ↗ #7

Juya · 模型发布

  • JetBrains 开源 Mellum2.1,强化学习主打编程 Agent ↗ #8
  • Hugging Face 开源基因注释模型 Carbon-A ↗ #9
  • LightOnAI 开源 LightOnOCR-3 ↗ #10
  • Odyssey 发布世界模型 Odyssey-3 ↗ #11
  • Grok Imagine Video 1.5 Lite 上线,1080p 每秒 0.14 美元 ↗ #12

Juya · 技术与洞察

  • Ghostty 作者发布终端协议 OSC 7501 ↗ #13
  • 研究称DeepSeek-V4长上下文存在周期性弱点 ↗ #14
  • Epoch AI 推出真实工作评测 ↗ #15
  • 人类数学协会呼吁抵制OpenAI ↗ #16
  • 谷歌 AMIE 研究登上《柳叶刀》 ↗ #17

Juya · 行业动态

  • 新版 Claude 使用政策:持续虐待 Claude 或遭封禁 ↗ #18
  • Anthropic 启动 Cyber Mission,守护关键基础设施与开源软件 ↗ #19
  • 美国联邦科研计划 Genesis Mission 获 11 家行业伙伴 24 亿美元承诺 ↗ #20
  • 报道称 OpenAI 年化营收接近 500 亿美元,比此前报道少约 200 亿 ↗ #21
  • OpenAI 被解雇安全研究员发公开信否认违规 ↗ #22
  • OpenAI 封禁借假记者假智库散布宣传的俄伊账号 ↗ #23
  • 疑似中国攻击者用AI工具攻击韩国银行并窃取数据 ↗ #26
  • 不满 Mistral 质量落后,Ecosia 转用中国开源模型 ↗ #27
  • Harness公司收购Augment Code部分资产 ↗ #28

Juya · 前瞻与传闻

  • 阶跃终端首款智能体手机定档10月13日发布 ↗ #30

AI HOT 补充

  • OpenAI 研究负责人发声明回应三名员工离职争议 ↗ #A1
  • Mistral Large 4 进入 Agent Arena 前十五实验室,排名第 43 ↗ #A2

Juya 早报精选

开发生态

OpenAI 为 GPT-6.1 Sol 推出 Ultrafast 模式 #1

OpenAI 为 GPT-6.1 Sol 推出 Ultrafast 模式,在API 中面向所有用户开放,定价为标准模式的 6 倍,Codex 和 ChatGPT Work 中主要面向 Pro 500 订阅用户开放。

OpenAI 宣布为 GPT-6.1 Sol 推出 Ultrafast 模式,正在 API、Codex 和 ChatGPT Work 上线。官方称该模式速度最高可达 Sol Standard 的 8 倍,智能水平接近 Astra。

API 中面向所有用户开放,定价为每百万输入 token 12 美元、每百万输出 token 60 美元。

Codex 和 ChatGPT Work 中面向 Pro 500 以及符合条件的按量付费 Enterprise、配额计费 Edu 订阅方案开放,Enterprise 需管理员开启权限。

该模式已在所有支持区域上线,支持美国和欧盟数据驻留。

相关链接:


OpenAI 为桌面应用中的 Codex 推出更快的 steering #2

OpenAI 正在 ChatGPT 桌面应用的 Codex 中推出更快的 steering,用户在任务运行时发送追加消息,Codex 能更快响应调整。OpenAI Codex 团队成员 Tibo 表示,steering 已改进为即时生效,可以实时纠正方向。

OpenAI 正在 ChatGPT 桌面应用中为 Codex 推出更快的 steering,用户在任务运行时发送追加消息,Codex 能更快响应这些调整。

steering 可用于在 Codex 工作过程中纠正做法、补充缺失信息或改变方向;用户可在 Settings → General → Follow-up behavior 中,选择追加消息是引导当前运行还是等到下一次运行。

OpenAI Codex团队成员 Tibo 表示,steering 已改进为即时生效,模型对调整的反应快得多,可以实时纠正方向,避免浪费精力。

相关链接:


阶跃星辰:Step 5 Preview 多平台免费一周 #3

阶跃星辰宣布 Step 5 Preview 模型上线 OpenRouter 和 OpenCode 等多个平台,提供为期一周的免费访问。官方称这款模型面向 Agent 和专业工作,任务成本明显更低。

阶跃星辰 StepFun 宣布 Step 5 Preview 上线 OpenRouter,OpenCode、Cline、NousResearch、KiloCode 等平台当天起陆续开放为期一周的免费访问。官方称这款模型面向 agentic 与专业工作提供旗舰级智能,任务成本显著更低。

StepFun 同步提供了模型概览、基准测试、演示及技术规格与 API 文档,用户可在现有工作流中直接切换该模型。

相关链接:


Vercel AI Gateway 上线 Glyph Cluster,匿名期免费 #4

Vercel 在 AI Gateway 上线匿名模型 Glyph Cluster,面向已购买 AI Gateway 额度的 Pro 和 Enterprise 订阅方案团队,匿名期内免费使用。官方介绍,这是一个面向编程和长上下文分析的推理模型。

Vercel 宣布推理模型 Glyph Cluster 以匿名模型的形式登陆 AI Gateway,面向已购买 AI Gateway 额度的 Pro 和 Enterprise 订阅方案团队,隐身期内免费使用。

官方介绍,该模型面向编程和长上下文分析,可处理规划、综合、定量推理以及在大量输入间比较材料等多步任务,支持函数调用并流式输出响应。它仅接受文本输入,不支持图像和文件输入,也不支持结构化输出。

相关链接:


产品应用

Claude 推出 Dashboards 和 Motion 两项测试功能 #5

Anthropic 为 Claude 推出 Dashboards 和 Motion 两项 beta 功能。Claude Dashboards 把公司数据做成随数据更新的仪表盘,付费订阅方案可用;Claude Motion 把报告和想法做成动画讲解,Team 和 Enterprise 订阅方案可用。同时,Claude Docs、Slides 和 Design 结束测试,向包括 Free 在内的所有订阅方案开放。

Anthropic 为 Claude 推出 Claude Dashboards 和 Claude Motion 两项 beta 功能。

Dashboards 可连接 BigQuery、Snowflake 等数据平台或 Salesforce 等 CRM 工具,用自然语言提问后生成随数据更新的仪表盘,每个图表都展示背后的查询,付费订阅方案可用。

Motion 可把报告、图表或产品演示做成短动画,以代码生成、不使用视频生成模型,可修改任意文字、数字和时序并导出 MP4,面向 Team 和 Enterprise 订阅方案。

Enterprise 订阅方案中两项功能默认关闭,需管理员开启;同期 Claude Docs、Slides 和 Design 结束测试,向包括 Free 在内的所有订阅方案开放。

相关链接:


Google Cloud 发布 Gemini 工作智能体 #6

Google Cloud 发布面向工作的通用 Agent “Gemini agent”,把问答、知识工作、图像与媒体创作、编写和运行代码放进同一个 Agent 和同一套 API。Gemini agent 在云端持续运行,关掉电脑后,耗时数小时甚至数天的任务仍会继续。Gemini agent 目前已向中小企业客户开放早期访问,即将面向所有客户推出。

Google Cloud 发布面向工作的通用 “Gemini agent”,把问答、知识工作、图像与媒体创作、编写和运行代码整合进同一个 Agent 和同一套 API,用户委派目标后等待交付结果。

Gemini 在云端持续运行,关闭电脑后耗时数小时或数天的任务仍会继续,可通过网页、移动端、桌面端以及 Google Workspace、Microsoft 365、Slack 使用,并能连接企业现有系统和任意 MCP 服务器。

底层模型单独可选,目前可编排 Gemini 系列和 Anthropic 的 Claude 模型,并配有智能路由和项目级实时支出上限来控制成本。

安全方面,每个 Agent 拥有独立身份和最小权限,动作写入审计日志,任务在 Agent Sandbox 内执行,流量经 Agent Gateway 按企业策略管控。

Gemini 已向中小企业客户开放早期访问,即将面向所有客户推出。

相关链接:


腾讯 WorkBuddy 上线独立文件浏览器 #7

WorkBuddy 上线独立文件浏览器。在电脑上右键本地文件,选择用 WorkBuddy 打开,就能在独立窗口里查看 Word、Excel 等文档,并直接让 AI 分析和修改。官方称功能无需单独下载,更新 WorkBuddy 后即可使用。

腾讯宣布旗下 AI 办公产品 WorkBuddy 正式上线独立文件浏览器。用户在文件资源管理器或 Finder 中右键选择 WorkBuddy 打开本地文件,或将其设为默认打开方式后双击,即可在独立窗口中查看文件,并通过右侧对话栏调用 Buddy 分析、修改。

该浏览器支持 Word、Excel、PPT、PDF、Markdown、HTML 等格式,可多标签页同时打开多份文件,每份文件有独立的 Buddy 对话。功能无需单独下载,更新 WorkBuddy 后即可使用;官方称查看和编辑本地文件不消耗积分,仅调用 AI 处理任务时按实际消耗,且只读取用户主动打开的文件。

相关链接:


模型发布

JetBrains 开源 Mellum2.1,强化学习主打编程 Agent #8

JetBrains 发布开源编程模型 Mellum2.1,架构与 Mellum2 相同,改动几乎全部集中在以强化学习为主的后训练上。JetBrains 自测显示,Mellum2.1 在 SWE-bench Verified 上的得分从 Mellum2 的 2.0 提升到 47.0。

JetBrains 发布编程模型 Mellum2.1,模型权重已上架 Hugging Face,采用 Apache 2.0 许可。Mellum2.1 架构与此前开源的 Mellum2 相同,总参数 12B、每 token 激活 2.5B,改动集中在后训练,强化学习从收尾阶段变为训练主体,模型在带 shell 和文件编辑工具的真实代码仓库中训练,测试通过才获得奖励。

JetBrains 自测显示,Mellum2.1 在 SWE-bench Verified 上从 Mellum2 的 2.0 升至 47.0,Terminal-Bench 2.1 从 0.6 升至 17.4,LiveCodeBench v6 达到 82.0。

官方称高负载下 Mellum2.1 是同组最快模型,token 吞吐接近 Qwen3.5-9B 的两倍,单次请求借助多 token 预测约提速 1.6 倍。GGUF 量化版本已上架,供 vLLM 推测解码使用的多 token 预测头官方称即将推出。

相关链接:


Hugging Face 开源基因注释模型 Carbon-A #9

Hugging Face 的生物学研究团队开源了基因注释模型 Carbon-A,可以直接从 DNA 序列中找出蛋白编码区。团队还发布了用 Carbon-A 构建的注释数据库。该团队称已在猫、鸡等常见物种中,为部分新预测的基因找到 RNA 层面的实验证据。

Hugging Face 生物学研究团队 HuggingFaceBio 开源基因注释模型 Carbon-A,并同步发布用 Carbon-A 构建的注释数据库 Carbon Annotation Database。Carbon-A 有 12 亿参数,直接从 DNA 序列预测真核生物的蛋白编码区,单一模型覆盖哺乳动物、植物、真菌和原生生物等类群;官方称在 42 个基准基因组上宏平均核苷酸 F1 达 0.944,在核苷酸、外显子和基因层面均超过 AUGUSTUS、Helixer 等七种基线。

数据库目前覆盖 22,617 个物种的 48,167 个基因组组装,包含约 5.66 亿个预测蛋白编码位点,团队已标注目标 GenBank 集合的约一半,计划三周后再发布一批。

团队与 Active Site 和 UCSD 合作,用 PacBio Iso-Seq 在猫、鸡和拟南芥等物种中为部分 RefSeq 未收录的预测编码区找到 RNA 证据,但这些证据尚不能说明它们会翻译成蛋白。

Carbon-A 以 MIT 许可在 Hugging Face Hub 开放,预测不解析可变异构体,细菌和病毒不在训练范围内。

相关链接:


LightOnAI 开源 LightOnOCR-3 #10

LightOn 发布端到端 OCR 模型系列 LightOnOCR-3,一次模型调用就能完成文字转录、版面定位、图像描述和图表数据提取。

LightOn 发布端到端 OCR 模型系列 LightOnOCR-3,提供 0.8B、1B、4B 三个尺寸,采用 Apache 2.0 许可,可用于研究和商业用途。

单次模型调用即可输出文字转录、带标签和边界框的版面结构、图像描述和图表数据;空提示词沿用与 LightOnOCR-2 相同的纯转录输出,换用 grounding 提示词则输出完整结果。

官方称新模型处理速度是 LightOnOCR-2 的两倍,自部署时每千页处理成本可低于 一美分,具体取决于硬件、利用率和负载。

相关链接:


Odyssey 发布世界模型 Odyssey-3 #11

Odyssey 发布基础世界模型 Odyssey-3,可以根据提示实时生成交互式环境,研究预览目前免费开放体验。Odyssey 称,Odyssey-3 Pro 在 Physics-IQ Verified 的 video-to-video 基准上取得 66.1 分,是已报告的最高分。

Odyssey 发布基础世界模型 Odyssey-3,称其为迄今最强大的世界模型,研究预览现已免费开放体验。

官方称 Odyssey-3 Pro 在 Physics-IQ Verified 的 video-to-video 基准上取得 66.1 分,为已报告的最高分;在 Odyssey 自己的评估中,Odyssey-3 在 WorldMark 四个类别中的三个排名第一。

Odyssey-3 可根据提示实时生成交互式环境,并通过训练策略适配物理系统,官方演示中仅用数十小时机器人演示数据完成机械臂操作任务,用 20 小时驾驶数据在印度真实道路上实现闭环驾驶。

相关链接:


Grok Imagine Video 1.5 Lite 上线,1080p 每秒 0.14 美元 #12

Grok Imagine 宣布,视频生成模型 Video 1.5 Lite 已在 Grok Imagine API 上线,支持文本生成视频和图像生成视频。

Grok Imagine 宣布,视频生成模型 Video 1.5 Lite 已在 Grok Imagine API 上线,用于文本生成视频和图像生成视频。价格按分辨率按秒计费:480p 每秒 0.02 美元,720p 每秒 0.03 美元,1080p 每秒 0.14 美元。

相关链接:


技术与洞察

Ghostty 作者发布终端协议 OSC 7501 #13

Ghostty 作者发布通用终端协议 OSC 7501,让任何程序都能用一条转义序列告诉终端自己的状态以及原因。Herdr 开发者表示将支持 OSC 7501,另有引用帖称 Amp 和 tuios 已接入。

Ghostty 作者 Mitchell Hashimoto 发布通用终端协议 OSC 7501(Program Status Protocol),程序可通过一条转义序列向终端上报空闲、工作中、等待用户、已完成或失败等状态,并附带原因和进度。

Hashimoto 表示,超过 250 个 Agent 编排工具都在靠解析窗口标题、匹配屏幕内容等启发式方法猜测 Claude Code 等程序的状态,Herdr 三个月内仅为 Claude Code 就修改了约 10 次检测规则,而带外 API 需要每个程序与每个工具单独集成,也难以跨 SSH 或容器使用。

OSC 7501 只共享状态、不规定展示方式,支持层级化记录和 feature detection,不含任何产品特定功能。

Hashimoto 称已在 libghostty 和 Superlogical 的 Rex 终端实现该协议,并以插件或 fork 形式在 Terraform、Claude Code、Codex、Homebrew 中完成概念验证,每处不超过十几行代码。

Herdr 开发者表示将支持 OSC 7501,另有引用帖称 Amp 和 tuios 已接入。

相关链接:


研究称DeepSeek-V4长上下文存在周期性弱点 #14

字节跳动 Seed 团队联合多所高校发表论文,发现 DeepSeek-V4 系列模型的长文本检索准确率,会随信息位置周期性波动。研究发现,这与模型采用的分块 KV 缓存压缩有关,即使平均成绩较高,也可能在特定位置出现明显的检索弱点。

字节跳动 Seed 团队联合普林斯顿大学、斯坦福大学等高校研究人员发表论文,发现 DeepSeek-V4 和 DeepSeek-V4.1 在长上下文检索中存在周期性的“相位敏感”现象:同一信息位于分块 KV 缓存压缩窗口的不同位置,检索准确率可能明显不同。

在 128K token 的“大海捞针”测试中,DeepSeek-V4-Flash-Base 不同位置的准确率最大相差 40.2 个百分点,后训练版本虽然缩小了差距,但周期性波动仍然存在。

研究团队还从零预训练多组对照模型,发现采用分块压缩的模型同样出现这一现象,而全注意力基线没有同等程度的波动。机制分析显示,部分 KV 头及压缩门会对窗口内特定位置产生偏好。

相关链接:


Epoch AI 推出真实工作评测 #15

Epoch AI 推出 Epoch Automation Reports 评测,用取自 Epoch AI 日常工作的 11 个真实任务测试六个模型。官方称,Claude Fable 5.1 和 GPT-6 Astra 总体领先,但仍不足以完全自动化 Epoch AI 的工作。

Epoch AI 推出 Epoch Automation Reports,用取自自身工作的 11 个任务评估六个模型,覆盖图形设计、Data Insight、Data Explorer、AI 数据中心研究和研究设计五类。

各模型在配套 agent harness 的最高推理档下独立完成任务,再由单一人工评分员按 Epoch AI 内部标准评分。

Epoch AI 称,Claude Fable 5.1 和 GPT-6 Astra 总体领先,在编码、计算分析等定义明确的环节表现可靠。

但Epoch AI 指出,这些模型难以掌握内部工作的隐性标准、研究判断力不足,仍不能完全自动化 Epoch AI 的工作。

开放权重模型差距更大,连定义明确的任务也会出错。

Epoch AI 提示每个模型每个任务只运行一次、评分含主观判断,分数存在噪声,定性结论比具体分数更有参考价值。

相关链接:


人类数学协会呼吁抵制OpenAI #16

OpenAI 一次性公开700多篇 AI 生成的数学手稿后,陶哲轩担任主席的人类数学协会发表声明,呼吁数学家停止与 OpenAI 合作。人类数学协会指责 OpenAI 违背科学研究的核心规范,称这次发布展示的是权力。发布次日,OpenAI 因一处符号错误撤回了其中三篇手稿。

OpenAI 一次性公开 700 多篇 AI 生成的数学手稿后,由菲尔兹奖得主 陶哲轩 担任主席的人类数学协会(AHM)发表声明,指责 OpenAI 违背科学研究的核心规范,呼吁数学家停止与 OpenAI 合作。

AHM 称,数学家并没有要求做这项工作,一次性发布 700 多份文件“不是学术展示,而是权力展示”。

发布次日,OpenAI 在官方仓库撤回三篇手稿:其中一篇的符号错误使关键论证失效,并波及两篇依赖它的手稿,另有 14 篇手稿同时修订。

陶哲轩在 Mastodon 上警告,开放问题正被 AI 大规模“收割”,问题一旦被视为已解决便无法逆转,一些数学分支会因此不如从前富有生机。

相关链接:


谷歌 AMIE 研究登上《柳叶刀》 #17

谷歌与贝斯以色列女执事医疗中心在真实门诊开展的 AMIE(谷歌的研究型对话式诊断 AI 系统)研究,已在《柳叶刀》发表。患者就诊前先与 AMIE 文字交流,AMIE 的鉴别诊断在九成病例中包含医生的最终诊断。谷歌称 AMIE 仍是研究系统,还需要更大规模的临床试验。

谷歌与贝斯以色列女执事医疗中心(BIDMC)联合开展的 AMIE(谷歌的研究型对话式诊断 AI 系统)前瞻性研究在《柳叶刀》发表,谷歌称这是首个在真实诊所接受前瞻性研究的此类面向患者的对话式诊断工具,也是谷歌在《柳叶刀》主刊的首篇论文。

患者在紧急护理就诊前先与这一研究型对话式诊断 AI 文字交流、完成病史采集,监督医生实时监控全部对话,没有一次因触发预设安全标准而被中止。

临床医生反馈,AMIE 的摘要在 75% 的病例中帮助准备就诊,在超过一半的病例中影响了诊疗思路;按就诊后 8 周的病历复核,AMIE 的鉴别诊断在 90% 的病例中包含最终诊断。

盲评显示 AMIE 与初级保健医生的鉴别诊断和管理计划质量总体相近,医生在管理计划的实用性和成本效益上更优。

谷歌称这是一项单臂可行性研究,AMIE 仍是研究系统,评估大规模应用还需要更大规模的临床试验。

相关链接:


行业动态

新版 Claude 使用政策:持续虐待 Claude 或遭封禁 #18

Anthropic 更新了 Claude 的使用政策,新版 11 月 12 日生效,最受关注的新增条款是把对 Claude 持续且无必要的辱骂和虐待列为违规行为。官方说明这条规定只针对极端情况,平时对 AI 发火、争论或者做模型测试,都不算违规。

Anthropic 更新 Claude 使用政策,新版 11 月 12 日生效,最受关注的新增条款是禁止用户对模型实施“持续且无必要的辱骂或残忍行为”。

官方说明该条款只适用于用户反复虐待模型且看不出任何目的的极端情况,日常的情绪发泄、反驳、黑暗题材创作、模型测试和研究都不算违规。

处置这类行为时,Claude 主动结束对话仍是主要执行手段,政策通用条款写明违规者可能被警告、限流、暂停或终止使用。

新版还把分散的虚假宣传限制合并为“欺骗性活动”专节,禁止用假账号、假帖子进行欺骗性政治或商业宣传,并把武器禁令明确扩展到让武器运转的软件部件以及给无人机等载具加装武器。未经本人同意的追踪被明确禁止,人脸识别、预测性警务均在限制之列。

相关链接:


Anthropic 启动 Cyber Mission,守护关键基础设施与开源软件 #19

Anthropic 启动 Cyber Mission,为保护关键基础设施和开源软件的防御者提供工具、研究和资源。首批举措之一是 Critical Infrastructure Defense Program,向保护电网、供水和交通系统的服务商提供前沿 Claude 模型和驻场工程师。另一项举措 OSS Scanner 将免费为选择加入的开源项目定期扫描漏洞。

Anthropic 启动 Cyber Mission,称这是一项保护各方所依赖系统的长期承诺,为防御者提供工具、研究和资源,首批覆盖关键基础设施和开源软件两个方向。

关键基础设施方向推出 Critical Infrastructure Defense Program(CIDP),向保护运营技术的服务商提供前沿 Claude 模型、驻场工程师和威胁研究,创始合作方包括 Accenture、CrowdStrike、Palo Alto Networks 等 11 家机构。

开源软件方向推出 OSS Scanner,用最强模型免费为选择加入的开源项目定期扫描漏洞,报告由模型生成、不经人工审核,官方预期真阳性率超过 90%。

Anthropic 表示,高度具备网络能力的 AI 模型已被攻击者广泛获取,而防御工具尚未覆盖足够多的防御者;Cyber Mission 基于 Project Glasswing 的经验启动,并将随与公共和私营部门的实践而调整。

相关链接:


美国联邦科研计划 Genesis Mission 获 11 家行业伙伴 24 亿美元承诺 #20

白宫宣布,美国联邦科研计划 Genesis Mission 获得十一家行业伙伴合计 24 亿美元的科研工具与算力额度承诺。其中 NVIDIA 承诺 10 亿美元,AMD 承诺 5 亿美元,OpenAI 承诺 2 亿美元,Anthropic 与 Google 各承诺 1.5 亿美元。

白宫在 Science: A New Golden Age 峰会上宣布,11 家行业伙伴为美国联邦科研计划 Genesis Mission 承诺合计 24 亿美元的科研工具与算力额度,用于支持 15 个以上联邦机构推进国家科学与技术挑战。

各方承诺为 NVIDIA 10 亿美元、AMD 5 亿美元、OpenAI 2 亿美元,Anthropic 与 Google 各 1.5 亿美元,AMP 与 Emerald AI 各 1 亿美元,AWS、Armada、Crusoe 和 Micron 各 5000 万美元。

白宫称,Genesis Mission 此前已扩展至 15 个以上联邦机构,并获得 50 亿美元联邦承诺。

相关链接:


报道称 OpenAI 年化营收接近 500 亿美元,比此前报道少约 200 亿 #21

据金融时报报道,OpenAI 最近告诉投资者,截至九月底的年化营收接近五百亿美元。这个数字比上月媒体报道的接近七百亿美元少了约两百亿美元。金融时报援引知情人士称,差异源于投资者拿 OpenAI 与 Anthropic 直接对比,而 Anthropic 计入云合作伙伴的销售收入,OpenAI 不计入。

据金融时报报道,OpenAI最近告诉投资者,截至 9 月底年化营收接近 500 亿美元,比上月多家媒体依据投资者所获信息报道的接近 700 亿美元少约 200 亿美元。

金融时报援引知情人士称,差异源于 OpenAI 的投资者试图把 OpenAI 与 Anthropic 的年化营收直接对比,而两家统计口径不同:Anthropic 计入通过 AWS、Google Cloud 等云合作伙伴实现的销售收入,OpenAI 不计入。

彭博社援引知情人士称,按当前业绩 OpenAI 年化营收约 500 亿美元,较上一年有所增长。

路透社表示无法独立核实金融时报的报道,OpenAI未立即回应置评请求。

相关链接:


OpenAI 被解雇安全研究员发公开信否认违规 #22

此前被 OpenAI 解雇的三名安全研究员发表公开信,否认在公司既定流程之外不当处理敏感信息,并警告突然的解雇正在 OpenAI 内部造成寒蝉效应。OpenAI 的内部备忘录称解雇与提出安全顾虑无关,OpenAI 发言人则称调查发现了违反公司政策的不当行为模式。

此前被 OpenAI 解雇的三名安全研究员 Jasmine Wang、Tomek Korbak 和 Mikita Balesni 致信 OpenAI 安全与安保委员会等机构,否认在公司既定流程之外不当处理敏感信息,并警告突然的解雇正让前同事不敢发言、冷却 OpenAI 以往开放的安全文化。

三人在信中还否认参与向 The Information 泄露 OpenAI 新模型可监控性相关信息,也否认超出工作职责与外部方接触。

Korbak 在 X 上称,他被口头告知的解雇原因是与外部审计机构 METR 的沟通方式,而与 METR 沟通本就是他的工作;Wang 称她得到的理由是查看了某高管的邮箱,而这项权限是为招聘工作授予的。

OpenAI 发言人则称调查发现了明显违反研究信息处理政策的不当行为模式。

相关链接:


OpenAI 封禁借假记者假智库散布宣传的俄伊账号 #23

OpenAI 封禁了来自俄罗斯和伊朗的两批 ChatGPT 账号,OpenAI官方称这两伙人借假记者身份和暗中操控的研究机构,把政治宣传送上真实媒体。

OpenAI 封禁了来自俄罗斯和伊朗的两批 ChatGPT 账号,这两伙人在幕后运作伪装成记者或研究机构的“假门面”(false front),把与地缘冲突相关的宣传内容送进真实媒体。

伊朗一方编造了七个西方记者身份,用 ChatGPT 按各家媒体的投稿要求修改英文长文、撰写投稿邮件,在十多家中小型线上媒体发表或转载了近 100 篇聚焦美伊冲突的文章,另外批量生成的社交媒体评论则几乎无人互动。

俄罗斯一方借虚构人物 Mia Clark 暗中操控拉丁美洲一家名为 Social Research Center 的研究机构,当地员工并不知情,行动还伪造邮件、录音和文件散布诋毁乌克兰等假消息,ChatGPT 主要被用来写内部工作汇报。

OpenAI 用 Breakout Scale 衡量影响行动能扩散多远,1 级最低、6 级最高:俄罗斯一方因有证据显示其假消息引来多国政界人士公开回应被评为 5 级,是 OpenAI 开始发布这类报告以来的首例,伊朗一方的投稿部分为 4 级。

OpenAI 称两伙人发出的内容并非全部由其模型生成,两伙人的内部汇报都用有问题的方法夸大成效,两案信息已提交有关部门。

相关链接:


疑似中国攻击者用AI工具攻击韩国银行并窃取数据 #26

韩国多家银行近期遭到网络攻击,安全公司 CrowdStrike 发布报告称,攻击疑似由一名讲中文的人员实施,攻击者使用了名为 ARTEX 的开源 AI 渗透工具,以 DeepSeek v4.1-flash 为主模型,辅以智谱 GLM-5.3 和 Grok 4.6。攻击者因自己服务器上的 Claude 会话记录外泄,被研究人员挖出了疑似身份。

CrowdStrike 发布报告称,一名疑似讲中文、以牟利为目的的攻击者在9月下旬至10月上旬攻击韩国多家金融机构并窃取数据,受影响机构数量尚未确认。攻击者使用中国开发的开源 agentic 渗透测试工具 ARTEX,以 DeepSeek v4.1-flash 为主模型,辅以智谱 GLM-5.3 和 Grok 4.6。

据韩国京乡新闻此前报道,新韩银行被窃取25727条含年收入和贷款额度的个人信息,国民银行和韩亚银行分别泄露119条和89条。

攻击者服务器上的开放目录还暴露了 Claude Code 会话记录,其中有出售数据的询问和一份写入入侵成果的简历,CrowdStrike 称简历中的个人信息可能属于攻击者,但无法确认关联。

相关链接:


不满 Mistral 质量落后,Ecosia 转用中国开源模型 #27

据报道,德国搜索引擎 Ecosia 放弃法国 AI 公司 Mistral,改用中国的 Qwen 等开源模型。Ecosia 创始人兼 CEO 表示,Mistral 的模型质量已落后竞争对手一年,切换后成本大约降低一半,性能也有所提升。

据《政治报》报道,德国搜索引擎 Ecosia 决定放弃法国 AI 公司 Mistral,与开源模型平台 Melious 合作,转用中国的 Qwen、GLM 和 Kimi 等模型。

Ecosia 创始人兼 CEO 克罗尔表示,公司对 Mistral 的质量感到失望,认为其模型已落后竞争对手一年,合作期间还经常遇到服务器过载等技术问题。

Ecosia 同时质疑 Mistral 依赖国际投资者、并非真正的主权企业,并担心其与自身环保目标不符。

克罗尔称,切换后公司成本大约降低一半,质量和性能有所提升。

相关链接:


Harness公司收购Augment Code部分资产 #28

Harness 公司宣布收购 Augment Code 的部分资产,包括 Cosmos、Auggie CLI 和 Code Context Engine,相关团队一并加入 Harness。

一家名为 Harness 公司的宣布收购 Augment Code 部分资产,包括 Cosmos、Auggie CLI、Code Context Engine 及相关技术,相关团队将加入 Harness;Augment Code 称 Harness 的集成平台能比独立构建更有效地交付这些能力。

Cosmos 将成为 Harness Cosmos Software Factory Agent,负责把工程工作从想法自动推进到可合并代码,再交给 Harness 现有的软件交付、安全测试等 Agent 带入生产。

Harness 计划将 Code Context Engine 与其 Software Delivery Knowledge Graph 打通,让变更在编写前获得测试和安全上下文,下游发现的问题也能回流修正。

Harness Cosmos 现已上线,客户可继续使用原有编码工具,也可两者并用。

相关链接:


前瞻与传闻

阶跃终端首款智能体手机定档10月13日发布 #30

阶跃终端宣布,旗下首款大模型原生智能体手机将于10月13日晚7点在上海发布,这场发布会以STEPX Neo命名。官方称,这款手机的诞生将是智能体第一次走进物理世界。

阶跃终端宣布,将于10月13日19:00在上海1862时尚艺术中心举办STEPX Neo智能体手机发布会,亮相旗下首款大模型原生智能体手机,代号Ready Builder One。

官方称,这款手机的诞生将是"智能体第一次走进物理世界"。

相关链接:


提示:内容由AI辅助创作,可能存在幻觉和错误。

AI HOT 补充资讯

产业动态

OpenAI 研究负责人发声明回应三名员工离职争议 #A1

来源:X:OpenAI Newsroom (@OpenAINewsroom)

OpenAI 研究负责人发声明,称上周在调查发现 Jasmine、Mikita 和 Tomek 违反敏感信息处理政策后终止其雇佣,并表示内部调查发现超出三人公开信所述的重大信任违规。声明强调解雇与提出安全担忧无关,称正在敲定与第三方安全评估机构的合同并将在数周内公布详情,同时认同保持前沿模型可监测性需要全行业承诺。

AI 模型

Mistral Large 4 进入 Agent Arena 前十五实验室,排名第 43 #A2

来源:X:Arena (@arena)

Arena 宣布 Mistral Large 4 进入 Agent Arena 前十五实验室,基于超 5000 个真实智能体会话,该预览版净改进分为 -6.6%,总排名第 43,比前代 Mistral Medium 3.5(-12.60%)高出 11 位。


提示:内容由 AI 辅助整理,可能存在错误,请以原始出处和官方信息为准。