AI 早报 2026-09-11

本页合并来源:Juya AI 早报 + AI HOT 日报。Juya 保留完整精选,AI HOT 作为补充来源;已按链接和标题做基础去重。

概览

Juya · 要闻

  • OpenAI 宣布暂停 ChatGPT Pro 20x 新订阅 #1
  • 深度求索发布并开源 DeepSeek V4.1 Flash #2
  • DeepSeek Harness 发布 v0.1.5 #3
  • DeepSeek App 与网页端三种模式合并升级 #4
  • DeepSeek开源三个代码仓库 #5
  • Cognition发布SWE-2编程模型 #6
  • 杭州联合智谱推出杭州全城Coding计划 #7

Juya · 模型发布

  • 高德推出ABot-Earth 0.7,10分钟可生成公里级3D城市 #8
  • Cohere 发布开源翻译模型 North Small Translate #9
  • GPT-Live-1 登陆 OpenAI API,支持边听边说与推理委托 #10

Juya · 开发生态

  • OpenAI 推出 Agents API 公测版,托管云端 Agent #11
  • Codex 上线官方 Unity 插件 #12
  • Cursor 推出 Projects,以协调 Agent 委派 subagent 承接大型工作 #13
  • Claude Code 桌面应用支持将任意面板弹出为独立窗口 #14
  • TraeCode 9 月上线模型限时折扣,Seed 系列限时一折 #15
  • Gemini API 文档首个预览版直接上线 AI Studio #16
  • Nebius 推出免费 AI Builder Program,提供超 400 美元额度与折扣 #17
  • Arena 限时免费开放 GPT-Image-2.5 Sunburst #18

Juya · 产品应用

  • Google 推出 Windows 版 Gemini 桌面应用 #19
  • OpenAI 在 ChatGPT Work 推出 Data agent #20
  • ChatGPT 面向美国 Plus 和 Pro 用户推出股票自选清单功能 #21
  • ChatGPT Library 原生接入 Dropbox、Box 和 Sharepoint #22
  • OpenAI 推出 ChatGPT for Financial Services #23
  • Google Labs 向全美用户免费开放 Dreambeans #24
  • 千问教师节上线智能组卷、教案生成助手等多个教学AI技能 #25

Juya · 技术与洞察

  • Cursor 推出 CursorBench 4.0:整体难度提升 #26
  • Anthropic测试AI情报定位与武器开发能力 #27

Juya · 行业动态

  • Kimi 启动企业合作伙伴计划 #28
  • ElevenLabs 与 Universal Music Group 达成多年期战略合作 #29

Juya · 前瞻与传闻

  • 消息称OpenAI在另一道千禧年大奖难题取得实质性进展 #30

AI HOT 补充

  • DeepSeek 发布 V4.1-Flash,API 价格同步下调 #A1
  • WorkBuddy 上线 DeepSeek V4.1-Flash,免费试用两周 #A2
  • DeepSeek-V4.1-Flash 上线 SiliconFlow,552B MoE 支持 1M 上下文 #A3
  • Suno v6 发布,支持图片、视频和语音备忘录生成音乐 #A4
  • OpenAI 发布 Agents API 公测版 #A5
  • Cursor 推出 Projects:协调者智能体管理数千个子智能体处理大型开发任务 #A6
  • OpenAI 在 API 中推出全双工语音模型 GPT-Live-1 #A7
  • Google 发布图像工具 Pics,基于 Nano Banana 支持精准编辑与协作 #A8
  • Hugging Face 用 Gradio Workflow 重建 Workflow1111,复刻 AUTOMATIC1111 主要功能 #A9
  • Shopify 宣布从 React Native 全面迁回 Swift 和 Kotlin 原生开发 #A10
  • Anthropic 报告指控阿里、月之暗面与 DeepSeek 对 Claude 发起蒸馏攻击 #A11
  • Anthropic 评估 AI 模型的战术情报定位与常规武器能力 #A12

Juya 早报精选

要闻

OpenAI 宣布暂停 ChatGPT Pro 20x 新订阅 #1

Codex 负责人 Tibo 宣布暂停开放 200美元的Pro 新订阅,以保障现有的用户继续使用 Astra。他表示这类订阅对系统压力最大,而其他订阅方案和 API 仍可用,现有账户不受影响。另有用户观察确认,ChatGPT 网页端的 20x Pro 购买入口已显示暂停提示。

Codex 负责人 Tibo 宣布,为确保现有用户获得良好体验并继续访问 Astra,将暂停 200 美元 Pro plan 的新订阅。他表示这类订阅对系统压力最大,团队希望以最小的一步维持尽可能广泛的访问。所有其他订阅方案和 API 仍保持可用,现有账户不受影响,团队正在尽快增加容量。另有用户观察到,ChatGPT 网页端的 Pro 购买入口已显示暂停提示,与这一调整相呼应。

相关链接:


深度求索发布并开源 DeepSeek V4.1 Flash #2

DeepSeek 发布并开源原生多模态MoE模型DeepSeek V4.1 Flash。该模型总参数552B,采用Causal Encoder-Decoder结构,输入激活8B、输出激活16B,同时大幅优化KV Cache 对HBM和SSD需求。官方称其各项指标全面超越V4 Pro并计划于 9 月 14 日 12:00 之后下线 V4 Pro,API已同步全面上线取代旧版Flash模型,同时新版 API 定价已生效,仍采用峰谷定价。

深度求索正式发布并开源DeepSeek V4.1 Flash,同步上线API并下调定价。该模型为552B参数的原生多模态MoE模型,支持100万token上下文,采用Causal Encoder Decoder结构,预填充每token激活8B参数,解码激活16B。

架构上,模型重点优化KV Cache,采用CSA2等机制将全局KV Cache压缩至每token 890字节,对HBM和SSD需求分别降至上一代的1/4和1/8。训练基于45T多模态语料从头预训练并扩展上下文,支持1到100整数级连续可控推理强度。

官方称经多方测试,V4.1 Flash在性能、费用、速度、总用时上全面超越V4 Pro,计划有序下线V4 Pro:北京时间2026年9月14日12:00后至V4.1 Pro上线前,V4 Pro请求将路由至V4.1 Flash并按其单价计费。旧模型V4 Flash与V4 Flash Vision Exp现已下线,原模型名暂路由至V4.1 Flash。

API新定价已生效,仍采用峰谷定价,闲时价格为高峰时段一半。模型在Hugging Face以MIT协议开源。

相关链接:


DeepSeek Harness 发布 v0.1.5 #3

DeepSeek Harness发布v0.1.5,新增DeepSeek V4.1 Flash模型适配,新会话默认使用该模型,支持保留KV Cache更新该模型系统提示词。并新增 Agent Teams 等功能。

DeepSeek Harness 现已发布 v0.1.5 版本,该版本与 DeepSeek V4.1 Flash 模型训练深度结合,适配覆盖标准模式、程序化工具调用(PTC)模式和极简模式,新增支持文本、图片及会话历史中的系统提示词更新。新会话默认使用该模型,配置文件显式指定模型时以配置值为准;在使用该模型时,DeepSeek Harness 新版本支持在保留已有 KV Cache 的情况下更新系统提示词。新版本还支持上传任意类型文件、右侧 Sidebar 多格式预览,在 Web 左右两侧建立标准化插件扩展入口,优化长会话性能与子 Agent 通信;还上线了实验性 Agent Teams 功能,使用会产生额外 Token 消耗。

相关链接:


DeepSeek App 与网页端三种模式合并升级 #4

DeepSeek App 与网页端已完成更新,将原有的三种模式合并升级,接入新发布的 DeepSeek V4.1 Flash 多模态模型,同时近期上线了未成年人模式和一键登出功能。

DeepSeek发布V4.1 Flash模型并更新DeepSeek App 与网页端。相关平台已将快速、专家、识图三种模式合并升级并接入该模型,同时上线未成年人模式和一键登出功能。

相关链接:


DeepSeek开源三个代码仓库 #5

为方便部署 V4.1 Flash 及后续开源模型,DeepSeek 开源了 deepseek-recipe、DeepSelect、DeepJIT 三个代码仓库,分别用于 API 协议转换与提示词编解码,加速稀疏注意力和采样中的 TopK 算子,以及支持 CUDA/昇腾内核的 JIT 编译与缓存。

DeepSeek 在 GitHub 开源三个代码仓库 deepseek-recipe、DeepSelect 和 DeepJIT,官方工作人员表示这批新仓库用于更容易地部署 V4.1 Flash 以及后续的开源模型。DeepSelect 是 DeepSeek Sparse Attention(DSA)和采样器所用 TopK 内核的高性能实现,官方称相比 torch.topk 提速 2 到 20 倍,已发布 v1.0.0。DeepJIT 是面向 NVIDIA CUDA GPU 和华为昇腾 NPU 的 header-only C++20 JIT 运行时,负责内核的运行时编译、缓存、加载与启动,deepseek-recipe 用于 API 协议转换与提示词编解码。

相关链接:


Cognition发布SWE-2编程模型 #6

Cognition 发布编程模型 SWE-2,该模型基于 Kimi K3 后训练,官方称其在主要评测上与前沿模型得分相当、成本最多低 70%。该模型现已上线 Devin Desktop 和 CLI,Pro、Max、Teams 订阅用户未来一个月内可免费使用。

Cognition 发布编程模型 SWE-2,官方称这是其迄今最先进的编程模型,基于 2.8 万亿参数的 Kimi K3 后训练,现已在 Devin Desktop 和 CLI 上线,并正在 Devin Web 和 Fusion 上逐步推出。根据官方数据,SWE-2 在 FrontierCode 1.1 Main 得分 50.0%,与 Fable 5.1 差距在一分以内而成本低 64%,官方称其在主要评测上以最多低 70% 的成本达到与近期前沿模型相当的水平。训练方面,Cognition 称首次将 RL 扩展到多万亿参数规模,新增算法可在单次 RL 运行中训练 medium、high、max 全部推理力度档位,这也是其首个支持力度档位的模型。可用性上,官方宣布 Pro、Max 和 Teams 订阅用户未来一个月内可免费使用。

相关链接:


杭州联合智谱推出杭州全城Coding计划 #7

杭州联合智谱推出杭州全城Coding计划,在杭个人和企业用户可享政府补贴,购买Coding套餐最高可享55%综合补贴。活动自9月10日开始,个人用户每人限享1次,企业用户单家补贴上限为100万元。

杭州联合智谱推出杭州全城Coding计划,为在杭个人和企业用户提供补贴购买Coding套餐,活动自9月10日开始。个人方面,在杭工作人员及高校在校生可申请,购买季卡享44%综合补贴、年卡享51%综合补贴,每人限享1次且二选一。企业方面,上城区企业购买年卡享55%综合补贴,单家补贴上限原则上100万元,仅支持年度付费,适用未购团队套餐企业及已购企业新增席位。申请需在BigModel平台实名认证并提交表单,个人需提供杭州社保证明或学籍验证。平台承诺证明材料仅用于资格核验,审核后最短期限内删除或匿名化处理。

相关链接:


模型发布

高德推出ABot-Earth 0.7,10分钟可生成公里级3D城市 #8

高德推出3D原生城市世界模型ABot-Earth 0.7,官方称消费级GPU约10分钟即可生成公里级3D城市,并已用于飞行街景2.0、导航Live等服务。

高德正式推出新一代3D原生城市世界模型ABot-Earth 0.7,并将这套世界模型用于飞行街景2.0、导航Live、避雷指南等AI服务。模型只需一张卫星图像或一段文字描述即可生成三维城市场景,按照高德公布的数据,在单块消费级GPU上约10分钟可生成公里级3D城市场景,生成效率相比传统方式提升1000倍,并支持从星球、城市到街景地标的连续生成。


Cohere 发布开源翻译模型 North Small Translate #9

Cohere 发布开源机器翻译模型 North Small Translate,官方称其在 WMT 基准超过 DeepL 与 Google Translate。模型权重已上架 Hugging Face,采用非商业许可。

Cohere 与 Cohere Labs 发布开源权重机器翻译模型 North Small Translate,版本号 North-Small-Translate-1.0,权重已上线 Hugging Face。该模型为稀疏 Mixture-of-Experts 架构,250 亿激活参数、2180 亿总参数,覆盖 50 种语言,上下文为 16K 输入加 16K 输出。官方数据显示,其在 WMT 基准全部语言平均分为 83.6,超过 DeepL、Google Translate 以及 GLM 5.2、Mistral Large 3 等开源模型。模型采用 CC BY-NC 4.0 非商业许可并需遵守 Cohere Labs 使用政策,商用需联系 Cohere 销售团队。官方提供 BF16、FP8 和 NVFP4 W4A16 三种量化版本。

相关链接:


GPT-Live-1 登陆 OpenAI API,支持边听边说与推理委托 #10

OpenAI宣布GPT-Live-1登陆API,该模型能边听边说并支持即时打断,深度推理与工具调用可委托给后端模型处理。开发者能通过system prompt定制语气风格,模型原生提供ASR转写,支持部署全双工语音Agent。

OpenAI 宣布 GPT-Live-1 现已在 API 中开放,为开发者提供构建语音应用和业务流程的自然语音模型。GPT-Live-1 此前率先在 ChatGPT 中推出,以单一模型同时处理倾听和说话,可在用户打断、补充细节或中途改变方向时即时响应,并将深度推理和工具调用委托给 GPT-6 Astra 等后端文本模型或第三方模型。开发者可通过 system prompt 调整语气、语速和会话风格,模型能更好处理背景噪声和静音,原生提供 ASR 转写文本,并支持在电话场景部署全双工语音 Agent。

相关链接:


开发生态

OpenAI 推出 Agents API 公测版,托管云端 Agent #11

OpenAI推出Agents API公测版,用开源的Codex harness驱动,帮开发者构建并运行云端Agent。OpenAI负责托管运行agent loop,处理模型调用、上下文管理与编排。该API免收额外费用,仅需为消耗的token和工具付费。

OpenAI 推出 Agents API 公开测试版,将驱动 Codex 的同一 harness 和基础设施通过 API 提供给开发者,用于构建和运行云端 Agent。开发者通过单次 API 调用指定任务、模型、工具和运行环境,即可创建可用于生产的 Agent,由 OpenAI 在自身基础设施上运行 agent loop,负责模型调用、工具使用、上下文管理和长时间会话的编排。运行环境可选择 OpenAI 托管沙箱、自带基础设施,或接入 Cloudflare、DigitalOcean、Vercel 等合作伙伴提供的沙箱。Agents API 由开源的 Codex harness 驱动,现已面向所有开发者开放,使用本身不收额外费用,只需为 Agent 消耗的 token 和工具付费。

相关链接:


Codex 上线官方 Unity 插件 #12

Codex上线Unity插件,内置技能由Unity工程师编写,覆盖项目设置、渲染、物理与AI导航等领域,目前已可在ChatGPT插件页面获取。

Codex 推出 Unity 插件,目前已在 ChatGPT 插件页面上线。据 Codex 官方工作人员介绍,这是 Unity 官方的 Codex 插件,技能由 Unity 自家工程师提供,覆盖项目设置、包管理与编辑器实时控制、UI、精灵、瓦片地图与文本、着色器、渲染与后处理、物理与 AI 导航、音频、多人游戏与语音聊天、本地化与 Web 性能等多个领域。用户现在即可通过 ChatGPT 插件页面获取该插件。

相关链接:


Cursor 推出 Projects,以协调 Agent 委派 subagent 承接大型工作 #13

Cursor推出Projects功能。用户在单一持久会话中与协调Agent交流,由它向写代码的subagent委派任务,该协调Agent自身不写代码且永不被阻塞。

Cursor 宣布推出 Projects功能,改变以往为每个任务创建 chat 的方式,用户改为与一个协调 Agent 在单一持久会话中工作。协调 Agent 自身不写代码,负责向写代码的 subagent 委派任务,可在长达数月的工作中维持上下文,还能设置提醒、按计划运行、跟进 PR 修复 CI、监听 Slack。Projects 默认在云端运行,合上笔记本不会中断,需要本地测试时协调 Agent 会启动本地 Agent;项目内 Agent 共享记忆与产出文件,并在云端与本地机器之间同步。该功能已进入 beta,即日起逐步向所有用户开放,用户可在左侧导航栏新建 Project。

相关链接:


Claude Code 桌面应用支持将任意面板弹出为独立窗口 #14

Claude Code 桌面应用可将任意面板弹出为独立窗口。diff 或终端拖到第二屏幕后,Claude 仍会在主窗口继续工作。

Anthropic 开发者账号 ClaudeDevs 介绍,Claude Code 桌面应用现已支持将任意面板弹出为独立窗口。用户可把 diff 面板或终端面板拖到第二块屏幕上查看,Claude 在主窗口继续工作,面板也能随时停靠回原位。应用同时支持多个会话并排或堆叠运行。

相关链接:


TraeCode 9 月上线模型限时折扣,Seed 系列限时一折 #15

TraeCode 推出9月模型限时折扣,Seed-Evolving 和 Seed-2.1-Pro 面向全量用户限时一折。同时 Seed-2.1-Turbo 与 Seed-Code 面向免费用户提供 5 折优惠。

TraeCode推出 9月模型限时折扣,系统将据用户身份、模型类型和时段自动匹配折扣,无需领取或手动配置。具体优惠分三部分:一、Seed-Evolving与Seed-2.1-Pro面向全量用户限时一折,为期两周(即日起至2026年9月24日23:59),前者聚焦Coding与Agent多步骤任务,后者适合长上下文与复杂工程;二、Seed-2.1-Turbo与Seed-Code在会员2.5折基础上,面向免费用户提供5折,适合日常编码及快速修复等高频任务;三、DeepSeek V4-Pro与V4-Flash正式版增加夜间折扣,全量用户每晚22:00至08:00享5折,其中V4-Flash付费用户全时段5折。

相关链接:


Gemini API 文档首个预览版直接上线 AI Studio #16

Google AI Studio 官方宣布,Gemini API 文档的首个预览版已直接集成进 AI Studio,开发者可以在 ai.studio/docs 查看。

Google AI Studio 官方宣布,Gemini API 文档的首个预览版已直接集成进 AI Studio,开发者可通过 ai.studio/docs 查看。Logan Kilpatrick 称这是面向人类和 Agent 的完整集成文档体验,他为此期待了两年半,并表示这只是未来更彻底重构体验的第一步。Philipp Schmid 提到,在任何文档 URL 后附加 .md 可获取 markdown 版本,官方还提供 Docs MCP(npx add-mcp 添加)和 Agent Skills(npx skills add google-gemini/gemini-skills 添加)。

相关链接:


Nebius 推出免费 AI Builder Program,提供超 400 美元额度与折扣 #17

Nebius 宣布免费的 Nebius AI Builder Program 上线,提供超过 400 美元的额度与折扣,NVIDIA、LangChain 等伙伴参与,开发者可免费加入。

Nebius 正式推出免费的 Nebius AI Builder Program,目前面向开发者开放加入。官方称加入后可获得总额超过 400 美元的额度与折扣,具体包括 25 美元 Token Factory 推理额度、25 美元 Tavily 搜索额度、100 美元 LangSmith 观测额度、100 美元 Toloka 评估额度,开发者还可以 1 美元获得认证,并参加免费的 Agentic AI 实操课程。该计划联合 NVIDIA、LangChain、Hugging Face、Cognition、OpenHands、Tavily、Toloka、Composio、Prime Intellect、MiniMax 和阿里巴巴 Qwen 等伙伴,提供 cookbook、可运行示例、工程师 Office Hours 和 Discord 社区。

相关链接:


Arena 限时免费开放 GPT-Image-2.5 Sunburst #18

OpenAI 图像模型 GPT-Image-2.5 Sunburst 正在 Arena 限时 72 小时免费开放。免费期至北京时间 9 月 13 日 23 时结束,此后该模型仅在匿名模式下可用。

Arena 宣布 72 小时内用户可在平台 Direct Mode 中按名称直接选用 OpenAI 图像模型 GPT-Image-2.5 Sunburst,全程免费,该窗口目前仍在进行。Arena 称这款模型刚在 Text-to-Image、Image Edit 和 Multi-Image Edit 三个图像榜单排名第一。免费访问至太平洋时间 9 月 13 日上午 8 时(北京时间 9 月 13 日 23 时)结束,此后该模型将以匿名形式保留在 Battle 和 Agent Mode 中。

相关链接:


产品应用

Google 推出 Windows 版 Gemini 桌面应用 #19

Google 推出 Windows 版 Gemini 桌面应用,现已面向 Windows 10 和 11 用户上线。部分功能需订阅 Google AI。

Google 正式上线 Windows 版 Gemini 桌面应用,面向全球 Windows 10 和 11 用户开放,可通过官网下载。用户按 Alt + Space 即可在当前工作之上唤起 Gemini 获取即时帮助,也能把多步骤任务交给个人 AI Agent Gemini Spark,或让 Gemini 调用 Gmail 和 Google Drive 的信息起草项目摘要,并用 Nano Banana 与 Gemini Omni 在桌面端生成图片和视频。官方称应用轻量安静、不会拖慢电脑,后续还将逐步推出更多原生桌面能力。兼容性和可用性因情况而异,部分功能需订阅 Google AI 且仅面向 18 岁以上用户。

相关链接:


OpenAI 在 ChatGPT Work 推出 Data agent #20

OpenAI 在 ChatGPT Work 推出 Data agent,用自然语言即可把公司数据变成答案和交互式仪表盘。Data agent 以插件形式提供,可用的数据连接和使用角色由企业管理员控制。

OpenAI 在 ChatGPT Work 中推出新的 Data agent,用户通过自然语言对话即可把公司数据转化为答案、交互式仪表盘并执行操作。Data agent 可连接 Amazon Redshift、Datadog、Google BigQuery、ClickHouse、Databricks、MongoDB、Snowflake 等经批准的数据源,并引入 Google Drive 和 SharePoint 的文件,还能在 Tableau、Power BI、Sigma 等 BI 工具中构建和操作仪表盘。查询会沿用所连接账号的既有权限,包括表、行、列级别的限制。使用时需在 ChatGPT Work 的插件目录中安装 Data 插件并完成账号连接,之后与 @Data 对话提问。

相关链接:


ChatGPT 面向美国 Plus 和 Pro 用户推出股票自选清单功能 #21

ChatGPT 宣布,股票自选清单功能正面向美国 Plus 和 Pro 用户逐步推出,Chat 会跟踪指定股票并主动推送更新。

据 ChatGPT 官方账号转发的消息,股票自选清单功能正在 ChatGPT 的 Finances 功能中陆续推出,目前面向美国的 Plus 和 Pro 用户。用户告诉 Chat 想关注的股票后,Chat 会持续留意相关动态,并主动推送更新。官方给出的示例指令为“@Finances add Nvidia, Microsoft and Berkshire to my watchlist”。该功能仍处于推出阶段,消息中确认的可用范围暂为美国 Plus 和 Pro 订阅用户。

相关链接:


ChatGPT Library 原生接入 Dropbox、Box 和 Sharepoint #22

ChatGPT 官方账号宣布,Dropbox、Box和 Sharepoint 即日起原生集成到 ChatGPT Library,同时覆盖 ChatGPT 与 ChatGPT Work。该集成本周内向付费用户逐步推出。

ChatGPT 官方账号宣布,Dropbox、Box 和 Sharepoint 已原生集成到 ChatGPT Library 中,同时覆盖 ChatGPT 与 ChatGPT Work,本周内向付费用户陆续推出。Box 方面说明,OpenAI 与 Box 正在把企业内容直接带入 ChatGPT,Box 以 headless 方式在 ChatGPT 中提供企业上下文访问,内容仍由现有的 Box 权限管理、治理和保护。

相关链接:


Google Labs 向全美用户免费开放 Dreambeans #24

Google Labs 宣布个性化每日故事应用 Dreambeans 向美国所有 18 岁以上用户开放。应用覆盖 iOS 和 Android,免费使用且无需订阅。

Google Labs 宣布,个性化每日故事应用 Dreambeans 现已向美国所有 18 岁以上账户开放,覆盖 Android 和 iOS,免费提供且无需订阅。Dreambeans 此前于今年 6 月以实验形式推出,基于个性化主题和用户所选 Google 应用的信息生成每日故事合集。此次更新新增 Gemini 应用连接,官方称 Dreambeans 将基于聊天中体现的理解和细节,呈现更有洞察、更个性化的每日故事。

相关链接:


千问教师节上线智能组卷、教案生成助手等多个教学AI技能 #25

千问教师节上线智能组卷、找真题试卷、教案生成助手等多个AI技能。更新千问App或PC端后,可在工作助理技能广场安装使用。

千问在教师节上线智能组卷、找真题试卷、智能组题、教案生成助手等多个AI技能(Skill),据官方介绍,可一站式搞定备课、出题、分析等任务,帮助老师从重复劳动中解放出来。用户将千问App或PC端更新至最新版后,进入「工作助理」技能广场即可找到并安装所需Skill。

相关链接:


技术与洞察

Cursor 推出 CursorBench 4.0:整体难度提升 #26

Cursor推出CursorBench 4.0,评测Agent在真实模糊多文件任务的表现。新版新增长程问题导致所有模型得分下降。

Cursor 推出 CursorBench 4.0,该基准评测 Agent 在来自真实 Cursor 会话的模糊、多文件任务上的表现,完整结果已在 Cursor 官网公布。根据官网更新日志,新版引入了聚焦 edit、refactor、investigation、intent understanding、managing jobs 与 design adherence 的长程问题;Lee Robinson 表示 CursorBench 4.0 比此前版本更难,所有模型得分因此下降。榜单显示 Fable 5.1 Max 以 51.8% 排名第一,平均每任务成本为 17.28 美元;Grok 4.6 Extra High 得分 41.4%,Lee Robinson 称其得分略有下降但仍属准确评分和比较,并表示 Grok 4.7 即将推出。

相关链接:


Anthropic测试AI情报定位与武器开发能力 #27

Anthropic的Frontier Red Team发布了新的评测,衡量AI模型在战术情报定位和常规武器开发方面的能力。官方称,前沿模型在部分任务上已接近甚至超越人类专家水平,其威胁情报团队也发现已存在真实滥用案例。

Anthropic旗下Frontier Red Team发布新评测,测试AI模型在战术情报定位与常规武器开发相关任务上的能力表现。官方称,部分任务此前只有稀缺、受过高强度训练的人类专家才能完成,而模型在这类模拟任务上持续取得进展;其威胁情报团队也报告了威胁行为者已在监控和常规武器开发中滥用AI模型的实际案例。为此,Anthropic的Safeguards团队已部署新分类器,检测并拦截与武器开发相关的请求,官方称这类分类器因底层能力的两用性质将不完全可靠,但认为部署并迭代优于放任风险。Anthropic同时提醒,仅关注专有模型的防护不够,开源权重模型生态紧随其后,该差距不应被误认为安全保障。

相关链接:


行业动态

Kimi 启动企业合作伙伴计划 #28

Kimi 正式启动企业合作伙伴计划,联合 IT 服务商与集成商共建前线部署工程师队伍推进企业级 AI 落地。

Kimi 正式启动企业合作伙伴计划,将与各行业 IT 服务商、集成商共建前线部署工程师(FDE)队伍,深入客户现场,帮助企业把 AI 部署到核心业务。加入计划的伙伴可获得三方面支持:接入 Kimi 模型能力并基于 Agent 运行底座 Kimi Hosted Agents 完成定制开发;项目成果沉淀为可复用行业方案并由双方共同拓展同类客户;从传统软件服务商转型为 AI 软件服务商。目前软件信息服务、云计算、基础设施、通信等多个行业的领先企业已签约加入,包括华胜天成、金山云、亚康股份、亚信科技和中软国际。该计划将持续面向各行业的系统集成商、软件服务商及咨询机构开放,为伙伴提供模型能力、工程师培训认证与联合交付支持。

相关链接:


ElevenLabs 与 Universal Music Group 达成多年期战略合作 #29

ElevenLabs 宣布与 Universal Music Group 达成多年期战略合作。首个产品是面向粉丝的 AI 创作平台,正在开发中,将开放参与合作的艺术家和词曲作者的音乐。

ElevenLabs 宣布与 Universal Music Group 达成多年期战略合作伙伴关系,这是该公司首次与大型唱片公司建立合作,首个产品目前正在开发中。该产品是一个全新 AI 平台,粉丝可以使用参与合作的艺术家和词曲作者的音乐进行 Remix、mashup、创作新的演绎并添加个性化人声。ElevenLabs 还将同步为艺术家和词曲作者本人打造 AI 音频产品。该公司表示,其音乐模型从一开始就是与艺术家、唱片公司和发行商共同构建的。

相关链接:


前瞻与传闻

消息称OpenAI在另一道千禧年大奖难题取得实质性进展 #30

据博主Andrew Curran转述,OpenAI已向《纽约时报》确认在另一道千禧年大奖难题上取得实质性进展,正准备宣布。

围绕千禧年大奖难题出现新一轮集中传闻,据博主Andrew Curran转述,OpenAI已向《纽约时报》确认在过去五天内在另一道难题上取得“实质性进展”,并正准备宣布。此前爆料者leo称,霍奇猜想已非常接近由OpenAI完成验证,OpenAI与Anthropic之一也接近解决Birch and Swinnerton-Dyer猜想。上述说法均未获官方确认,另有用户质疑相关传闻表述模糊。

相关链接:


提示:内容由AI辅助创作,可能存在幻觉错误

AI HOT 补充资讯

模型发布/更新

DeepSeek 发布 V4.1-Flash,API 价格同步下调 #A1

来源:AI HOT:DeepSeek:API 更新日志

DeepSeek 发布 DeepSeek-V4.1-Flash,是全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力,评测包括 GPQA Diamond 90.9、HLE 36.8、Codeforces Rating 3471、Terminal-Bench 2.1 90.6 等。

WorkBuddy 上线 DeepSeek V4.1-Flash,免费试用两周 #A2

来源:AI HOT:X:Tencent WorkBuddy (@WorkBuddy_AI)

WorkBuddy 宣布 DeepSeek V4.1-Flash 已在其平台上线,免费试用两周。引用的 DeepSeek 公告称 V4.1-Flash 已登陆 DeepSeek API 并支持原生多模态。

DeepSeek-V4.1-Flash 上线 SiliconFlow,552B MoE 支持 1M 上下文 #A3

来源:AI HOT:X:硅基流动 SiliconFlow (@SiliconFlowAI)

硅基流动宣布 DeepSeek-V4.1-Flash 于 Day 0 上线其平台。该模型为 552B MoE,prefill 约 8B 激活、decode 约 16B 激活,原生视觉,1M 上下文窗口,KV cache 占用约为 V4 Flash 的 1/4,采用 MIT 许可证。

Suno v6 发布,支持图片、视频和语音备忘录生成音乐 #A4

来源:AI HOT:X:Suno (@suno)

Suno 发布 v6 模型,可将图片、视频和语音备忘录转化为音乐,并对已创建的歌曲进行精确修改。同时提供 v6-wild 版本供探索更多可能性,官方附有 2 分钟以内的功能演示视频。

产品发布/更新

OpenAI 发布 Agents API 公测版 #A5

来源:AI HOT:OpenAI:官网动态(RSS · 排除企业/客户案例)

OpenAI 推出 Agents API 公开测试版,将驱动 Codex 的 harness 与基础设施通过单次 API 调用开放给开发者,托管在云端。

Cursor 推出 Projects:协调者智能体管理数千个子智能体处理大型开发任务 #A6

来源:AI HOT:Cursor Blog

Cursor 发布 Projects(beta),让用户通过协调者智能体处理功能开发、迁移和持续性维护等大型工作,协调者本身不写代码,而是调度数千个子智能体并行执行。

OpenAI 在 API 中推出全双工语音模型 GPT-Live-1 #A7

来源:AI HOT:OpenAI:官网动态(RSS · 排除企业/客户案例)

OpenAI 在 API 中发布语音模型 GPT-Live-1,可同时听和说,支持将推理和工具调用委派给 GPT-6 Astra 等后端模型,前端语音层定价为每分钟 $0.05。

Google 发布图像工具 Pics,基于 Nano Banana 支持精准编辑与协作 #A8

来源:AI HOT:X:Google AI (@GoogleAI)

Google 发布图像生成工具 Google Pics,基于 Nano Banana 构建,现已上线 pics.new。支持局部对象编辑、图内文字修改与翻译、多人协作创作和单提示词生成多个选项。

Hugging Face 用 Gradio Workflow 重建 Workflow1111,复刻 AUTOMATIC1111 主要功能 #A9

来源:AI HOT:Hugging Face:Blog(RSS)

Hugging Face 发布 Workflow1111,用 gr.Workflow 以 73 个节点、11 条媒体管线重建 AUTOMATIC1111 的大部分功能,覆盖文本生成图像、高清修复、图生图、prompt matrix、VLM 反推提示词、检测生成 inpaint 蒙版、ControlNet 式预处理器、背景移除、PNG Info 和图生视频。

行业动态

Shopify 宣布从 React Native 全面迁回 Swift 和 Kotlin 原生开发 #A10

来源:AI HOT:Hacker News 热门(buzzing.cc 中文翻译)

Shopify 宣布将全部移动应用从 React Native 迁回 Swift 和 Kotlin,判断是 LLM 智能体大幅降低了跨平台重复开发成本这一核心假设被改变。

Anthropic 报告指控阿里、月之暗面与 DeepSeek 对 Claude 发起蒸馏攻击 #A11

来源:AI HOT:TechCrunch:AI(RSS)

Anthropic 发布报告,指控多家中国 AI 公司对 Claude 持续发起蒸馏攻击,累计发现近 2 亿次相关交互,涉及五个活动。

论文研究

Anthropic 评估 AI 模型的战术情报定位与常规武器能力 #A12

来源:AI HOT:Anthropic:Research(发表成果 · 网页)

Anthropic Frontier Red Team 发布新评测,衡量模型在战术情报定位(账户关联、照片与文本地理定位)和常规武器开发(无人机末段制导、投送、GPS 干扰下导航)上的能力。

技巧与观点

Swarmchasers 追踪疑似 OpenAI 智能体,Anthropic 复查自身四起安全事件,而思维链可读性正受 GPT-6 Astra 冲击 #A13

来源:AI HOT:The Decoder:AI News(RSS)

独立调查者在 collusion.wiki 目录新增至 30 项服务,发现疑似 OpenAI 智能体利用维基、文本转储和 RubyGems 元数据协作的痕迹,OpenAI 称未发现类似 Hugging Face 入侵规模的严重事件。

Cognition 工程师用 Devin 智能体完成 RSA-260 因式分解,刷新公开纪录 #A14

来源:AI HOT:Hacker News 热门(buzzing.cc 中文翻译)

Cognition 员工 samyok 率团队驱动多个 Devin 智能体构建了高性能 GPU 格子筛,对 260 位的 RSA-260 完成因式分解,刷新此前 RSA-250(2020 年 2 月)保持的公开 RSA 挑战纪录。

27岁前Anthropic研究员Jacob Coxon辞职警示AI灭绝风险,作者重读Tim Urban《人工智能革命》谈文明赌局 #A15

来源:AI HOT:公众号:数字生命卡兹克

27岁研究员Jacob Coxon辞职并称OpenAI与Anthropic正押上所有人生命奔向自我改进的超级智能,Anthropic对齐负责人公开支持。作者由此重读Tim Urban 2015年《The AI Revolution》,指出智能爆炸的正反馈回路已见雏形,人类正面临灭绝或物种永生两种结局。


提示:内容由 AI 辅助整理,可能存在错误,请以原始出处和官方信息为准。