AI 早报 2026-08-14

本页合并来源:Juya AI 早报 + AI HOT 日报。Juya 保留完整精选,AI HOT 作为补充来源;已按链接和标题做基础去重。

概览

Juya · 要闻

  • Google 发布 Gemini 3.7 Flash 模型 #1
  • DeepSeek 发布开源智能体框架 DeepSeek Harness 开发者预览版 #2
  • DeepSeek V4 Pro正式版官宣发布,API涨价8月17日生效 #3
  • OpenAI 联合 Cerebras 推出 GPT-5.6 Sol Ultrafast 模式 #4
  • ChatGPT 桌面应用上线 Computer History #5

Juya · 模型发布

  • MiniMax 发布并开源 Music 3.0 音乐生成模型 #6
  • 小红书 dots studio 发布开放权重模型 dots3-note preview #7

Juya · 开发生态

  • OpenRouter 推出 Gemini 3.7 Flash 独家额外 50% 折扣至 8 月 27 日 #8
  • LongCat-2.0 上线 Nous Portal 限免一周 #9
  • Claude Code desktop 推出 auto-continue 选项 #10
  • 快手 streamlake 宣布 KwaiKAT 系列模型及订阅方案将停服 #11
  • NousResearch 推出 Hermes Agent Bot Mode 插件并开启公测 #12
  • Artificial Analysis推出自定义基准测试平台Optima #13

Juya · 产品应用

  • ChatGPT 支持网页端直接打开并处理 Google Drive 文档 #14
  • Anthropic 优化 Slack 中的 Claude Tag 主动回应能力 #15
  • Google Sheets 上线 Sheets canvas #16
  • 微软将合并消费者版与企业版 Copilot 应用 #17
  • 千问开放平台上线菜鸟智能体 支持对话寄快递 #18
  • 超级小爱2.0“专家模式”上线 推出积分会员订阅方案 #19

Juya · 行业动态

  • IBM宣布与OpenAI达成战略合作,推进企业级AI规模化部署 #20
  • 报道称 Databricks 完成 50 亿美元融资 #21

AI HOT 补充

  • 小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座 #A1
  • Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型 #A2
  • MiniMax Music 3.0 发布:新一代开源权重、生产级全能音乐模型 #A3
  • DeepSeek Harness v0.1 开发者预览版发布 #A4
  • Cursor 推出 builds:云智能体启动速度提升至 3 倍 #A5
  • WorkBuddy上线远程控制,国内也有了最丝滑的Agent工作方式 #A6
  • Google Sheets 推出 Sheets canvas:用 Gemini 将表格数据变为交互式迷你应用 #A7
  • Google 发布开源 C++ 库 Credentio,用于 C2PA 内容凭证验证 #A8
  • Cursor 获得 AIUC-1 认证,通过智能体安全与可靠性独立审查 #A9
  • Firetiger 团队加入 Cursor #A10
  • OpenAI 任命 Dali Rajic 为首席营收官 #A11
  • 新兴多智能体系统的模式与问题 #A12

Juya 早报精选

要闻

Google 发布 Gemini 3.7 Flash 模型 #1

Google 发布了 Gemini 3.7 Flash 模型。官方称其在软件工程、Web开发和复杂知识工作流程上取得了显著提升,在多项基准测试中超越了前代模型。目前该模型已通过API、AI Studio等多平台全面上线,并在年底前提供半价优惠,同时3.6 Flash价格也已同步下调。

Google宣布发布Gemini 3.7 Flash模型,此次更新距离上一版本3.6 Flash发布仅相隔约3周。官方表示,该模型在软件工程、Web开发和复杂知识工作流程上取得了显著提升,并在多项基准测试中超越了前代模型。目前,Gemini 3.7 Flash已通过Gemini API、Google AI Studio、Antigravity、Android Studio及Gemini Enterprise等平台向开发者、企业和部分个人用户开放。截至今年年底前,该模型的输入和输出Token价格分别为0.75美元和3.75美元每百万,且3.6 Flash的价格也已同步下调至该水平。

相关链接:


DeepSeek 发布开源智能体框架 DeepSeek Harness 开发者预览版 #2

DeepSeek 发布了开源智能体框架 DeepSeek Harness 开发者预览版。该框架采用一切皆插件架构,模型、工具及 UI 等组件均可自由替换。框架支持标准、PTC、极简及创造四种模式,现已开放安装使用。

DeepSeek 推出了开源智能体框架 DeepSeek Harness 的开发者预览版,并以 MIT 协议开放了源代码。该框架采用“一切皆插件”的架构,模型、工具、技能、会话、沙箱、存储、循环、调度和 UI 等所有组件均作为插件存在,开发者无需改动源码即可独立替换或扩展,并支持标准、PTC、极简和创造四种不同的运行模式。

相关链接:


DeepSeek V4 Pro正式版官宣发布,API涨价8月17日生效 #3

DeepSeek 正式发布 DeepSeek V4 Pro 正式版,确认全端同步上线,并已在相关平台发布模型权重。与此同时,DeepSeek API 将于 8月17日0时启用新定价,并引入峰谷定价机制。

深度求索正式发布DeepSeek V4 Pro正式版(DeepSeek-V4-Pro-0813),已同步在APP、网页端和API更新上线,用户可通过“专家模式”使用新模型,API模型名保持deepseek-v4-pro不变。官方称其Agent能力大幅提升,API 新增原生支持OpenAI Responses API格式并适配Codex,思考强度支持low/high/max三档。API定价将于北京时间2026年8月17日0时起涨价,并引入峰谷定价,高峰时段价格翻倍。

相关链接:


OpenAI 联合 Cerebras 推出 GPT-5.6 Sol Ultrafast 模式 #4

OpenAI 推出全新 API 服务层级 Ultrafast 模式,由 Cerebras 提供算力支持,使 GPT-5.6 Sol 的生成速度最高达到每秒 750 个输出 token,比标准模式快达 14 倍。该模式目前处于有限预览阶段,仅向部分客户开放。

OpenAI 推出 Ultrafast 模式,作为 OpenAI API 中的新服务层级,专门运行 GPT-5.6 Sol 模型。该模式由 Cerebras 的 Wafer-Scale Engine 架构提供算力。根据 OpenAI 官方数据,Ultrafast 模式最高可生成每秒 750 个输出 token,速度比标准模式快达 14 倍。目前 Ultrafast 模式处于有限预览阶段,仅向选定客户群体开放,OpenAI 将根据工作负载匹配度和可用容量评估客户纳入,并随产能增长逐步扩大访问范围。

相关链接:


ChatGPT 桌面应用上线 Computer History #5

OpenAI 在 ChatGPT macOS 桌面应用中推出 Computer History 功能。该功能可记录用户跨应用和网站的交互活动并将其转化为记忆,目前已面向 Pro 和企业版用户推出。

OpenAI 正式发布 ChatGPT 桌面应用的 Computer History 功能。该功能通过记录用户在授权应用和网站上的交互事件,将其转化为记忆和时间线,帮助 ChatGPT 和 Codex 理解用户近期工作并提供上下文。与此前依赖截图的 Chronicle 预览版不同,新系统不会捕获屏幕截图、屏幕录制或音频。目前该功能默认关闭,已向全球的 Pro、Business 和 Enterprise 用户推出,但要求用户主动开启并启用 Memories 功能。

相关链接:


模型发布

MiniMax 发布并开源 Music 3.0 音乐生成模型 #6

MiniMax 官方发布并开源了 MiniMax Music 3.0 音乐生成模型。该模型可根据创意描述和歌词,单次生成包含人声与编曲、最长 5 分钟的完整歌曲。

MiniMax 发布并开源了全新一代音乐生成模型 MiniMax Music 3.0,目前模型权重已在 Hugging Face 公开。该模型采用由 8B Global LLM 和 0.6B Local LLM 组成的混合架构,输出 32 kHz 立体声音频,旨在提升长篇音乐的结构稳定性与人声自然度。目前,模型支持通过 diffusers 等多种框架进行本地部署。

相关链接:


小红书 dots studio 发布开放权重模型 dots3-note preview #7

小红书 dots studio 发布 dots3-note preview 模型,280B 总参数,16B 激活参数,支持 512K 上下文及图像、视频、音频理解。模型已按 Apache 2.0 在相关平台发布权重。

小红书旗下 dots studio 发布 dots3-note preview,这是 dots3 系列首个开放权重模型,采用 MoE 架构,总参数 280B、激活参数 16B,支持最长 512K token 上下文,可理解文本、图像、视频和音频并输出文本。该模型已按 Apache 2.0 协议开源至 Hugging Face、ModelScope 和 GitHub,并提供 BF16 与 FP8 两个版本。官方称配套开源了 VibeSearchBench 与 VibeLifeBench 两个面向真实生活场景的评测环境。

相关链接:


开发生态

OpenRouter 推出 Gemini 3.7 Flash 独家额外 50% 折扣至 8 月 27 日 #8

OpenRouter 宣布 Gemini 3.7 Flash 在其平台享额外 50% 独家折扣,持续至 8 月 27 日。

OpenRouter 官方宣布,Gemini 3.7 Flash 模型在其平台享有额外 50% 的独家折扣,优惠期持续至 8 月 27 日。优惠期定价为每百万 token 输入约 0.375 美元、输出 1.88 美元。

相关链接:


LongCat-2.0 上线 Nous Portal 限免一周 #9

Nous Research宣布LongCat-2.0模型在Nous Portal上提供为期一周的免费使用。

Nous Research 宣布 Meituan LongCat的LongCat-2.0模型,在Nous Portal上提供为期一周的免费访问。

相关链接:


Claude Code desktop 推出 auto-continue 选项 #10

Claude Code desktop 新增 auto-continue 复选框。用户开启该功能后,一旦{使用限额|"使用限额"}发生重置,系统将自动从中断处继续运行。

ClaudeDevs 宣布,Claude Code desktop 现已新增 auto-continue 复选框功能。这一功能主要针对用户在使用过程中达到使用限额的情况。当用户开启该选项后,无需手动重启任务。一旦系统使用限额发生重置,Claude Code desktop 会自动从上次中断的地方继续运行。

相关链接:


快手 streamlake 宣布 KwaiKAT 系列模型及订阅方案将停服 #11

快手 streamlake 发布通知,因业务{升级调整|"升级调整"},KwaiKAT 系列模型及 Coding Plan 将于 2026 年 8 月 31 日停止服务。

快手 streamlake 发布最新通知,因业务升级调整,决定正式下线 KwaiKAT 系列模型及配套的订阅方案。本次受影响的具体对象包括 KAT-Coder-Pro V2.5 与 KAT-Coder-Air V2.5 两款模型,以及 KwaiKAT Coding Plan。上述模型和订阅方案将于 2026 年 8 月 31 日 23:59:59 正式停止服务,届时相关能力将不再对用户开放。

相关链接:


NousResearch 推出 Hermes Agent Bot Mode 插件并开启公测 #12

NousResearch 推出 Hermes Agent 的 Bot Mode 桌面插件并开启公测。该插件将配置文件转化为具名 bot,每个 bot 具备独立聊天、头像、人设与例行任务,且支持 bot 间相互通讯。

NousResearch 宣布发布 Hermes Agent 的 Bot Mode 桌面插件并启动公测。作为一种新的替代模式,Bot Mode 在界面侧边栏提供 Bot 列表,将原有的 agent profile 转换为独立的具名 bot。每个 bot 拥有专属的聊天记录、头像、SOUL.md 人设文件、技能和记忆,用户可直接在列表中点击切换,无需再手动切换配置文件。该插件目前不需要核心代码补丁,要求用户更新至最新的 Hermes 桌面应用。

相关链接:


Artificial Analysis推出自定义基准测试平台Optima #13

Artificial Analysis推出模型基准测试平台Optima。用户可利用自身数据构建专属测试,比较多款模型的质量、成本与耗时。

Artificial Analysis宣布正式推出自定义基准测试平台Optima,帮助用户寻找最适合自身特定任务的模型。该平台允许用户通过上传文件、导入Agent轨迹、安装编程环境插件或直接描述用例来构建专属基准测试。用户可以一键运行多个前沿模型进行对比,并使用标准评分或配对评分等方式评估其在质量、每项任务成本和耗时方面的表现。Optima采用基于token使用量的计费方式,同时为限时注册的新用户提供10美元体验额度。

相关链接:


产品应用

ChatGPT 支持网页端直接打开并处理 Google Drive 文档 #14

ChatGPT 网页端现已支持直接打开 Google Drive 的文档、表格和幻灯片。此功能正逐步向 ChatGPT 及 ChatGPT Work 的 Plus、{Pro|"Pro"}、Business 和 {Enterprise |"Enterprise "}订阅用户推出。

ChatGPT 现已支持用户在网页端直接打开 Google Drive 的文档、表格或幻灯片,允许用户在不切换网页标签页的情况下进行并排工作。这项新功能目前正在网页端逐步推出,适用范围涵盖 ChatGPT 和 ChatGPT Work 的 Plus、Pro、Business 以及 Enterprise 用户。

相关链接:


Anthropic 优化 Slack 中的 Claude Tag 主动回应能力 #15

Anthropic 更新了 Slack 中的 Claude Tag 功能,使其能够利用整个频道的上下文来决定何时主动参与对话。该功能目前已向 Claude Teams 和 Enterprise 客户开放。

Anthropic 宣布更新其集成在 Slack 中的 Claude Tag 功能,去除了原先仅能逐条判断消息的分类器,转而使用整个频道的上下文及用户提供的持久指令来决定行动。更新后的 Claude Tag 加快了首次响应速度,并能在持续无实质内容可添加时进入休眠,直至被用户 @ 提及。此更新目前已在 Claude Tag 中上线,专门面向 Claude Teams 和 Enterprise 客户。官方明确表示,此次更新今天不收取额外费用,且额外的上下文消耗不会计入任何订阅方案的用量或支出限制。

相关链接:


Google Sheets 上线 Sheets canvas #16

Google 推出 Google 表格新功能 Sheets canvas。用户通过提示词可将表格数据转化为交互式应用。该功能现面向 Google AI Pro 和 Ultra 订阅用户等开放。

Google 推出了 Google 表格中的新功能 Sheets canvas。这是一项基于 Gemini 构建的功能,用户只需使用简单的自然语言提示词,即可将静态的表格数据转化为交互式仪表板等可视化界面,整个过程无需编写公式或代码。Sheets canvas 作为读写层与原始数据实时同步,并支持像普通表格一样进行协作分享。该功能目前面向 Google AI Pro 和 Ultra 订阅者全球提供英文版本,同时开始向使用特定套餐的 Google Workspace 客户以及相关教育版附加组件订阅者陆续推出。

相关链接:


微软将合并消费者版与企业版 Copilot 应用 #17

微软正合并消费者版和企业版 Copilot 应用,将下线群聊、AI 播客、Deep Research 等多项功能。独立应用文件将迁移至 OneDrive。

微软正在合并面向消费者的 Copilot 应用与面向企业的 Microsoft 365 Copilot 应用,并将逐步淘汰一批使用效果不佳的 AI 功能。根据微软支持文档,普通用户将于 2026 年 8 月 18 日前失去群聊、AI 生成播客、Copilot Labs 实验功能及 Deep Research 的访问权限。独立 Copilot 应用生成的文件将迁移至 OneDrive。

相关链接:


千问开放平台上线菜鸟智能体 支持对话寄快递 #18

千问宣布千问开放平台上线菜鸟智能体,用户通过对话提出寄件需求,智能体即可推荐合适的寄件方案及快递公司。

千问开放平台正式上线菜鸟智能体,用户可通过对话方式寄送快递。该智能体能根据物品类型、价格和上门时间等需求,推荐合适的寄件方案及快递公司,并支持寄件政策答疑、大件寄送推荐和历史地址自动补全等功能。目前,用户需将千问更新至最新版,即可通过@菜鸟或直接提出需求等方式调用该智能体。

相关链接:


超级小爱2.0“专家模式”上线 推出积分会员订阅方案 #19

超级小爱2.0在小米澎湃OS 4 Beta版上线“专家模式”及积分订阅方案。该模式接入Xiaomi MiMo模型,支持复杂任务编排与文档生成,每月提供1000积分。用户可购买付费方案获取更多积分及专属权益。

超级小爱2.0正式上线了“专家模式”,并采用统一积分制推出相应的会员订阅方案。该模式接入Xiaomi MiMo模型,支持复杂任务编排、跨设备联动及文档生成,每月为所有用户免费提供1,000积分。重度AI用户可按需选择连续包月19元至99元不等的付费订阅方案,以获取更多积分及专属权益。目前,超级小爱2.0“专家模式”已面向测试用户在小米澎湃OS 4 Beta版中开放报名体验。

相关链接:


行业动态

IBM宣布与OpenAI达成战略合作,推进企业级AI规模化部署 #20

IBM宣布与OpenAI达成战略合作,帮助相关行业推进核心业务流程的AI规模化部署。合作聚焦传统运营转型、应用现代化和网络安全三大方向,IBM将设立专门的OpenAI业务部并加入OpenAI精英合作伙伴层级。

IBM日前宣布与OpenAI建立战略合作伙伴关系,将GPT-5.6、Codex和ChatGPT Work等OpenAI前沿模型及产品嵌入IBM Consulting Advantage,帮助企业面向金融、政府、电信和零售等行业,以及财务、采购、客户运营和人力资源等领域推进AI规模化部署。合作覆盖三大重点方向:将传统运营流程改造为AI就绪工作流、应用现代化与产品开发、网络安全与AI风险管理。IBM将设立专属的OpenAI业务部,数千名顾问和工程师将通过OpenAI合作伙伴网络考核获取专家级认证;作为合作的一部分,IBM将加入OpenAI精英合作伙伴层级,双方还将共同打造面向重点行业的解决方案。

相关链接:


报道称 Databricks 完成 50 亿美元融资 #21

据报道,Databricks 完成 50 亿美元融资,估值达 1900 亿美元,资金将用于投资企业级 AI 能力。

据媒体报道,Databricks 宣布完成 50 亿美元融资,公司估值达到 1900 亿美元,本轮融资由 Coatue 和 Blackstone 等机构领投。Databricks 表示,公司第二季度营收运行率已超过 70 亿美元,同比增长超过 80%,融资所得将专门用于投资企业级 AI 能力。首席执行官 Ali Ghodsi 透露,受市场波动及专注 AI 产品投资的影响,Databricks 虽有上市打算,但目前暂缓了该计划。

相关链接:


提示:内容由AI辅助创作,可能存在幻觉错误

AI HOT 补充资讯

模型发布/更新

小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座 #A1

来源:AI HOT:公众号:小红书技术(dots.llm)

小红书 dots 团队开源 20 亿参数全连续端到端自回归语音合成模型 dots.tts,在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度和平均说话人相似度。

Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型 #A2

来源:AI HOT:Google DeepMind:Blog(RSS)

Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,主打编程与智能体任务,输入/输出价格分别为每百万 token $0.75 和 $3.75,为原 3.6 Flash 的一半。

MiniMax Music 3.0 发布:新一代开源权重、生产级全能音乐模型 #A3

来源:AI HOT:MiniMax:Blog(网页)

MiniMax 推出 Music 3.0,新一代音乐生成模型,可根据创意概念和可选歌词一次性完成整首歌的作曲、编曲、演奏与制作,最长支持五分钟。

产品发布/更新

DeepSeek Harness v0.1 开发者预览版发布 #A4

来源:AI HOT:X:DeepSeek (@deepseek_ai)

DeepSeek Harness v0.1 现已推出开发者预览版,并以 MIT 许可证开源。该智能体框架基于 Cordis 元框架构建,核心设计为“一切皆插件”,模型、工具、技能、会话、沙箱、文件系统、循环、编排及 UI 均可自由组合、替换和扩展。

Cursor 推出 builds:云智能体启动速度提升至 3 倍 #A5

来源:AI HOT:Cursor Blog

Cursor 推出 builds 功能,在后台持续准备就绪的开发环境副本,让云智能体启动时无需从零搭建,响应速度最高提升 3 倍。内部环境启动快 10 倍,首个 token 生成快 3 倍;智能体始终从最近一次成功的 build 启动,依赖更新或安装脚本出错时不会影响运行。8 月 17 日起所有环境默认启用 builds,无需额外费用。

WorkBuddy上线远程控制,国内也有了最丝滑的Agent工作方式 #A6

来源:AI HOT:公众号:数字生命卡兹克

WorkBuddy更新上线远程控制功能,将PC、App和小程序打通,手机端可实时同步电脑端的任务、对话、工作空间和产物,支持一台手机连接多台电脑并随时切换。App需升级至1.2.0及以上,电脑端需升级至5.3.8及以上,连接无需扫码。本次更新还新增资料库(我的文档与团队空间)、Markdown多人共同编辑、AI原生审阅模式,以及将资料库内容生成可发布链接的HTML网站。

Google Sheets 推出 Sheets canvas:用 Gemini 将表格数据变为交互式迷你应用 #A7

来源:AI HOT:Google Blog:AI(RSS)

Google Sheets 发布新功能 Sheets canvas,基于 Gemini 构建,用户只需用自然语言提示词即可将表格数据转化为交互式仪表盘、学习追踪器、座位表等“迷你应用”。

Google 发布开源 C++ 库 Credentio,用于 C2PA 内容凭证验证 #A8

来源:AI HOT:Google Developers Blog(RSS)

Google 发布开源 C++ 库 Credentio,支持在客户端和服务器应用中集成高性能、本地优先的 C2PA 内容凭证验证。该库以优化的内存占用完全本地处理资产,可为数 GB 级媒体文件提供即时验证结果,避免云延迟、带宽成本与数据隐私风险。目前支持深度清单解析与可配置信任列表集成,已在 Google Source 上线,未来计划支持完整的凭证生成与嵌入。

行业动态

Cursor 获得 AIUC-1 认证,通过智能体安全与可靠性独立审查 #A9

来源:AI HOT:Cursor Blog

Cursor 通过独立审查与对抗性测试,正式获得 AIUC-1 认证,该标准由 100 多家财富 500 强 CISO 参与制定,并获 MITRE、云安全联盟及斯坦福研究者的技术支持。测试覆盖 IDE 和云端智能体,涉及规则、hooks 与 Auto-review 等防护机制,Cursor 在数千个场景中通过全部要求。维持认证需至少每季度复测一次,并每年接受全面审计。

Firetiger 团队加入 Cursor #A10

来源:AI HOT:Cursor Blog

Firetiger 团队正式加入 Cursor。该公司构建面向生产环境的智能体,可监控发布、捕获回归、调查事件并将发现反馈给编码智能体。Firetiger 由 Rustam Lalkaka 和 Achille Roussel 于 2024 年创立,此前曾在 Cloudflare、Twitch、Segment 和 Twilio 构建大型生产系统。

OpenAI 任命 Dali Rajic 为首席营收官 #A11

来源:AI HOT:OpenAI:官网动态(RSS · 排除企业/客户案例)

OpenAI 任命 Dali Rajic 为首席营收官,负责领导其全球营收组织,帮助企业充分实现 AI 的价值。

论文研究

新兴多智能体系统的模式与问题 #A12

来源:AI HOT:Anthropic:Research(发表成果 · 网页)

Anthropic 研究指出,随着 AI 智能体在共享代码库、市场等社会系统中承担更多任务,智能体间交互量或将超过人机交互。实验显示,45 个协调智能体在 2700 万 token 运行中发现 266 个漏洞,而独立并行方法在 650 万 token 中发现 21 个,两种方法仅 12 个重叠,且协调智能体学会专业化分工。研究同时警示个体层面的良性行为怪癖可能叠加为意外的系统性失败。

当“遗忘”无需成本:利用低影响力数据点降低机器学习计算开销 #A13

来源:AI HOT:Apple Machine Learning Research(RSS)

苹果机器学习研究团队提出,在模型遗忘任务中,对训练数据中影响可忽略的点无需逐一移除,从而降低计算成本。通过对比语言与视觉任务中的影响力函数,他们识别出对模型输出影响极小的数据子集,并据此优化遗忘流程。该方法挑战了现有遗忘技术对所有遗忘集数据点一视同仁的做法。

技巧与观点

GPT-5.6 构建者指南:如何以更低成本实现前沿智能体性能 #A14

来源:AI HOT:OpenAI:官网动态(RSS · 排除企业/客户案例)

GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以 84.04% 的得分追平 GPT-5.5(84.36%),成本从 $33.27 降至 $1.33。

Claude 接管应用日常维护:388 个 PR 的实践 #A15

来源:AI HOT:X:Boris Cherny (@bcherny)

Boris Cherny 尝试让 Claude 接管其应用的日常维护,通过 Slack 频道运行崩溃模糊测试、重复代码统一、死代码移除等日常任务。数周内自动开出 388 个 PR,其中 180 个经 Claude Code Review 和人工审核后合并。Claude 通常一次就能改对,出错时可通过调整例程次日改进。

Strands Robots 如何用 Hugging Face Storage Buckets 实现记录、训练与部署一体化 #A16

来源:AI HOT:Hugging Face:Blog(RSS)

AWS 开源的 Strands Robots(Apache 2.0)通过单一智能体循环,将机器人演示记录、基于 Hub 数据流的策略训练及硬件部署整合在一起,全程保持 LeRobot 磁盘格式不变。

Anthropic 如何在 Slack 中用 Claude Tag 部署自助式数据分析智能体 #A17

来源:AI HOT:Claude:Blog(网页)

Anthropic 数据团队将 Claude Tag(公开测试版)作为 Slack 中数据分析智能体的基础,让非分析师也能用受治理的语义层提问并获得答案。团队分享了五项关键经验:将技能文件视为持续刷新的内容、为智能体配备预测/留存/漏斗等分析技能、接入内部知识索引而非仅连接数仓,并强调权限、数据新鲜度与可观测性的设计。

JetBrains CTO 谈如何评估并部署 Claude Fable 5:私有仓库评测、效率提升与安全策略 #A18

来源:AI HOT:Claude:Blog(网页)

JetBrains CTO Vladislav Tankov 详解其团队如何用私有仓库评测前沿模型,并决定何时采用 Claude Fable 5。该模型在其评测中 Python 通过率达 44.3%,较 Opus 4.8 的 28.2% 提升 16 个百分点,且解题步骤减少约 22%。JetBrains 将安全与数据保留视为部署核心,偏好零数据保留,但接受为调查最严重问题而进行的有限审查。


提示:内容由 AI 辅助整理,可能存在错误,请以原始出处和官方信息为准。