2026-07-25
AI 早报 2026-07-25

本页合并来源:Juya AI 早报 + AI HOT 日报。Juya 保留完整精选,AI HOT 作为补充来源;已按链接和标题做基础去重。
概览
Juya · 要闻
- Anthropic 发布 Claude Opus 5,以一半价格提供接近 Fable 5 的前沿智能 ↗
#1 - NVIDIA、Meta和微软等公司联名呼吁美政府勿对开放权重AI设限 ↗
#2 - Kimi 在 Kimi Code Plan 新增 k3-256k 模型ID ↗
#3
Juya · 模型发布
- Sakana AI 发布 Fugu-Ultra v1.1 及兼容 Claude Code 的接口 ↗
#4 - Midjourney 推出 V8.2 模型以提升图像质量与个性化能力 ↗
#5 - SANA-Video 2.0 发布:涵盖 5B 与 14B 规格,效率大幅提升 ↗
#6 - Swiss AI Initiative 发布完全开源多模态模型 Apertus 1.5 ↗
#7
Juya · 开发生态
- Ollama 扩充云端算力并暂停 Max 方案新订阅 ↗
#8 - OpenRouter推出Classifiers功能,结构化分类标记推理生成 ↗
#9 - Perplexity 官方发布 Perplexity CLI ↗
#10
Juya · 产品应用
- OpenAI为ChatGPT Work agent上线云浏览器登录功能 ↗
#11 - ChatGPT 网页版开放宠物分享功能 ↗
#12 - SpaceXAI推出Grok for Google Workspace插件 ↗
#13 - TRAE Work 升级内置 Seedream 及 Seedance 模型,免费开放生图生视频 ↗
#14 - 智谱清言PC客户端正式上线 ↗
#15 - Notion 开启“Notion as code”beta 测试 ↗
#16
Juya · 技术与洞察
- Anthropic 更新上下文工程指南并推出配置优化命令 ↗
#17 - Anthropic 发布 Claude 模型选择指南:详述 Mythos 至 Haiku 四大级别 ↗
#18 - Anthropic 设计师分享 Claude Design 使用方法与最佳实践 ↗
#19 - Anthropic 发布 Drone-Bench 评估 AI 无人机控制能力 ↗
#20 - Google发布首份ATLAS报告:揭示超150国AI实际使用情况 ↗
#21
Juya · 前瞻与传闻
- Elon Musk 称 Grok 4.6 及 4.7 将在四周内相继发布 ↗
#22 - 消息称 Stripe 正洽谈收购 OpenRouter,交易仍存在破裂可能 ↗
#23 - 腾讯合并大语言模型和多模态团队成立基础模型部 ↗
#24
AI HOT 补充
- Anthropic 发布 Claude Opus 5 ↗
#A1 - 蚂蚁百灵发布Ling-3.0-flash原生混合推理模型 ↗
#A2 - FLUX 3 x mimic:新一代视频动作模型 ↗
#A3 - Midjourney V8.2 发布:专注美学提升与个性化理解 ↗
#A4 - Black Forest Labs 发布 FLUX 3 多模态模型,支持单次生成 20 秒视频与原生音频 ↗
#A5 - Runway Agent 推出自然语言工作流功能 ↗
#A6 - 百度搭子更新:电脑手机接力、桌面端内嵌浏览器上线,复杂任务可跨端连续执行 ↗
#A7 - OpenRouter 推出 Classifiers 测试版:自动标记 AI 请求的用途与成本归属 ↗
#A8 - Claude Code v2.1.219 发布:新增 Claude Opus 5,支持 1M 上下文与嵌套子智能体 ↗
#A9 - 英伟达、微软和Meta联合警告:应避免对开放权重模型过度监管 ↗
#A10 - 微软阐述开源模型助力美国竞争力路径 ↗
#A11 - Kimi K3 在网络安全漏洞利用测试中大幅落后美国前沿模型,知识蒸馏或为原因 ↗
#A12
Juya 早报精选
要闻
Anthropic 发布 Claude Opus 5,以一半价格提供接近 Fable 5 的前沿智能 #1
Anthropic 正式发布 Claude Opus 5 模型,官方称其性能较前代 Opus 4.8 有显著跃升,在编程和{知识工作|"知识工作"}等多项评测中达到最新领先水平,同时价格较前代保持不变,以一半价格提供接近 Fable 5 的前沿智能。目前该模型已在官方和各类第三方平台上线。
Anthropic 正式发布 Claude Opus 5 模型。已在 Claude Max、Claude Pro 订阅和 Claude API 等平台上线,上下文窗口保持 100 万 token,最大输出 token 数为 12.8 万,定价与 Opus 4.8 相同,为每百万输入 token 5 美元、输出 token 25 美元。官方称 Opus 5 是一次显著升级,在编程和知识工作评测上达到最新领先水平,并以一半价格提供接近 Fable 5 的前沿智能。新模型支持完整的 Effort 推理档位,包括最高档 max,思考模式默认开启,同时推出了对话中途更换工具而不清空缓存、自动安全降级等 beta 功能。在安全方面,Opus 5 被官方称为对齐程度最高的模型,其安全分类器拦截频率比 Fable 5 低约 85%,并在生物领域为科研场景放宽了部分限制。


相关链接:
- https://www.anthropic.com/news/claude-opus-5
- https://www.anthropic.com/claude-opus-5-system-card
- https://platform.claude.com/docs/en/about-claude/models/whats-new-opus-5
NVIDIA、Meta和微软等公司联名呼吁美政府勿对开放权重AI设限 #2
NVIDIA、Meta和微软等多家公司联合签署公开信,呼吁美国政策制定者避免对开放权重AI模型施加过早的限制。信中指出,开放权重模型能促进行业参与并增强网络安全,合法的蒸馏技术不应与不当行为混为一谈。签署方还包括IBM、Mistral和Hugging Face等,OpenAI和Anthropic未参与签署。
包括Nvidia、Meta、微软、Mistral和Hugging Face在内的多家公司签署了一封公开信,敦促美国政策制定者避免对开放权重AI模型实施广泛的限制。公开信认为,开放权重模型能扩大对AI经济的参与、加强竞争,并通过让网络防御者获得先进能力来增强安全。信中还将蒸馏技术区分为一种合法的技术,与应通过针对性法律框架处理的不当行为分开。签署方包括Andreessen Horowitz、IBM、Palantir等,OpenAI和Anthropic不在其中。


相关链接:
- https://www.microsoft.com/en-us/corporate-responsibility/topics/open-weight/
- https://x.com/JensenHuang/status/2080643682408321103
Kimi 在 Kimi Code Plan 新增 k3-256k 模型ID #3
Kimi 官方宣布 Kimi Code Plan 新增 k3-256k 模型ID。该模型适用于日常开发,额度消耗约为 k3 的一半,但不支持视频输入。
Kimi Code Plan 宣布新增 k3-256k 模型ID,旨在应对用户反馈的额度消耗较快问题。官方数据显示,约 90% 的请求上下文长度未超过 256K,针对此类请求使用 k3-256k 模型的消耗仅约为 k3 模型的一半。k3-256k 适用于日常问答、代码补全和常规功能开发,但不支持视频输入;涉及大型代码库分析、超长文档或视频输入时仍建议使用 k3 模型。在模型切换方面,从 k3-256k 直接切换至 k3 不会影响缓存,但从 k3 切换至 k3-256k 前建议手动执行 compact 命令压缩上下文,避免因包含视频文件等原因报错。

相关链接:
模型发布
Sakana AI 发布 Fugu-Ultra v1.1 及兼容 Claude Code 的接口 #4
Sakana AI发布Fugu-Ultra v{1.1|一点一}多模型编排引擎。新版本可动态协调多款前沿模型,在编程、智能体任务和高级推理基准上全面提升,并新增Claude Code兼容接口。
Sakana AI 宣布推出最新版本的多模型编排引擎 Fugu-Ultra v1.1,并同步发布兼容 Claude Code 的接口。Fugu-Ultra v1.1 通过动态编排前沿模型,在编码、Agentic 任务和高级推理方面展现出更强能力。官方数据显示,该版本较 v1.0 性能最高提升 7.9 分,其中在ProgramBench和Terminal Bench 2.1上的表现尤为突出,在未使用 Fable 5 模型的情况下于复杂任务中表现领先。升级后的系统进一步增强了复杂编程、智能体任务和高级推理能力,价格则维持与上一版本相同。此外,新的 Claude Code 接口允许开发者直接在终端内调用 Fugu 的多模型协作能力。

相关链接:
Midjourney 推出 V8.2 模型以提升图像质量与个性化能力 #5
Midjourney 正式发布 V8.2 图像模型。官方称,更新重点提升图像美学、质量与个性化体验,目前模型已上线可用。
Midjourney 官方博客宣布正式发布 V8.2 图像模型,目前该模型已上线可用。官方表示,为提升用户的创作体验,此次更新重点聚焦于图像的美学表现、整体质量以及个性化功能。根据官方说明,新版生成的图像预期将更具创意、大胆、成熟、前卫和新鲜,且随机出现低质量图像的情况会大幅减少。在个性化能力上,V8.2 能更好地理解用户偏好,尤其是积累了大量评分数据的用户,同时为创建个性化配置文件提供了更大且更完善的图像池。

相关链接:
SANA-Video 2.0 发布:涵盖 5B 与 14B 规格,效率大幅提升 #6
NVIDIA发布SANA-Video 2.0视频生成模型,包含5B和14B规模。该模型采用混合Linear-Softmax Attention架构从零训练,经Sol-Engine优化,比其他开源视频生成模型生成速度更快。
NVIDIA Research 团队发布了 SANA-Video 2.0 视频视频生成模型,提供 5B 和 14B 两种规模。该模型采用混合 Linear-Softmax Attention 架构,并从零开始训练。在性能表现上,官方数据显示其 VBench 总分为 84.30,5B 模型结合 Sol-Engine 优化后,在单张 H100 上仅需 13.06 秒即可生成 5 秒的 720p 视频。根据团队公布的数据,在同等单张 H100 设置下,其速度比 Wan 2.2-A14B 快 120 倍。

相关链接:
Swiss AI Initiative 发布完全开源多模态模型 Apertus 1.5 #7
瑞士国家人工智能研究所首个倡议项目 Swiss AI Initiative 发布 Apertus 1.5 多模态语言模型,含 8B 与 70B 两版,支持图像、音频及文本输入。
由苏黎世联邦理工学院 AI 中心和洛桑联邦理工学院 AI 中心合作发起的 Swiss AI Initiative 发布了 Apertus 1.5 系列 8B 和 70B 参数语言模型。该系列在 Apertus 1.0 基础上继续预训练,分别为 8B 模型新增 4T token 多模态数据、为 70B 模型新增 2T token,首次支持图像、音频和文本输入并输出文本,默认上下文长度为 262,144 个 token。模型采用完全开放策略,提供开放权重、开放数据、开放训练细节,并首次引入可选的"思考模式"以增强推理能力。官方表示完整技术报告将在未来几周内公布。

相关链接:
开发生态
Ollama 扩充云端算力并暂停 Max 方案新订阅 #8
Ollama宣布因需求激增,Ollama正扩充云端算力来迎接下周上线的超大模型。为保障系统响应速度,Ollama暂时停止了Max订阅方案的新用户订阅。
Ollama 官方表示,近期云端对 GLM-5.2 等前沿开源模型的需求激增,公司正在扩充容量以迎接下周上线的超大型模型。为确保基础设施的响应速度,Ollama 暂时停止了 Max 订阅方案的新增订阅。此次暂停不影响现有的 Max 订阅用户,且 Pro 订阅方案仍可正常购买。

相关链接:
OpenRouter推出Classifiers功能,结构化分类标记推理生成 #9
OpenRouter推出Classifiers功能公测。该功能可对推理生成按任务类型、部门等维度进行分类标记,帮助追踪Agent行为与成本。
OpenRouter正式推出Classifiers功能,目前处于公测版。用户可在工作区中为每次推理生成添加结构化元数据标签,按任务类型、部门、Agent复杂度等维度进行分类。分类器由四部分组成:最多8个维度的分类体系、分类提示词、分类模型和采样率,并提供6个预设模板。分类在每次请求完成后异步运行,不增加推理路径延迟,即使在输入输出日志记录关闭时仍可工作。结果写入日志并可在Activity Explorer中按维度分组查看,用户可在工作区设置中创建分类器。

相关链接:
Perplexity 官方发布 Perplexity CLI #10
Perplexity 官方正式发布 Perplexity CLI ,能赋予编码 Agent 实时搜索网络与抓取网页内容的能力。
Perplexity 官方宣布其命令行工具 Perplexity CLI(pplx)正式上线,旨在赋予编码 Agent 网络搜索与内容抓取能力。开发者可通过 pplx search web 命令进行实时网络搜索,或使用 pplx content fetch 命令获取指定网页的文本内容。

相关链接:
- https://x.com/perplexity_ai/status/2080759011809407379
- https://github.com/perplexityai/api-platform-developers/blob/main/skills/pplx-cli/SKILL.md
产品应用
OpenAI为ChatGPT Work agent上线云浏览器登录功能 #11
OpenAI 宣布,ChatGPT Work agent 现已支持通过云浏览器登录需要认证的网站,登录状态可跨会话持久保持。目前用户只能在ChatGPT.com上接管云浏览器,且暂不支持passkey登录。
OpenAI Developers官方账号宣布,ChatGPT Work agent现已支持访问需要登录的网站。用户可以接管云浏览器手动登录,随后交由agent继续执行任务,登录状态会在会话间保持,用户只需登录一次。据OpenAI团队成员James Sun介绍,目前云浏览器接管功能仅限ChatGPT.com网页端使用,移动端体验后续将得到改善。该功能暂不支持passkey登录方式,用户需要使用其他方式完成登录。

相关链接:
ChatGPT 网页版开放宠物分享功能 #12
OpenAI Developers 宣布 ChatGPT 网页版的自定义宠物现已支持分享与领养,用户可生成分享链接发送给朋友领养,也可下载导入桌面客户端。
ChatGPT 网页版的自定义宠物现已支持分享和领养功能。用户在 ChatGPT 网页版创建自定义宠物后,前往个性化设置页面选择"复制链接"即可生成可分享链接,将链接发送给朋友后对方即可领养该宠物。官方表示宠物分享功能目前仅在网页版提供,用户还可以下载将自定义宠物添加到桌面客户端。

相关链接:
SpaceXAI推出Grok for Google Workspace插件 #13
SpaceXAI推出Grok for Google Workspace插件。用户安装后,可在Sheets、Slides和Docs的侧边栏直接使用Grok分析数据、生成幻灯片与撰写文档。
SpaceXAI正式推出Grok for Google Workspace插件,用户可从Google Workspace Marketplace免费获取,一次安装即可覆盖Sheets、Slides和Docs。该插件以侧边栏形式在文件旁打开,在Sheets中支持读取选定范围并给出带有单元格引用的解答,在Slides中可根据大纲生成匹配现有主题的可编辑幻灯片,在Docs中能将粗略笔记转为带真实标题和列表的结构化草稿。
相关链接:
TRAE Work 升级内置 Seedream 及 Seedance 模型,免费开放生图生视频 #14
TRAE Work 宣布,正式升级并内置 Seedream {5.0|五点零} 与 Seedance 系列模型。目前,该生图与生视频能力已面向所有用户免费开放,付费会员可享更高的排队优先级。
TRAE Work 宣布,TRAE Work 正式升级并内置了 Seedream 5.0 与 Seedance 系列模型。用户无需挑选模型或进行参数配置,只需通过自然语言即可在工作流中直接生成可用的图片和视频。目前,该功能已在中国版 Work 模式的桌面端与网页端上线,面向所有用户免费开放。能力涵盖文生图、文生视频和图生视频,视频支持多种时长、比例与默认 720P 分辨率。在高峰期可能需要排队或限制使用频次,付费会员可享更高的排队优先级。

相关链接:
智谱清言PC客户端正式上线 #15
智谱宣布智谱清言PC客户端上线。该客户端整合Chat与AgentMore,支持挂载本地文件夹,供AI进行实时同步与跨文件联合分析。
智谱宣布智谱清言PC客户端正式上线,用户可于官网下载。该客户端集成了Chat与AgentMore双核能力,支持一键切换且上下文无缝流转。其核心功能是支持挂载本地文件夹,使AI常驻工作目录,实时感知文件变化并进行跨文件联合分析。挂载机制支持单Agent多文件夹及多Agent并发挂载。同时,AI实施“只读不写”策略,保障本地敏感文件的安全。

相关链接:
Notion 开启“Notion as code”beta 测试 #16
Notion 发布“Notion as code”功能。该功能允许用户使用 TypeScript 定义整个工作区,通过 API 部署并支持 Git 版本控制,官方称目前仍在开发中,用户可以申请加入测试。
Notion 发布“Notion as code”功能,现已进入 beta 测试阶段。该功能允许用户使用 TypeScript 代码来定义整个 Notion 工作区,包括团队空间、数据库以及自定义 Agent。用户可以通过 API 部署这些设置,利用编码 Agent 构建工作区,并将配置纳入 Git 进行版本控制,从而在不同环境或工作区复用。目前,用户可以申请加入该 beta 测试,官方表示仍在继续推进该功能的开发工作。

相关链接:
技术与洞察
Anthropic 更新上下文工程指南并推出配置优化命令 #17
Claude Code 开发者 Thariq 发文,介绍其团队已为最新模型移除超 80% 的 Claude Code 系统提示词且无性能损失,并推出{ claude doctor 命令|" claude doctor 命令"}协助用户精简配置。
Anthropic 开发团队成员 Thariq 表示,针对 Claude Opus 5 和 Claude Fable 5 等最新模型,团队移除了超过 80% 的 Claude Code 系统提示词。官方评估显示,该精简操作未造成可衡量的性能损失,团队发现新模型在减少过度约束后能更好地运用自身判断力。目前,官方已在 Claude Code 中推出 claude doctor 命令,帮助用户自动精简和调整上下文配置,开发者使用 /doctor 命令即可优化 Skills 与 CLAUDE.md 文件。
相关链接:
Anthropic 发布 Claude 模型选择指南:详述 Mythos 至 Haiku 四大级别 #18
Anthropic 官方发布 Claude 模型选择指南,详细说明了 Mythos、Fable、Opus、Sonnet 与 Haiku 模型的特点与适用场景。官方建议开发者优先从最智能的模型起步,并通过调节 effort level 来平衡性能与成本。
Anthropic 官方发布了关于如何为不同工作负载选择 Claude 模型的详细指南,全面介绍了旗下不同级别模型的能力与定位。目前模型家族中,Mythos 与 Fable 是最强大的模型级别,Opus 专注推理密集型企业任务,Sonnet 兼顾日常通用任务,而 Haiku 主打最低成本与最快速度。官方称,由于更智能的模型完成任务所需的轮次和思考时间更少,其“每任务成本”往往更低,因此建议直接从最智能模型起步并向下测试。此外,官方还介绍了利用低成本模型调用智能模型进行验证的 advisor strategy,并建议企业使用自定义评估来测试强大模型。

相关链接:
- https://claude.com/blog/claude-models-explained-choosing-the-best-model-for-your-use-case
- https://platform.claude.com/docs/en/about-claude/models/choosing-a-model
Anthropic 设计师分享 Claude Design 使用方法与最佳实践 #19
Anthropic 产品设计师 Nate Parrott 发文分享了 Claude Design 的日常使用经验与最佳实践。该工具目前处于 Beta 阶段,用于早期视觉设计和沟通。
Anthropic 产品设计师 Nate Parrott 在官方博客撰文,分享了视觉设计工具 Claude Design 的日常使用经验与最佳实践。Claude Design 目前处于 Beta 阶段,已在 Claude Pro、Max、Team 和 Enterprise 订阅方案中开放,主要用于制作原型、幻灯片和动画等早期视觉沟通。根据作者说明,该工具不包含图像模型,不适合标志设计,也不替代用于编写生产代码的 Claude Code,但两者支持双向同步。他建议用户在提示前明确需求、上传品牌文件建立设计系统,并通过连接 GitHub 等方式提供真实上下文。
相关链接:
Anthropic 发布 Drone-Bench 评估 AI 无人机控制能力 #20
Anthropic 与 Andon Labs 推出 Drone-Bench 基准测试,评估 AI 模型自主控制无人机执行室内人员定位与跟随的能力。官方称 Claude Fable 5 表现最佳。
Anthropic 与合作伙伴 Andon Labs 合作开发了名为 Drone-Bench 的全新基准测试,用于评估 AI 模型自主控制无人机执行定位与跟随人员的监视任务的能力。根据 Anthropic 官方公布的测试结果,Andon Labs 测试了来自三家开发者的 15 个模型,整体趋势表明越新的模型在子任务上完成度越高。其中,表现最好的模型是 Claude Fable 5,它在除重建外的所有任务上都超过了人类与 AI 协作设定的基线,并在真实无人机测试中的检测和跟随环节明显优于基线。由于在重建任务上的错误累积,Claude Fable 5 仍无法自主在房间之间导航。官方指出,该测试仅在室内单一办公室环境中进行,无人机飞行速度缓慢,未涉及复杂的户外场景。


相关链接:
Google发布首份ATLAS报告:揭示超150国AI实际使用情况 #21
Google发布了“AI与经济ATLAS”报告。该报告基于1500万次去标识化交互数据,展示了用户如何在实际工作与生活中使用其AI工具。
Google正式发布了首份“AI与经济ATLAS”报告。这是一项针对人们如何使用Google AI产品和工具的大规模去标识化研究,其首版数据集(v1.0)基于来自Gemini App、AI Mode和Gemini API的1500万次聚合脱敏人机交互。该数据覆盖超150个国家、140种语言、800种职业和4000项任务。报告指出,职场AI应用广泛但单一职位使用率仅约21%,且不到10%的交互实现了任务完全自动化;同时超86%的AI交互发生在工作之外的家庭场景。

相关链接:
- https://blog.google/innovation-and-ai/technology/research/understanding-the-ai-economy/
- https://ai.google/static/documents/GoogleATLASv1.pdf
前瞻与传闻
Elon Musk 称 Grok 4.6 及 4.7 将在四周内相继发布 #22
SpaceXAI CEO Elon Musk 宣布 Grok 4.6 将于 2 周后发布,Grok 4.7 将于 4 周后推出。该发布时间表目前为其个人预告,后续实际进展或发生变动。
SpaceXAI 首席执行官 Elon Musk 公布了旗下 Grok 模型的最新发布时间表。根据其说法,Grok 4.6 模型预计将在 2 周后发布,而 Grok 4.7 模型则预计在 4 周后推出。由于该信息来源于马斯克的个人社交媒体发言,目前尚未有官方渠道的正式公告进行补充说明。

相关链接:
消息称 Stripe 正洽谈收购 OpenRouter,交易仍存在破裂可能 #23
据报道,Stripe 正洽谈收购 OpenRouter,交易估值可能约为 100 亿美元。目前谈判仍可能破裂,且存在其他潜在竞购者。
据《华尔街日报》报道,知情人士透露美国金融科技公司 Stripe 正洽谈收购大模型中转站 OpenRouter,交易目前处于洽谈阶段,仍存在破裂或出现其他竞购者的可能。知情人士称,虽然确切价格尚不清楚,但本次收购交易的估值可能达到约 100 亿美元,而 OpenRouter 在最近一轮融资中的估值仅为 13 亿美元。此外,知情人士补充称还有其他大型科技公司也在考虑收购 OpenRouter,且 Stripe 与 OpenRouter 此前已存在支付处理方面的合作。
相关链接:
腾讯合并大语言模型和多模态团队成立基础模型部 #24
据报道,腾讯混元多模态模型部门与大语言模型部门合并,成立基础模型部,统一由首席AI科学家姚顺雨管理,探索全模态模型。
据报道,腾讯宣布混元多模态模型部门与大语言模型部门合并,并正式成立基础模型部。新成立的基础模型部统一由腾讯首席AI科学家姚顺雨管理。此次架构调整旨在提升模型研发和协同效率,并探索全模态模型的智能上限。
相关链接:
提示:内容由AI辅助创作,可能存在幻觉和错误。
AI HOT 补充资讯
模型发布/更新
Anthropic 发布 Claude Opus 5 #A1
来源:AI HOT:Anthropic:Newsroom(网页)
Anthropic 发布 Claude Opus 5,其智能水平接近 Claude Fable 5,但价格减半。该模型在 Frontier-Bench v0.1 上性能超过 Opus 4.8 两倍以上,在 ARC-AGI 3 上得分是次优模型的三倍。Opus 5 即日起成为 Claude Max 的默认模型和 Claude Pro 的最强模型。
蚂蚁百灵发布Ling-3.0-flash原生混合推理模型 #A2
来源:AI HOT:公众号:蚂蚁百灵(Ling)
蚂蚁百灵发布新一代原生混合推理模型Ling-3.0-flash,总参数量124B,激活参数量仅5.1B,在传统推理、指令遵循与长文本等指标上对标甚至超越上一代旗舰Ring-2.6-1T。模型采用原生混合线性注意力架构与1/64稀疏MoE,并扩展至10,000+可交互训练环境,长输入下TTFT降低60%至80%以上。
FLUX 3 x mimic:新一代视频动作模型 #A3
来源:AI HOT:Hacker News 热门(buzzing.cc 中文翻译)
Black Forest Labs 发布多模态基础模型 FLUX 3,联合训练图像、视频和音频,其中视频预测占训练算力的 95% 以上。该模型与机器人公司 mimic 合作推出 FLUX-mimic,已在奥迪生产线上测试部署。加入动作预测后,视频生成质量最初下降最多 10%,但经 3500 步训练后恢复原有水平。
Midjourney V8.2 发布:专注美学提升与个性化理解 #A4
来源:AI HOT:Midjourney:Updates(RSS)
Midjourney 今日推出 V8.2 图像模型,重点提升美学质量、图像创意与个性化表现。低质量图像出现频率将显著降低,个性化功能能更精准理解用户审美偏好。V8.2 的个性化配置文件拥有更大、更优的图像选择池,建议用户尝试新旧配置文件体验最新版本。
Black Forest Labs 发布 FLUX 3 多模态模型,支持单次生成 20 秒视频与原生音频 #A5
来源:AI HOT:IT之家(RSS)
Black Forest Labs 以 Early Access 方式推出 FLUX 3 多模态基础模型,采用统一架构联合学习图像、视频和音频。该模型基于 Self-Flow 学习框架扩展,可在单次生成中输出最长 20 秒视频并附带原生音频,支持文生视频、图生视频、多镜头串联等任务。
产品发布/更新
Runway Agent 推出自然语言工作流功能 #A6
来源:AI HOT:X:Runway (@runwayml)
在 Runway Agent 中引入工作流。现在你可以通过自然语言构建、运行或编辑基于节点的工作流。工作流可大规模解锁高质量输出。 立即尝试,点击下方链接调用 / Workflow 技能。
百度搭子更新:电脑手机接力、桌面端内嵌浏览器上线,复杂任务可跨端连续执行 #A7
来源:AI HOT:公众号:百度智能云(文心)
百度搭子在近期AI Day上推出多项升级,支持电脑与手机双端互联,同步任务上下文与执行进度,用户可跨设备接力完成复杂工作。桌面端内嵌浏览器正式上线,能自动打开多个网页执行调研、下载等操作,手机端支持云端远程操控。智能路由自动匹配任务模式,平均任务耗时降低20%,Token利用率提升25%;简单任务完成度达100%,复杂任务高交付率94%,积分消耗最高降低75%。
OpenRouter 推出 Classifiers 测试版:自动标记 AI 请求的用途与成本归属 #A8
来源:AI HOT:OpenRouter:Announcements(RSS)
OpenRouter 上线 Classifiers 测试版,允许用户通过自定义分类法(最多 8 个维度)自动标记每次 AI 请求的任务类型、部门归属、合规类别等信息。分类异步运行,不增加推理延迟;支持采样率控制成本,推荐使用 Gemini 3.5 Flash Lite 作为分类模型。标记结果写入日志,并可在 Activity Explorer 中按维度聚合分析模型使用分布与成本流向。
Claude Code v2.1.219 发布:新增 Claude Opus 5,支持 1M 上下文与嵌套子智能体 #A9
来源:AI HOT:Claude Code:GitHub Releases(RSS)
Claude Code v2.1.219 新增 Claude Opus 5 作为默认 Opus 模型,支持 1M 上下文窗口,快速模式定价为 $10/$50 每百万 token。
行业动态
英伟达、微软和Meta联合警告:应避免对开放权重模型过度监管 #A10
来源:AI HOT:Hacker News 热门(buzzing.cc 中文翻译)
英伟达、微软和Meta联合签署公开信,警告对开放权重AI模型的过度监管将削弱美国在AI领域的竞争力。信中指出,开放权重模型能促进创新、降低准入门槛,并支持学术研究。OpenAI和Anthropic未签署该信函。
微软阐述开源模型助力美国竞争力路径 #A11
来源:AI HOT:X:Satya Nadella (@satyanadella)
开放权重模型对健康的 AI 生态系统至关重要。我们与行业同仁一道,正在规划一条路径,让开放权重模型在保护国家安全的同时,增强美国竞争力并扩大经济机会。
Kimi K3 在网络安全漏洞利用测试中大幅落后美国前沿模型,知识蒸馏或为原因 #A12
来源:AI HOT:The Decoder:AI News(RSS)
英国AI安全研究所与美国AI标准与创新中心联合评估显示,月之暗面的Kimi K3在ExploitBench基准上得分32.2%,远低于美国领先模型的76.2%,但优于智谱GLM-5.2的24.4%。
论文研究
Anthropic 联合 Andon Labs 发布 Drone-Bench,评估 AI 模型自主操控无人机执行定位追踪任务的能力 #A13
来源:AI HOT:Anthropic:Research(发表成果 · 网页)
Anthropic 与 Andon Labs 合作推出 Drone-Bench,用于测试 AI 模型自主操控四旋翼无人机在室内环境中定位并追踪指定人员的能力。该基准将任务分解为 3D 地图重建、定位、导航、目标检测与跟随五个子任务,并通过软件复现实现快速评估。实验表明,该任务链的难度足以区分不同智能水平的模型,并揭示 AI 在物理世界操控能力上的进步轨迹。
Apple 提出 LEAD 方法,破解长程推理中的“不可恢复瓶颈” #A14
来源:AI HOT:Apple Machine Learning Research(RSS)
Apple 研究发现,大语言模型在长程执行中即使有高层策略也不稳定,极端分解会导致“不可恢复瓶颈”——少数“困难”步骤上的持续错误变得不可逆转。为此提出 Lookahead-Enhanced Atomic Decomposition(LEAD),通过引入短程未来验证与聚合来打破这一瓶颈。该方法在受控算法谜题上验证了有效性。
技巧与观点
Claude-thermos:保持 Claude 会话缓存热度,避免重新编码费用 #A15
来源:AI HOT:Hacker News 热门(buzzing.cc 中文翻译)
Claude-thermos 通过本地反向代理监控 Claude Code 会话,在主智能体因等待子智能体而空闲超过 5 分钟时,自动发送预热请求刷新提示缓存。实测约 185 次本地会话中,缓存过期导致的重新编码占账单约 22%。工具以 uvx 运行,支持自定义空闲阈值和预热间隔。
Claude 5 代模型上下文工程新规则:Claude Code 系统提示词精简超 80% #A16
来源:AI HOT:Claude:Blog(网页)
Anthropic 为 Claude Opus 5 和 Claude Fable 5 等新一代模型删除了 Claude Code 超过 80% 的系统提示词,且编码评测无显著损失。
Claude Design 产品设计师 Nate Parrott 分享如何用其探索视觉创意 #A17
来源:AI HOT:Claude:Blog(网页)
Anthropic 产品设计师 Nate Parrott 分享了他在 Claude Design(beta 版)中利用 HTML 交互能力进行产品原型、幻灯片、动画等视觉创意探索与迭代的方法。他将 Anthropic 品牌规范提炼为提示词,使输出自动符合品牌指南。Claude Design 不包含图像模型,不适合 Logo 设计,但可与 Claude Code 协同工作,将早期创意与生产开发衔接。
Claude 模型家族详解:如何为工作负载选择最佳模型 #A18
来源:AI HOT:Claude:Blog(网页)
Anthropic 发布 Claude 模型选择指南,将模型分为 Mythos/Fable(最强能力,用于前沿编码与智能体任务)、Opus(推理密集型企业任务)、Sonnet(日常通用任务)和 Haiku(最低成本与最快速度)四个类别。
提示:内容由 AI 辅助整理,可能存在错误,请以原始出处和官方信息为准。