AI 早报 2026-08-13

本页合并来源:Juya AI 早报 + AI HOT 日报。Juya 保留完整精选,AI HOT 作为补充来源;已按链接和标题做基础去重。

概览

Juya · 要闻

  • DeepSeek-V4-Pro 正式版 API 上线,官方称增强 Agent 能力 #1
  • SpaceXAI发布Grok 4.6,多项基准测试达前沿水平,价格不变 #2
  • Codex 突破 1500 万活跃用户,Tibo 宣布重置额度 #3
  • 豆包面向在校大学生推出学生认证特惠 #4
  • Kimi 调整老套餐续订规则:到期超7天无法续订 #5
  • Manus AI向所有用户免费开放1.6 Lite与1.6至8月25日 #6
  • Claude Cowork 上线 Chrome 侧边栏,支持会话跨端接续 #7

Juya · 模型发布

  • Qwen 正式发布 Qwen3.8-Max 模型权重 #8
  • 微信发贴介绍WeLM模型系列,腾讯宣布Hy4近期发布 #9
  • Google DeepMind 推出 SL2T 手语翻译模型,Pixel 11 已上线 #10
  • Liquid AI 发布端侧视觉模型 LFM2.5-VL-3B #11
  • Cohere发布2.4B视觉语言模型North Micro Vision #12

Juya · 开发生态

  • SuperGrok Heavy 用户可领取 Cursor Ultra 一个月免费试用 #13
  • Zed 推出 Delta:基于 DeltaDB 的 Agent 协作编程环境 #14
  • OpenAI Codex 订阅额度缩水引用户质疑 #15

Juya · 产品应用

  • OpenAI推出ChatGPT积分赠送功能,可购买积分赠与他人 #16
  • OpenAI正在逐步扩大ChatGPT的广告测试范围 #17
  • 谷歌宣布Gemini将在未来几周内接入更多第三方应用 #18

Juya · 行业动态

  • 面壁智能启动A股上市辅导,中信证券担任辅导机构 #19

Juya · 前瞻与传闻

  • Elon Musk 称 Grok 4.7 预计3-4周内就绪 #20

AI HOT 补充

  • xAI 发布 Grok 4.6,强化长时运行智能体能力 #A1
  • 阿里开放 Qwen3.8-2.4T-A95B 模型权重:2.4T MoE、激活 95B、原生 256K 上下文 #A2
  • LTX-2.5 模型登场:AI 生成 10 秒 720P 视频仅需 6.8 秒,原生集成 ComfyUI #A3
  • 微软首发自研推理模型MAI-Thinking-1 #A4
  • OpenRouter 推出实时网页搜索基准测试:如何为智能体选择引擎、深度与模型 #A5
  • Claude in Chrome 侧边栏升级为 Claude Cowork 会话 #A6
  • SGLang 与 Miles 为 Qwen3.8-2.4T-A95B 提供 Day-0 支持 #A7
  • WhatsApp 如何用端到端加密与可验证性构建 Scam Alert 诈骗提醒功能 #A8
  • Claude Code v2.1.229 发布:新增远程会话恢复、插件市场命令源及多项修复 #A9
  • Research Gold 号称“100%人类撰写、绝不使用AI”,实则全程由AI驱动 #A10
  • RingCentral 如何用 ChatGPT Work 和 Codex 构建 AI 原生工作流 #A11
  • 空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈 #A12

Juya 早报精选

要闻

DeepSeek-V4-Pro 正式版 API 上线,官方称增强 Agent 能力 #1

DeepSeek 上线了 DeepSeek-V4-Pro 正式版API,模型版本更新为DeepSeek-V4-Pro-0813。该版本增强了Agent能力,并支持Responses API及Codex接入,调用方法保持不变且价格尚未正式调整。官方数据显示,DeepSeek-V4-Pro-0813 在多项基准测试中表现优异,DeepSWE得分升至62.7。截至本期内容发出前,官方尚未透露更多信息。

DeepSeek 官方 API 文档及官方通知显示,DeepSeek-V4-Pro 正式版 API 已上线,模型版本更新为 DeepSeek-V4-Pro-0813,调用方法保持不变。官方称新版本增强了 Agent 能力,根据官方基准测试数据,其在多项评测中得分提升,在 Cybergym 和 AutomationBench 中表现领先,DeepSWE 得分较预览版从 12.8 升至 62.7。官方表示,该正式版支持 Responses API、Codex 等接入。此前官方已预告可能大幅上涨API价格,但目前尚未正式调整价格。截至本期内容发出前,官方尚未透露更多信息。

相关链接:


SpaceXAI发布Grok 4.6,多项基准测试达前沿水平,价格不变 #2

SpaceXAI 发布新一代模型Grok 4.6,官方称其在多项Agentic编码与知识工作基准测试中达到前沿智能水平,价格与Grok 4.5持平,输入每百万token 2美元、输出6美元,今日起在Cursor、Grok Build和API等渠道可用。Grok Build和Cursor中首周提供2倍用量。

SpaceXAI正式发布新一代模型Grok 4.6。官方称其在多项Agentic编码和知识工作基准测试中达到前沿智能水平,在Artificial Analysis Intelligence Index上获得61分,与GPT-5.6 Sol持平。模型特别针对长时间运行的Agent和更复杂的交互式及视觉工作进行了优化。价格与Grok 4.5保持相同,输入token每百万2美元、输出token每百万6美元,快速版本价格翻倍。模型今日起在Cursor、Grok Build、Grok Bot和API中可用,并通过OpenRouter、Vercel、Cloudflare等合作伙伴提供,Grok Build和Cursor中第一周提供2倍包含用量。

相关链接:


Codex 突破 1500 万活跃用户,Tibo 宣布重置额度 #3

Codex 负责人 Tibo 表示,此前曾承诺每新增100万活跃用户就进行一次额度重置,原计划持续到1000万用户。如今用户规模已远超这一节点,活跃用户已突破1500万。他宣布再次为用户开放一次 Codex 额度重置,并称将在一个小时左右生效。

OpenAI Codex 活跃用户规模已突破1500万。Tibo 此前曾承诺,在Codex达到1000万活跃用户前,每新增100万用户就为社区提供一次使用额度重置;突破1000万后,这一活动一度暂停。8月13日,Tibo 再次宣布为用户送上额度重置,并称将在一个小时左右生效。此前他还曾预告会准备一个“小惊喜”,最终落地为此次额度重置。

相关链接:


豆包面向在校大学生推出学生认证特惠 #4

豆包宣布正式上线学生特惠活动,在校大学生完成身份认证后,可获得2.5倍免费额度,并能以38元连续包月的学生特惠价购买原价68元每月的专业版标准套餐。

豆包宣布面向在校大学生推出学生特惠活动。大学生完成学生身份认证后,可在豆包 App 内解锁学生专属免费额度与专业版标准套餐优惠两项权益,其中学生专属免费额度为2.5倍免费额度,专业版标准套餐原价68元每月,学生特惠价为38元连续包月。用户将豆包电脑端更新至最新版本,打开工作任务模式并向豆包发送消息(例如“我要领取学生优惠”),或登录豆包电脑端从设置界面进入豆包专业版订阅、在界面右上方选择学生权益选项,通过抖音账号认证学生身份成功后即可获得优惠。


Kimi 调整老套餐续订规则:到期超7天无法续订 #5

Kimi 官方宣布调整老套餐续订规则:自2026年8月20日起,订阅到期超过7天未续订的账号将无法再购买老套餐。公告发布时已过期的历史用户可在公告后7天内购买老套餐。

Kimi 官方发布公告,因当前算力资源紧张,自北京时间2026年8月20日起调整老套餐续订规则:订阅到期且超过7天未续订的账号,将无法再次购买老套餐。正在订阅中和自动续费正常开启的用户完全不受影响,会员权益与自动续费均保持不变。公告发布时订阅已过期的历史用户,可在公告发布后7天内购买老套餐。老套餐内升级(如199元档升至699元档)不受本次调整影响,且官方表示随着算力扩容会持续评估并尽可能放宽该7天限制。

相关链接:


Manus AI向所有用户免费开放1.6 Lite与1.6至8月25日 #6

Manus AI宣布即日起至{8月25日(新加坡时间)|8月25日},向全球用户免费开放 Manus 1.6 Lite 与 Manus 1.6 ,付费用户享优先排队访问。

Manus AI发布免费访问活动,自即日起至8月25日晚上11点59分(新加坡时间)期间,全球免费和付费用户均可在每日活动配额内免费使用Manus 1.6 Lite和Manus 1.6,付费用户对这两个模式拥有优先排队访问权。免费用户每日可生成20张图片和1个视频,付费用户每日可生成200张图片和10个视频。Manus 1.6 Max不包含在此次活动权益中。活动设有限额达到即停止、风险控制及动态排队等机制。

相关链接:


Claude Cowork 上线 Chrome 侧边栏,支持会话跨端接续 #7

Anthropic 宣布将 Claude in Chrome 浏览器侧边栏升级为 Claude Cowork 会话。用户的对话与上下文现可实现跨设备同步,该功能目前已向 Max 和 Team 订阅方案开放,并将在未来几周内逐步推向 Pro 用户。

Anthropic 官方宣布,Claude in Chrome 扩展的浏览器侧边栏现已变更为完整的 Claude Cowork 会话。用户的对话记录、技能与连接器现在可以在浏览器和 Claude 桌面端、网页端及移动端应用之间无缝同步与延续。由于会话直接与用户账号绑定,用户可以在浏览器标签页中启动长任务,随后在其他设备上继续完成工作。该功能目前面向 Max 和 Team 订阅方案提供,并将逐步向 Pro 用户推出。

相关链接:


模型发布

Qwen 正式发布 Qwen3.8-Max 模型权重 #8

Qwen 团队正式发布了Qwen3.8-Max 的模型权重,该开源版本命名为 Qwen3.8-{2.4|二点四}T-A95B。本次开放的权重版本为纯文本模型,交互时强制开启思考模式,不支持多模态输入及关闭思考功能。

Qwen 团队目前已在相关平台发布了Qwen3.8-Max 的模型权重,该开源版本命名为 Qwen3.8-2.4T-A95B。本次开放的权重版本为纯文本模型,交互时强制开启思考模式,不支持多模态输入及关闭思考功能,原生上下文长度为 256K,并最高可扩展至 1M。目前,开发者可通过 vLLM、SGLang 等框架进行部署,也可通过 Qwen Cloud 调用具备更多功能、默认支持 1M 上下文的 Qwen3.8-Max 官方 API。

相关链接:


微信发贴介绍WeLM模型系列,腾讯宣布Hy4近期发布 #9

微信团队发文介绍自研WeLM大语言模型系列,包含已部署的WeLM-80B和开发中的WeLM-617B。腾讯财报同时提及进一步提升模型性能和多模态能力的{Hy|混元大模型}4将于近期发布。

微信团队在其X账号发文介绍自研WeLM大语言模型系列,核心特点为资源高效。系列包括WeLM-80B(80B参数,3B激活)和WeLM-617B(617B参数,23B激活,MoE架构,开发中)。WeLM-80B已部署于微信原生AI助手小微,支持聊天搜索、微信原生功能和小程序服务。WeLM-617B面向微信生态复杂任务,目前处于开发阶段。此外,腾讯2026年Q2财报提及Hy4将于近期发布,以进一步提升模型性能和多模态能力。

相关链接:


Google DeepMind 推出 SL2T 手语翻译模型,Pixel 11 已上线 #10

Google DeepMind 发布了全新的{手语转文本(SL2T)|手语转文本}翻译模型。目前,{美国手语(ASL)|美国手语}转写为英语的功能已上线 Pixel 11 的 Gboard 和 Live Transcribe应用,供用户免费使用。

Google DeepMind 与 Android 团队联合发布了 SL2T 多语言手语转文本翻译模型,并首次将其部署到消费级产品中。首发功能支持将美国手语(ASL)转写为英语,听障用户可通过手语在 Pixel 11 的 Gboard 和 Live Transcribe 中进行搜索、起草消息和日常对话。该功能目前已在 Pixel 11 上免费提供,未来将支持更多设备和语言。

相关链接:


Liquid AI 发布端侧视觉模型 LFM2.5-VL-3B #11

Liquid AI 发布开源视觉语言模型 LFM2.5-VL-3B。该模型专为端侧部署设计,主打快速直接回答,较前代提升了屏幕理解和函数调用能力。

Liquid AI 发布视觉语言模型 LFM2.5-VL-3B,结合了 LFM2.5-2.6B 语言骨干与 SigLIP2 视觉编码器。该模型采用直接回答而非推理的生成模式,确保在端侧设备上的实时响应速度。相比上一代,新模型在屏幕与 UI 理解、目标检测、多图像输入处理以及函数调用方面实现了四大核心改进。目前 LFM2.5-VL-3B 已在 Hugging Face 上线,支持 llama.cpp、vLLM、ONNX 等多种框架进行跨平台或 GPU 推理。

相关链接:


Cohere发布2.4B视觉语言模型North Micro Vision #12

Cohere发布了参数量 2.4B 的开源视觉语言模型 North Micro Vision。官方称该模型在视觉理解基准测试中表现优于Gemma 4 E2B和Ministral 3 3B。

Cohere发布了视觉语言模型North Micro Vision,总参数量为24亿(2.4B)。官方称,该模型在视觉理解基准测试中表现优于Gemma 4 E2B和Ministral 3 3B,并在文档理解和视觉问答方面取得尤为突出的成绩。North Micro Vision采用原生分辨率视觉处理技术,提供多轮图文对话、空间推理和多语言图像理解能力。目前,该模型已开放模型权重。

相关链接:


开发生态

SuperGrok Heavy 用户可领取 Cursor Ultra 一个月免费试用 #13

SuperGrok Heavy 用户现可获得 Cursor Ultra 一个月免费试用。据官方 Grok 账号说明,用户需使用与 SuperGrok Heavy 账户相同的邮箱登录 Cursor 领取该福利。

SuperGrok Heavy 订阅用户现可获得 Cursor Ultra 一个月免费试用。官方 Grok 账号表示,用户需使用与 SuperGrok Heavy 账户相同的邮箱登录或注册 Cursor,在优惠出现时领取一个月免费 Ultra 试用,该福利非永久订阅。该试用拥有独立的使用额度池,与 Grok 的使用限制互不影响。

相关链接:


Zed 推出 Delta:基于 DeltaDB 的 Agent 协作编程环境 #14

Zed 团队推出面向 Agent 协作编程的应用 Delta,目前已向首批用户开放内测。Delta 基于 DeltaDB 构建,将对话与代码变更实时关联,并接入 Claude Code 等第三方 Agent 工具。

Zed 团队推出 Delta,一款用于与 Agent 协作编写和审查代码的多人环境应用,目前已开始邀请首批用户进入内测。Delta 基于 Zed 团队此前构建的 DeltaDB 版本控制系统,将开发者与 Agent 的对话、代码编辑和审查过程实时同步在同一线程中。DeltaDB 捕获提交之间的每一次操作而非仅记录快照,使代码与对话始终保持关联。Delta 支持通过链接在浏览器中直接打开线程,并已接入 Claude Code 等第三方 Agent 工具。Zed 团队表示,DeltaDB 未来将集成到 Zed 编辑器中,但当前以 Delta 作为首个客户端。

相关链接:


OpenAI Codex 订阅额度缩水引用户质疑 #15

据多名社区用户反映,OpenAI Codex Pro订阅额度出现下降,有用户称额度缩水近三分之一,官方尚未就此作出回应。

据多名论坛用户反映,OpenAI Codex Pro订阅额度出现缩水问题。有用户订阅一周后称第一周额度为2400多美元,近期降至约1700美元,缩水近三分之一;另有用户称出现5美元用量显示5%的异常,并质疑是否账号问题或OpenAI Bug,相关情况尚未获官方确认。

相关链接:


产品应用

OpenAI推出ChatGPT积分赠送功能,可购买积分赠与他人 #16

OpenAI推出ChatGPT积分赠送功能,符合条件的个人用户可购买积分赠送给他人。该功能正逐步上线,所有个人账户均可参与。

OpenAI官方帮助中心上线了ChatGPT积分赠送(Gifting credits)功能说明。根据该说明,符合条件的ChatGPT免费版、Go、Plus和Pro个人账户用户,可以在ChatGPT网页端为他人购买一笔独立的预付积分。完成支付后,购买者会获得一个一次性领取链接,可通过邮件或复制链接的方式发送给接收人。接收人打开链接后,需登录或创建符合条件的个人ChatGPT账户,并在30天内完成兑换。兑换后,积分将计入该账户的个人积分余额,可用于该账户订阅方案所支持的积分功能,包括ChatGPT Codex等。

相关链接:


OpenAI正在逐步扩大ChatGPT的广告测试范围 #17

OpenAI宣布ChatGPT广告已扩展至英国、墨西哥、巴西、日本和韩国。目前,这些地区及美国等地的Free和Go订阅的成年用户会看到广告。

OpenAI正在推进ChatGPT中的广告测试,该功能目前已在美国、加拿大、澳大利亚、新西兰以及英国、墨西哥、巴西、日本和韩国上线。此功能针对已登录的成年用户,并在Free和Go订阅方案中展示,而Plus、Pro、Business、Enterprise及Education等订阅方案不包含广告。

相关链接:


谷歌宣布Gemini将在未来几周内接入更多第三方应用 #18

谷歌宣布Gemini将在未来几周内接入更多应用。新增服务涵盖办公与生活领域,用户可直接完成总结会议或餐厅预订等任务。

谷歌宣布将在未来几周内向Gemini推出一批新的已连接应用。这些新增服务允许用户直接在Gemini内处理待办事项,涵盖生产力与创造力、本地与娱乐、音乐以及家庭健康与生活方式四个主要类别。用户只需在Gemini中开启这些服务,便可一站式完成总结会议、预订餐厅、播放歌单和预约医生等任务。目前这些功能正逐步上线。

相关链接:


行业动态

面壁智能启动A股上市辅导,中信证券担任辅导机构 #19

据报道,面壁智能启动A股上市辅导,正式冲刺IPO。该公司估值超200亿元,是国内端侧智能领域公开估值最高的独角兽企业。

据报道,面壁智能于8月12日首次向上海证监局提交上市辅导备案报告,正式启动A股上市辅导,中信证券担任辅导机构。此前7月15日,面壁智能完成新一轮融资,投资方包括国家级基金、央企、汽车制造商等产业方及知名财务投资机构,2026年上半年累计融资金额超过50亿元,估值超过200亿元。面壁智能2022年8月成立于北京,孵化自清华大学自然语言处理实验室,核心业务为端侧大模型研发及产业化,核心产品为MiniCPM系列模型。

相关链接:


前瞻与传闻

Elon Musk 称 Grok 4.7 预计3-4周内就绪 #20

Elon Musk 表示,Grok 4.7 初始训练已完成,目前正加入大量 SpaceX 公司数据进行补充训练,预计将在 3 到 4 周内就绪。他称该模型将超越当前所有模型,并表示 SpaceX 的训练语料使其在现实世界工程领域将无可匹敌。

Elon Musk 宣布 Grok 4.7 的初始训练已经完成,目前正在加入大量 SpaceX 公司数据作为补充训练内容,预计该模型将在 3 到 4 周内准备就绪。Musk 称 Grok 4.7 将超越当前所有模型,并表示由于 SpaceX 训练语料的独特性,如果有任何模型在现实世界工程方面优于 Grok 4.7,他会感到非常惊讶。

相关链接:


提示:内容由AI辅助创作,可能存在幻觉错误

AI HOT 补充资讯

模型发布/更新

xAI 发布 Grok 4.6,强化长时运行智能体能力 #A1

来源:AI HOT:xAI:News(网页)

xAI 今日发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力。该模型在多项智能体编码与知识工作基准上达到前沿水平,在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol。

阿里开放 Qwen3.8-2.4T-A95B 模型权重:2.4T MoE、激活 95B、原生 256K 上下文 #A2

来源:AI HOT:IT之家(RSS)

阿里 Qwen 团队正式开放 Qwen3.8-2.4T-A95B 模型权重,这是 Qwen-Max 级别模型首次开源。模型总参数 2.4T,每个 Token 激活 95B,原生支持 262,144 Token 上下文并可扩展至 1,010,000 Token。

LTX-2.5 模型登场:AI 生成 10 秒 720P 视频仅需 6.8 秒,原生集成 ComfyUI #A3

来源:AI HOT:IT之家(RSS)

LTX 推出 LTX-2.5 模型,原生集成 ComfyUI,在 2 张英伟达 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒。LTX-2.5 Fast 以每秒 0.09 美元生成带音频 720p 视频,10 秒片段成本 0.90 美元;年度经常性收入低于 1,000 万美元的组织可免费使用。

微软首发自研推理模型MAI-Thinking-1 #A4

来源:AI HOT:X:Mustafa Suleyman(Microsoft AI CEO) (@mustafasuleyman)

我们的首个推理模型 MAI-Thinking-1 从零开始构建,现已在 Microsoft Foundry 上线。为团队点赞!更多详情如下。

产品发布/更新

OpenRouter 推出实时网页搜索基准测试:如何为智能体选择引擎、深度与模型 #A5

来源:AI HOT:OpenRouter:Announcements(RSS)

OpenRouter 发布实时排行榜,系统评测模型、搜索引擎、搜索方法与预算四类配置组合。数据显示,将搜索预算从 1 轮增至 25 轮可使 BrowseComp 得分近乎翻倍,成本仅增 2.5-7 倍;模型选择比引擎更重要,平均分差 15 分 vs 10 分。失败率高的任务应降低搜索深度以控制成本。

Claude in Chrome 侧边栏升级为 Claude Cowork 会话 #A6

来源:AI HOT:Claude:Blog(网页)

Claude in Chrome 浏览器扩展的侧边栏现已升级为 Claude Cowork 会话,对话会保存至历史记录,技能和连接器可在浏览器中工作,且任务可在桌面、网页和移动端应用间无缝切换。

SGLang 与 Miles 为 Qwen3.8-2.4T-A95B 提供 Day-0 支持 #A7

来源:AI HOT:LMSYS:Blog(Chatbot Arena 团队)

SGLang 与 Miles 在发布首日即支持 Qwen3.8-2.4T-A95B,这是 Qwen 最大的开源模型,总参数 2.4T,每 token 激活 95B,采用混合注意力架构。

WhatsApp 如何用端到端加密与可验证性构建 Scam Alert 诈骗提醒功能 #A8

来源:AI HOT:Meta Engineering Blog(RSS)

WhatsApp 推出可选功能 Scam Alert,通过端到端加密保护下在设备端运行机器学习模型,识别潜在诈骗消息,且消息内容不会离开设备或自动上报。该功能遵循仅设备端处理、无自动上报、用户控制三大原则,模型权重公开供独立验证,遥测数据经差分隐私聚合处理。目前已在 Beta 版有限推出,并邀请安全研究社区参与测试。

Claude Code v2.1.229 发布:新增远程会话恢复、插件市场命令源及多项修复 #A9

来源:AI HOT:Claude Code:GitHub Releases(RSS)

Claude Code v2.1.229 发布,新增远程控制会话恢复、自托管 runner 的服务器端 hook 支持,以及插件市场命令源。修复了长响应流式输出丢失、窄终端渲染崩溃、Windows 扩展路径崩溃等问题。改进工作流扇出以复用缓存提示前缀,并调整 /commit-push-pr 对危险 git/gh 命令不再自动批准。

行业动态

Research Gold 号称“100%人类撰写、绝不使用AI”,实则全程由AI驱动 #A10

来源:AI HOT:Hacker News 热门(buzzing.cc 中文翻译)

面向医学研究者的网站 Research Gold 宣称其服务“100%由人类撰写、绝不使用AI”,并列出多名博士审稿人。但调查发现,这些审稿人系AI生成、并不存在;部分真实方法学家的身份和照片未经许可被挪用。致电该公司时,自称“Sarah”的AI助手坚称自己是真人,邮件与聊天回复也均为AI生成。

RingCentral 如何用 ChatGPT Work 和 Codex 构建 AI 原生工作流 #A11

来源:AI HOT:OpenAI:官网动态(RSS · 排除企业/客户案例)

RingCentral 通过全员发放 ChatGPT Work 和 Codex,推动从工程到运营的 AI 原生开发,其 AI-Native Challenge 让数千名员工(含非技术人员)交付了可运行项目。

论文研究

空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈 #A12

来源:AI HOT:Google Research:Blog(网页)

Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于“丢钥匙”而非“空货架”。该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。

Anthropic 联合独立研究者发布工人再培训项目证据综述 #A13

来源:AI HOT:Anthropic:Research(发表成果 · 网页)

Anthropic 与独立研究者 David Roodman 合作发布报告,基于 56 项美国随机研究和欧洲实验证据,评估工人再培训项目应对 AI 劳动力市场冲击的效果。

技巧与观点

零基础用户半天上手AI的12步实操流程 #A14

来源:AI HOT:公众号:数字生命卡兹克

文章给出一套零基础用户半天上手AI的12步实操流程:准备内存不低于16G的电脑,订阅ChatGPT并安装Codex或使用WorkBuddy,用语音输入法以【背景、痛点、需求】框架向AI交代任务,经苏格拉底提问澄清需求后投喂文件让AI直接完成,最后沉淀为可复用Skill。文中建议Codex选GPT-5.6 Sol最高模型,WorkBuddy选Kimi K3。

DeepSeek V4 Pro与Grok 4.6同日发布,双双逼近Claude Fable 5体验 #A15

来源:AI HOT:公众号:数字生命卡兹克

DeepSeek V4 Pro正式版与Grok 4.6在2小时内先后发布,均为1.6T/1.5T参数模型,逼近Claude Fable 5体验。

AutoGPT 如何用 AGENTS.md 和技能门控管理 AI 生成的拉取请求 #A16

来源:AI HOT:GitHub Blog

AutoGPT 维护者发现,AI 智能体不会主动阅读文档,因此将指令放在 AGENTS.md 和技能文件中,并置于代码目录旁。他们通过强制 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等门控机制,将智能体提交的 PR 从“不可用”转变为“可用但不符合路线图”。其中 CLA 签名因需浏览器和 OAuth 流程,被用作区分人类与智能体的“人类探测器”。

我写了一本 AI 教科书——AI 还要多久才能写得更好? #A17

来源:AI HOT:Nathan Lambert:Interconnects(RSS)

作者在完成一本 RLHF 教科书后反思,LLM 在长文非虚构写作上进展停滞,GPT 4.5 和 Kimi K2 等写作强模型已显老旧,而编码、数学等任务已接近超人水平。模型能改错字、做编辑,但组织整章内容时仍混乱且易出错,作者认为这阻碍了模型自主解决开放科学问题。

OpenRouter 工具调用指南:一次编写循环,切换模型字符串即可跨模型运行 #A18

来源:AI HOT:OpenRouter:Announcements(RSS)

OpenRouter 发布工具调用指南,展示如何用同一套代码在 Claude、GPT 和开源权重模型间切换,仅需更改模型字符串。指南涵盖定义工具、发送请求、读取 tool_calls 响应、执行函数并返回结果的完整循环,支持 OpenAI 兼容的 JSON schema,并提供 cURL、Python 和 JavaScript/TypeScript 示例。


提示:内容由 AI 辅助整理,可能存在错误,请以原始出处和官方信息为准。