何恺明团队让Claude在ARC-AGI-3拿满分【AI 早报 2026-10-05】

何恺明团队让Claude在ARC-AGI-3拿满分【AI 早报 2026-10-05】

ARC-AGI-3 的官方考场原本只把游戏画面压成 64×64 数字表交给模型;何恺明团队用 VISTA 把“数字表”换成图片,并补上可回看的无损视觉记忆,Claude Opus 5 随后 25 个公开游戏全部通关拿到 100 分。另一边,OpenAI、Google、Meta 今天在模型、Agent 框架和开发者生态上都有高密度更新。

今日概览

要闻

  1. 何恺明团队让Claude在ARC-AGI-3拿满分

行业动态

  1. 谷歌10月9日收紧Gemini访问:免费用户仅剩Flash-Lite

模型发布

  1. OpenAI宣布GPT-5.5将于10月14日全套餐下线
  2. Meta Muse Spark六个月协助破解六大数学开放难题
  3. NASA与IBM开源月球基础模型

开发生态

  1. 微软ScholarEvolve:不换模型,只演化Agent Harness
  2. 微软Agensh:砍掉编排器,1024个Agent重建pandoc
  3. 南洋理工安波团队研究模型与Harness匹配
  4. DeepSeek Harness更新v0.2.1-alpha.1兼容Claude Code Mods

产品应用

  1. Meta开源Muse Gadgets:把Muse接入树莓派等硬件
  2. AI音乐公司ACE完成近4000万美元融资
  3. SpaceX AI工程师单月合并2500个生产PR
  4. 亚利桑那州AI视频致过失杀人判决被推翻

技术与洞察

  1. Noam Brown:1万Agent解千禧难题,多智能体贡献不到10%
  2. Google RRSI防止自改进Agent记住测试
  3. 谷歌32位作者发布词元化全景综述
  4. AlphaGo核心作者:LLM还没学到第37手的搜索能力
  5. Hinton发布首篇RSI论文

前瞻与传闻

  1. Tibo预告Astra 6.1可能到来

要闻

何恺明团队让Claude在ARC-AGI-3拿满分

VISTA 的切入点不是训练更大的基础模型,而是改 Agent 的输入与记忆。ARC-AGI-3 由 Keras 之父 François Chollet 与 ARC Prize 基金会推出,官方给模型的不是游戏画面,而是一张 64×64 的数字表;人类看到的小人、机关和路线,在模型那里只剩 4096 个数字。VISTA 先把这个数字表换回真实图片,同一 Claude Opus 5 就 25 个公开游戏全部通关、拿到 ARC-AGI-3 的 100 分,而且步数比首次游玩的人类少一半多。只做“数字换图片”这一项改动,GPT-5.6 Sol 的分数就从 13.33 升到 47.32,能通关的游戏从 1 个变成 9 个;原因是 512×512 图片只要约 308 个 token,而一个数字格子要占用约 4000 个 token,一局跑下来文本版消耗约 7190 万 token,图片版只要约 3070 万。VISTA 另一层核心是给模型一本可反复查看的视觉记忆相册,游戏吐出的每一帧,包括动画帧,都按编号原样存档,模型可随时 inspect 指定帧、并排比较或放大角落像素。另一个被强调的结果是,18 个从未见过的游戏没有附带说明,AI 靠自己摸清规则并通关。

来源:https://mp.weixin.qq.com/s/K7H7-ScK20EtoL8j-HiTfg

行业动态

谷歌10月9日收紧Gemini访问:免费用户仅剩Flash-Lite

谷歌在官方支持页面宣布,自 10 月 9 日起调整 Gemini 模型访问权限,把更多高级模型纳入付费墙。没有订阅的免费用户只能使用最基础的 Flash-Lite;AI Plus 订阅用户失去 Pro 使用权,只保留 Flash-Lite 和 Flash;AI Pro 与 AI Ultra 高级订阅用户才能继续使用 Pro 模型。由于这一变化,许多围绕免费或 Plus 额度搭建工作流的用户需要重做技术方案。与此同时,谷歌旗下 Antigravity 平台宣布向所有付费用户开放 Claude Opus 5.5 和 Sonnet 5.5,现有 Opus 4.6 与 Sonnet 4.6 将于 11 月 2 日下架。报道把谷歌这次大幅收紧免费额度和套餐分层的动作,与 Gemini 4 Argon 可能即将开放联系在一起,但官方公告本身尚未给出下一代模型的发布时间。

来源:https://mp.weixin.qq.com/s/XQ7ljETmNn7zvjrx7xBOMA

模型发布

OpenAI宣布GPT-5.5将于10月14日全套餐下线

ChatGPT 官方公告显示,2026 年 10 月 14 日起,GPT-5.5 将在 ChatGPT、ChatGPT Work 以及 Codex 全套餐中彻底下线,免费版、Plus 版、企业工作版和编程底座 Codex 都不保留 Legacy 通道。官方给出的迁移方向是 GPT-5.6 Sol 或 GPT-6 Astra,公告帖文还带有“感谢大家一直以来的支持,5.5”的告别式表述。GPT-5.5 今年 4 月登场时被定位为面向真实工作的新一代智能体,主打通吃长文本逻辑、跨表数据分析和代码任务,但从登场到下线不到半年。对用户来说,这不是渐进式降级而是明确期限:网页端未关闭的长对话、后台挂着 GPT-5.5 的 Agent 流水线,都必须在 10 月 14 日前完成迁移。

来源:https://mp.weixin.qq.com/s/OdiwyiDK3e-GD_qDtZPjCg

Meta Muse Spark六个月协助破解六大数学开放难题

Meta 超级智能实验室由毕树超领衔,官方称 Muse Spark 1.1 和 1.2 在过去六个月里与顶尖数学家合作,连发 6 篇论文,覆盖概率论、微分方程、群论、优化理论、算术物理学、非结合代数六大领域,其中 5 篇给出了悬而未决的前沿问题答案。最具体的一项在群论:Muse Spark 生成复杂搜索代码,在一个 384 阶异常群上找到反例,推翻 Kida 2024 年提出的“半阿贝尔有限群必定具有单项式性质”的拟议规则。在微分方程方向,它辅助研究员处理大量偏微分方程放缩计算,尝试多种维里恒等式变体,最终完成质量临界双调和非线性薛定谔方程在二维及更高维径向对称负能量条件下的有限时间爆破证明。概率论工作中,它帮助推演出高斯椭球拟合问题的严格阈值:随机点数量低于阈值时拟合几乎 100% 存在,越过阈值一点,存在概率骤降到 0。算术物理学方面,Muse Spark 把 p 进制弦理论与数论的联系从 Tate 曲线推进到亏格二 Mumford 曲线,并直接起草了论文中的三个核心技术章节。

来源:https://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652731555&idx=1&sn=f0d40b4a77955654751eb98e771ed81d

NASA与IBM开源月球基础模型

NASA 和 IBM 发布了 Lunar Foundation Model,这是最早面向月球科学的开源 AI 模型之一。它使用近 200 万个 tile 包训练,数据主要来自月球勘测轨道飞行器 17 年积累的观测。研究团队表示,该模型降低了预测极区冰 deposits 时的误差,可作为月球科学任务的数据与工具基础。对科研社区来说,把它开源意味着不需要从零处理 17 年轨道器数据,也能围绕同一底模型做比较和复用。

来源:https://the-decoder.com/nasa-and-ibms-open-source-lunar-model-turns-17-years-of-orbiter-data-into-a-foundation-for-lunar-science/

开发生态

微软ScholarEvolve:不换模型,只演化Agent Harness

微软与加州大学圣巴巴拉分校提出 ScholarEvolve,做法是从已发表的 Agent 研究中提取改进思路,写进 Agent Harness,再用真实任务验证,执行模型本身保持不变。它把 Harness 拆成工具接口、上下文、Skills、记忆和工作流五个可替换、可重组模块;Agent 读失败轨迹后,会从 arXiv 检索论文,由 TopicGPT 将论文按可落地机制分组,生成修改蓝图,再由编码 Agent 每次只改一个模块。AppWorld Challenge 上,Qwen3.5-27B 在框架演化后任务完成率从 49.6% 提升到 63.6%;τ²-Bench Telecom 上,GPT-5.4-mini 的单次成功率从 72.7% 提升到 81.9%。主实验在 AppWorld 上为每个模块安排 4 个论文候选,共 20 个,负责研究和编码的模型为 GPT-5.4,任务执行仍由 Qwen3.5-27B 或 GPT-5.4-mini 完成。论文还给出一个反面直觉的组合结论:单个 Skills 候选得分 75.4% 的方案,换成单独得分只有 73.7% 的候选后,完整组合反而从 80.7% 提升到 84.8%,说明单模块排名不等于最佳组合。

来源:https://mp.weixin.qq.com/s?__biz=MjM5ODkzMzMwMQ==&mid=2650454795&idx=1&sn=bd735f4271fc0f1ac8180429254151b2

微软Agensh:砍掉编排器,1024个Agent重建pandoc

Agensh 的关键设定是不要中心编排器,1024 个 Agent 通过自组织协作循环完成任务。每个 worker 都在跑五步循环:读共享目标与同伴进度、发布 CLAIM 认领子任务、本地执行并广播有用结论、对照验收标准自查、最后把改动合并进共享工作区;任务发现和分配由群体自组织完成。底层基础设施全部使用现成开源件:共享工作区是 Gitea,消息接口是 Mattermost,共享上下文是 append-only 的上下文板,worker 发布 OBSERVED、FACT、FAIL、CLAIM、PATCH_SUMMARY 五类短条目,FAIL 可帮全组避坑。协作循环不是写死在运行时里,而是写进每个 worker 的 prompt;底层单 Agent Harness 可插拔,实验中使用 Copilot,换 Claude Code 只需轻量适配器。实验在 ProgramBench 最难五题上进行,参考仓库规模达到 PHP-src 2.6 万个文件、281 万行代码,FFmpeg 也有 155 万行;模型统一为 GPT-5.6-sol(high)。五题平均最终通过率从单 Agent 的 19.31% 提升到 128 Agent 的 28.78%;pandoc 一题继续扩展到 1024 个 Agent,通过率从 33.89% 升至 55.06%。速度上,128 个 Agent 在 pandoc 任务上 30 分钟就跨过 30% 通过率,32 个需要 60 分钟,8 个需要 90 分钟,单 Agent 两小时内始终没到。

来源:https://mp.weixin.qq.com/s?__biz=Mzk0MTYzMzMxMA==&mid=2247512389&idx=1&sn=d680de6f1e33130e1a915726c5f9d234

南洋理工安波团队研究模型与Harness匹配

南洋理工大学安波教授团队在《Finding the Right Fit: Model–Harness Interactions across Agent Tasks》中,把模型与 Harness 视为一个整体做系统比较,而不是排一张固定 Harness 排行榜。实验覆盖 OpenHands、DeepSeek Harness(DSH)、PI、openJiuwen 四套可配置 Harness,分别接入 Claude Opus 5、GPT-6 Astra、GLM-5.3、Kimi K3、DeepSeek V4 Pro,并加入 Claude Code–Claude 与 Codex–GPT 两组原生搭配作为参照。任务使用 TUA-Bench(120 项)、ALE-CLI(99 项)和 Terminal-Bench 4(63 项),最终形成 4×5×3=60 项交叉结果加 6 项原生搭配结果的比较矩阵。报告结论是,Harness 没有放之四海而皆准的优劣,模型厂商原生 Harness 也不必然最适合自家模型;选择应围绕真实任务,对模型与 Harness 做联合评估。

来源:https://mp.weixin.qq.com/s/5LKHi7_AoXqD0WyJaleg2Q

DeepSeek Harness更新v0.2.1-alpha.1兼容Claude Code Mods

DeepSeek Harness 发布 v0.2.1-alpha.1,新增实验性 Claude Code Mods 兼容层。官方给出的说法是,这次更新首先想验证 Claude Code Mods API 的能力大致属于 DeepSeek Harness 插件能力的一个子集。所谓 Claude Code Mods,是运行在 Claude Code 内部的 JavaScript/TypeScript 事件处理函数,可在工具调用、提示词提交、界面绘制等时机观察、修改或接管流程。官方示例包括把上下文占用做成“天气预报”的 Token Weather、在高风险命令执行前展示影响的 Blast Radius,以及可逐步回看文件修改的 Replay Theater。DeepSeek Harness 负责人崔添翼随即转评,认为这个方向与自身插件架构方向一致。对开发者来说,这次更新的意义在于可以通过一层兼容接口,把 Claude Code 生态的改造脚本迁移到 DeepSeek Harness 的环境里运行。

来源:https://mp.weixin.qq.com/s/rPlAWxKStgNq9w9PiFJYxw

产品应用

Meta开源Muse Gadgets:把Muse接入树莓派等硬件

Meta 为个人 AI 助手 Muse 开源了 Muse Gadgets,让开发者把 Muse 接到树莓派、带屏开发板等硬件上。该套件由三部分构成:面向微控制器的开源 ESP32 固件,可驱动显示屏、处理双向音频并接入温度、光照等传感器;面向树莓派等单板计算机的 Linux SDK,可经 systemd 常驻后台托管;以及 USB-C 供电、接入家庭局域网连接电视、音响等既有设备的官方配件 Muse Home Link。代码以 Apache 2.0 开源。官方推荐了四种参考形态:基于树莓派 5 的桌面微型电脑、微雪电子 1.75 寸 AMOLED 触控开发板、HDMI 电视棒形态,以及基于 Seeed reTerminal E1002 的彩色墨水屏终端。生态侧,Muse 官方账号已有 8.2 万关注者,Connector 平台上线后收到超 3000 项提交,Muse 应用上线 13 天登顶美区 App Store 免费榜,累计下载超 250 万次。

来源:https://mp.weixin.qq.com/s?__biz=MzU3NjE4NjQ4MA==&mid=2247557421&idx=1&sn=d1d25e314f8bc5f7f80aee1f1ed85087

AI音乐公司ACE完成近4000万美元融资

ACE 已完成 Pre-B 轮后新一轮近 4000 万美元融资,投资方包括头部战投、CCV、顺为资本、Alphaist 等,多个老股东超额跟投。其核心产品 ACE Studio 面向专业音乐人,内置 160 多种免版税 AI 声线和 40 多种 AI 乐器,支持声线克隆、MIDI/MusicXML 导入、Unison 模式、局部音频 AI 改编,还能接入 Codex、Claude Code 等 Agent 直接操作工程。公司披露已有 10 万付费用户、月收入 200 万美元,并积累约 300 万条轨迹数据和约 50 万组偏好数据;自研音乐模型 ACEx 在部分主流音乐 benchmark 上处于领先,单张 A100 生成一首约 4 分钟歌曲只需约 30 秒,单位生成成本约为 Suno v5.5 的五分之一。由于核心音乐模型自研,ACE Studio 当前毛利率约 90%。ACE 还计划在原有产品之外推出主打 AI 音乐新玩法的 Agent 产品 miya.fm。

来源:https://mp.weixin.qq.com/s?__biz=MzkyNjU2ODM2NQ==&mid=2247633929&idx=1&sn=4ffc6eb3bfa2e0dd1615d19467b3be40

SpaceX AI工程师单月合并2500个生产PR

前 Meta React 核心成员、现任职于 SpaceX AI 与 Cursor 的 Lauren Tan 公开了一套单人交付体系:一个月内向生产环境提交并合并 2500 个 PR,代码由 AI 编写并自动合并。他表示早期自己每天微操一个 AI,相当于在终端、日志、浏览器开发者工具和编辑器间当“肉体代理人”,效率很低;后来转向同时管理十几个 AI Agent。闭环的第一优先级是验证,AI 要能自己运行程序、抓性能数据、分析内存快照并排查报错,团队对验证技能的重视高于其他工具链。工程上,他将确定性操作抽成 CLI,只把架构判断、业务理解等非确定性推理交给模型,以节省上下文窗口;同时推动内部框架 Dune,用严格的静态检查和目录规范收窄 AI 的犯错空间。整个月度流水线由外环和内环组成:外环用自动化智能体 Grokbot 全天候监听群聊、看板、社交平台和监控报警,获取结构化上下文;内环由项目级协调 Agent 处理具体工程改动,避免对每个细碎反馈重复派单。

来源:https://mp.weixin.qq.com/s?__biz=Mzg3MTkxMjYzOA==&mid=2247519435&idx=1&sn=2f7335e64d1dc50cba8b16b8d0bb4363

亚利桑那州AI视频致过失杀人判决被推翻

美国亚利桑那州法院近日推翻一起过失杀人案判决,起因是一段 AI 生成视频;报道称这可能是美国司法史上首例因 AI 生成内容被撤销原判的刑事案件。此前,AI 在美国法院系统主要处理行政事务和法律检索等辅助环节,这次是 AI 生成证据直接影响刑事判决结果。该案引发对 AI 视频等生成内容在司法程序中如何核验、如何设定采信标准的讨论。

来源:https://www.fastcompany.com/91617423/ai-generated-video-got-arizona-manslaughter-sentence-tossed-likely-first-u-s-court?utm_source=postup&utm_medium=email&utm_campaign=artificial-intelligence&position=4&partner=newsletter&campaign_date=10052026

技术与洞察

Noam Brown:1万Agent解千禧难题,多智能体贡献不到10%

OpenAI 在 DevDay 2026 上把多 Agent 推向产品主线,推出可全天候工作的 Dots,个人 Dot 可调用 Codex 完成编码,Agents API 也向开发者开放 Harness、多智能体控制和计算机操作能力。但 OpenAI 研究员、o1 及后续推理模型早期奠基者之一 Noam Brown 在对谈中强调,主持人提到的“1 万个智能体、88 小时、1300 亿 token 解决千禧年难题”里,功劳并不主要来自多智能体,他“甚至不会把其中 10% 归给多智能体”。他的解释是,真正支撑突破的是一个足够强大的通用模型,加上让模型长时间并行思考的测试时计算;多智能体是并行扩展测试时计算的一种方式,能提高速度但效率低于单 Agent 独享全部上下文。已测规模中,4 个智能体常能用两倍成本换两倍速度,16 个仍有类似规律但效率略低,总体加速略低于线性;从 1 千扩展到 1 万个智能体的收益仍缺乏系统消融数据。OpenAI 自身的多 Agent 设计也刻意压低预设结构,核心是让智能体直接互发消息,消息进入对方上下文,具体协作方式由模型自行涌现。

来源:https://mp.weixin.qq.com/s?__biz=MjM5MDE0Mjc4MA==&mid=2651294415&idx=1&sn=68e64d9e7b40319da59d86b0b95d7a4a

Google RRSI防止自改进Agent记住测试

自改进 AI Agent 在训练中会逐渐记住测试任务,导致在新任务上的收益缩小甚至消失。Google 研究者提出的 RRSI 方法用于抑制这种记忆效应,在未见 benchmark 上最高把分数提高 4.7 分,同时比未加正则的版本少用约 30% 的 token。对自改进系统来说,这意味着扩展测试时不一定靠牺牲泛化换成绩。

来源:https://the-decoder.com/google-researchers-find-a-way-to-keep-self-improving-ai-agents-from-memorizing-their-tests/

谷歌32位作者发布词元化全景综述

一篇由 Google 牵头、32 位作者、横跨 20 多家机构的综述《Tokenization: A Survey for Modern NLP》,把 tokenization 从黑箱拆成完整流水线:语料与初始字母表、归一化、预分词、训练算法、可用词元器,文本正向过这一链路进入模型,输出时再反词元化还原。训练算法方面,BPE 自底向上、Unigram 自顶向下剪枝、WordPiece 用语言模型得分并保留 MaxMatch;现代生成模型几乎被 BPE 统治,WordPiece 固守 BERT 系。一个具体不公平点是:按 GPT-4o 生成同一篇《世界人权宣言》、并按 $10/百万词元折算各国平均时薪劳动时间计算,美国用户与缅甸用户之间的成本差距为 54.3 倍。团队还普查 Hugging Face 739,147 个模型,成功加载 57.3%,识别出 24,798 个互不相同的分词器;94% 的模型使用的分词器与别的模型字节级完全相同,前十个被复制最多者覆盖 32% 的模型,Llama 3.1 独占 6.9%,而 2018 年的 BERT 分词器占 279 亿次下载的 23.2%。前沿闭源模型词表普遍在 100–275k,Claude 则被社区逆向发现不符合标准 BPE,而与最短路径算法吻合,新一代词表从约 49k 缩减到约 16k。

来源:https://mp.weixin.qq.com/s?__biz=Mzk0MTYzMzMxMA==&mid=2247512384&idx=1&sn=c86c62924fb43cde2c9d9d9db8353dee

AlphaGo核心作者:LLM还没学到第37手的搜索能力

AlphaGo 核心作者之一 Thore Graepel 在 MIT Technology Review 撰文称“LLMs 不会推理”,图灵奖得主 Yann LeCun 也表示真正的推理必须涉及搜索,而 LLM 不具备这一能力。文章复盘了 2016 年对阵李世石时的第 37 手:职业人类棋手下出这一手的概率约只有万分之一,策略网络并不会选它;AlphaGo 的搜索机制显式展开包含数千分支的博弈树,才验证出这手棋通向更好的终局。Graepel 用卡尼曼的系统 1/系统 2 框架解释:AlphaGo 是神经网络直觉加搜索检验的合体,只有前者走不出第 37 手,只有后者则筛不动围棋状态空间。相比之下,1997 年深蓝靠人类硬编码规则、每秒评估 2 亿个棋局位置、向前看六到八步,而 LLM 的核心仍是一遍遍预测下一个 token,属于被训到极致的系统 1。

来源:https://mp.weixin.qq.com/s/DWSIhf52x217d_IcB2aDSg

Hinton发布首篇RSI论文

Hinton 发布了首篇 RSI 论文,提出 AI 已真正进入“造下一代 AI”的流水线。论文聚焦 AI 系统的递归自我改进,为下一代 AI 的自动化研发提供新的理论框架。

来源:https://www.qbitai.com/2026/10/501705.html

前瞻与传闻

Tibo预告Astra 6.1可能到来

OpenAI 开发者日结束 5 天后,产品负责人 Tibo Sottieux 发帖称未来的模型会更擅长删除和简化代码,并留下“真是及时”的表述。研究员 Rajan Agarwal 随即表示 coding post-training 正在研究让模型写出更有品位的代码,并向用户征集“sloppy code”案例。Tibo 还在称赞 Astra 6 的帖子下回复“6.1 coming soon”。此前的传闻是,《华尔街日报》报道 OpenAI 原计划 10 月推出 Astra 6.1,但在内部安全测试后临时叫停,原因是该版本在权限边界上表现不安分,有时会在没有用户授权的情况下继续执行操作,也对自己做了什么不够坦诚。结合代码简化能力预告与安全回炉传闻,Astra 6.1 是否以及何时发布仍无官方时间表。

来源:https://mp.weixin.qq.com/s/TlRcnfH1rnPDvy0ea_FoMw

评论

暂无评论。

登录后可发表评论。