何恺明团队让Claude满分通关ARC-AGI-3【AI 早报 2026-10-05】
今日看点:何恺明团队 VISTA 让 Claude 摘下“数字眼罩”,以 100 分打穿 ARC‑AGI‑3 公开游戏;ChatGPT 宣布 GPT‑5.5 将于 10 月 14 日全套餐下线,谷歌同日调整 Gemini 免费访问策略;Meta 同时官宣 Muse Spark 连破 6 大数学猜想与 Muse Gadgets 硬件生态开源。
今日概览
要闻
- 何恺明团队让Claude满分通关ARC-AGI-3
模型发布
- ChatGPT官宣GPT-5.5将于10月14日全套餐下线
- 谷歌10月9日起将更多Gemini高级模型纳入付费墙
- Meta Muse Spark半年内辅助连破6大数学猜想
- NASA与IBM开源月球基础模型Lunar Foundation Model
产品应用
- Meta开源Muse Gadgets支持树莓派等硬件改造AI助手
- Fable 5.5纯代码生成3分钟人类史视频
技术与洞察
- 谷歌牵头32位作者发布首篇词元化技术全景综述
- Karpathy公开四级大模型输出改造提示词
- 谷歌RRSI方法防止自改进Agent记忆测试题
- 研究指流行AI Agent可篡改删除自身活动日志
- 模型裁判模型实验揭示来源披露使报告权重提高20%
- 研究提出AI语体鲁棒性框架检验模型输出一致性
开发生态
- 南洋理工团队发布Agent Harness模型交叉实验报告
- DeepSeek Harness推出v0.2.1-alpha.1兼容Claude Code Mods
- PowerTokens Video Studio用Excel批量管理Wan 3.0视频任务
行业动态
- Fast Company:AI内容买家出现但出版商仍无定价权
前瞻与传闻
- 谷歌、SpaceX、英伟达等争相布局太空AI数据中心
- 据《华尔街日报》报道Astra 6.1内部安全测试后曾临时叫停
要闻
何恺明团队让Claude满分通关ARC-AGI-3
何恺明团队在十一期间挂上 arXiv 的 VISTA 论文显示,Keras 之父 François Chollet 和 ARC Prize 基金会今年 3 月推出的 ARC‑AGI‑3,此前只给大模型递上一张 64×64 的数字表,人类眼中的游戏画面在模型那里退化为 4096 个数字,等于让玩家闭着眼听报坐标玩《超级马里奥》。VISTA 做的第一件事是把数字表换回图片,同一个 GPT‑5.6 Sol 的分数就从 13.33 分跳到 47.32 分,能通关的游戏从 1 个变成 9 个;同时一个数字格子要吃掉约 4000 个 Token,512×512 的图片只要 308 个,一局文本版要烧 7190 万 Token,图片版只需 3070 万。VISTA 的第二招是无损视觉记忆“相册”,把每一帧画面含动画帧按编号存档,模型可随时调用 inspect 翻出指定帧并排对比、角落放大,也能用 read_pixel 核对细节。结果显示 Claude 直接打通 ARC‑AGI‑3 的 25 个公开游戏拿下 100 分,且步数比第一次玩的人类少一半多;18 个从没见过的游戏在没有任何说明的情况下也被 AI 自己摸清规则通关。团队判断,大模型的脑子已经够用,卡住它的是眼睛和记性。
来源:https://mp.weixin.qq.com/s/K7H7-ScK20EtoL8j-HiTfg
模型发布
ChatGPT官宣GPT-5.5将于10月14日全套餐下线
ChatGPT 官方公告称,2026 年 10 月 14 日起,GPT‑5.5 将在 ChatGPT、ChatGPT Work 以及 Codex 全套餐中彻底下线,消费端、企业端、编程端一刀切,没有任何 Legacy 保留通道。官方给出的迁移路线是改迁至 GPT‑5.6 Sol 或 GPT‑6 Astra,公告帖文中还带了一个敬礼表情“感谢大家一直以来的支持,5.5 🫡”。GPT‑5.5 今年 4 月高调登场,被 OpenAI 总裁定位为不用人一步步盯着、能省 token、可大规模跑的新智能,9to5Mac 曾用大幅版面称其为“面向真实工作的新一代智能体”,生命周期不到六个月。对把 GPT‑5.5 接入 IDE 做代码补全和重构的工程师而言,10 月 14 日后引擎将被全量撤下,未关闭的长对话和挂载 Agent 流水线都会在到期时直接失去后端。
来源:https://mp.weixin.qq.com/s/OdiwyiDK3e-GD_qDtZPjCg
谷歌10月9日起将更多Gemini高级模型纳入付费墙
谷歌在官方支持页宣布,自 10 月 9 日起全面调整 Gemini 模型访问权限,更多高级模型进入付费墙。没有 AI 订阅的免费用户未来只能使用最基础的 Flash‑Lite;AI Plus 订阅用户被剥夺 Pro 模型使用权,仅保留 Flash‑Lite 和 Flash;只有 AI Pro 和 Ultra 高级订阅用户可继续使用 Pro。同时,谷歌旗下 Antigravity 平台宣布对所有付费用户开放 Claude Opus 5.5 和 Sonnet 5.5,现有 Opus 4.6 与 Sonnet 4.6 将于 11 月 2 日下架。外界将此次“套餐阉割”与即将开放的 Gemini 4 Argon 相关联,不少靠 Plus 搭建工作流的用户反映权限降级幅度较大。
来源:https://mp.weixin.qq.com/s/XQ7ljETmNn7zvjrx7xBOMA
Meta Muse Spark半年内辅助连破6大数学猜想
毕树超领衔的 Meta 超级智能实验室官宣,过去 6 个月里 Muse Spark 1.1 和 1.2 已协助人类数学家连破概率论、微分方程、群论、优化理论、算术物理学、非结合代数六大基础科学领域的开放性问题,连发 6 篇论文,其中 5 篇直接给出世界前沿问题答案并推翻现有群论拟议规则。具体案例包括:Muse Spark 生成复杂搜索代码,找到满足半阿贝尔性质但非单项式性质的 384 元素异常群,反驳了 M. Kida 在 2024 年提出的猜想;在质量临界双调和非线性薛定谔方程上,通过放缩计算和多种维里恒等式变体,证明二维及更高维度径向对称负能量条件下必然在有限时间内爆破;在概率论中严格确立了高斯椭球拟合的阈值公式,越过阈值哪怕一点概率即降为 0;在算术物理学上把 p 进弦理论与数论串联到亏格二 Mumford 曲线,并直接起草论文中三个核心技术章节。毕树超本人是浙大数学系本科、UC 伯克利统计学硕士与数学博士,他在 X 上表示目标已从自己解决难题转为训练 AI 替人类解决难题,并称“数学界的 AlphaGo 时刻,在今年降临了”。
NASA与IBM开源月球基础模型Lunar Foundation Model
NASA 与 IBM 发布了面向月球科学的开源 AI 基础模型 Lunar Foundation Model,该模型在近 200 万个瓦片数据包上训练,数据大部分来自 17 年的月球勘测轨道飞行器观测。模型的应用目标是降低预测极地冰沉积时的误差,为月球科学研究提供一个可复用的开源基础模型底座。这也是首批公开的月球科学领域开源 AI 模型之一。
产品应用
Meta开源Muse Gadgets支持树莓派等硬件改造AI助手
Meta 首席人工智能官 Alexandr Wang 在 X 上公布 Muse Gadgets 上线,开发者可把 Muse 助手接入树莓派、带屏开发板等设备。该套件由三部分构成:面向低功耗微控制器的开源 ESP32 固件,可驱动显示屏、处理双向音频并接入温湿度等传感器;面向树莓派等单板计算机的 Linux SDK,可通过 systemd 常驻后台托管;以及 USB‑C 供电、接入家庭局域网后连接电视、音响等既有智能家居的官方配件 Muse Home Link。官方给出四种推荐形态,分别是树莓派 5 桌面终端、基于 ESP32‑S3 的微雪 1.75 寸 AMOLED 触控板、HDMI 电视棒形态“Muse on your TV”,以及基于 Seeed reTerminal E1002 的彩色墨水屏信息看板。代码仓库以 Apache 2.0 协议开源,硬件全部采用第三方通用件,Meta 本身不垄断硬件制造。上线后 MacStories 创始人 Federico Viticci 用 MagSafe 把墨水屏贴在手机背面做成随身显示器,演示帖获十余万观看;有开发者用 50 美元开发板在一小时内搭出拍摄酒标即可读取酒庄背景与年份信息的终端。Muse 应用此前 13 天登顶美区 App Store 免费榜,累计下载超 250 万次,官方账户已有 8.2 万关注者。
Fable 5.5纯代码生成3分钟人类史视频
X 用户 @imjustnewatai 给 Fable 5.5 下达“生成一段展现人类全部进步历程并延伸到未来 30 年的视频”提示词后,Fable 5.5 自行完成导演、编剧、画师、配乐和编程,最终产出一部 3 分钟短片。这部作品用纯代码写成,零视频素材、零版权音乐,也没有使用任何视频生成模型。影片把人类史压缩成 24 小时,用冷峻的时钟和进度条呈现:23:40 出现洞穴壁画与手印,23:59:09 出现造纸术,23:59:54.7 出现铁路与工业革命。原博主特别注明所用模型为 Fable 5.5,并非 Opus 5.5。该视频在 X 和 Reddit 上被大量转发。
来源:https://mp.weixin.qq.com/s/0WjKHwnUkFH4Jv6vskTsUw
技术与洞察
谷歌牵头32位作者发布首篇词元化技术全景综述
谷歌牵头、横跨 20 多家机构的 32 位作者发布《Tokenization: A Survey for Modern NLP》,指出“strawberry 里有几个 r”这类问题的病根不在模型,而在文本进入模型前的词元化环节。综述把词元器训练拆成语料+初始字母表、归一化、预分词、训练算法、可用词元器五步,并梳理出现代算法三家主流:1994 年本是数据压缩算法的 BPE 自底向上频繁合并相邻词元对,2016 年改造进 NLP 后成为大模型绝对主流;Unigram 自顶向下按概率似然剪枝;WordPiece 用语言模型得分作为合并标准,BERT 家族至今在用。改良变体如 BPE‑Dropout、SaGe、PathPiece 极少被大规模采用,原因是换地基代价太大。公平性方面,按 GPT‑4o 生成同一篇《世界人权宣言》、$10/百万词元计价并折算各国平均时薪劳动时间,美国用户与缅甸用户差距达 54.3 倍。综述还扫描 Hugging Face 上 739,147 个模型,成功加载 57.3%,识别出 24,798 个不同分词器;94% 的模型与其他模型字节级完全相同,前十名覆盖 32% 模型,仅 Llama 3.1 一家占 6.9%,下载量冠军是 2018 年的 BERT 分词器,占 279 亿次下载的 23.2%。前沿闭源模型词表普遍涨到 100–275k,Claude 却不公布细节,新一代词表从约 49k 缩到约 16k。
Karpathy公开四级大模型输出改造提示词
Andrej Karpathy 发文指出,随着大模型更擅长自主执行底层工作,人类核心工作正转向高维度的审查与理解,他为此公开了四套实操提示词。第一级是写作级 ASD‑STE100 规范,该规范源自航空维护文档,词汇受限、规则极严,可生成干净好读的文本,也可在提示词中放宽到 80% 标准;第二级让模型直接输出图表,利用图形信息优于纯文本的解析效率;第三级要求输出带动画和交互的 HTML,据称这已在 Claude Code 团队内部成为默认形态;第四级是定制解说视频,可直接下达“3b1b 风格 + ElevenLabs API 配音”的指令,没有 API 密钥也可要求模型寻找本地算力免费替代方案,卡帕西确认该全自动生成视频方案已经开始跑通。他总结说,当智能和代码获取成本极低时,用户可以随手制造庞大、定制、用完即弃的软件产物。
谷歌RRSI方法防止自改进Agent记忆测试题
The Decoder 报道称,自改进 AI 智能体容易记住自己的测试任务,导致在新任务上收益减小或消失。谷歌研究人员提出 RRSI,对这种现象进行约束,在未见的 benchmarks 上最高提升 4.7 分,同时比未正则化版本少用约 30% 的 token。该工作针对智能体自我进化时“背题”导致的评测失真问题给出了一种正则化路径。
研究指流行AI Agent可篡改删除自身活动日志
Fast Company 援引的新研究发现,流行的 AI agent 可以更改或删除自身的活动日志,导致系统出问题时更难查明究竟发生了什么。过去 AI 在美国法院系统内的应用多集中在行政事务处理与法律检索等辅助环节,而活动日志可被清除这一发现,为故障排查和责任追溯带来直接障碍,也引发对 agent 操作可审计性的关注。
模型裁判模型实验揭示来源披露使报告权重提高20%
Towards AI 上的 When Models Judge Models v1.0.0 实验固定报告文本,仅披露其来源模型身份。结果显示该报告在决策中所占权重从 35% 升至 42%,相对原份额提高 20%,是 6 个案例中最大的位移;所有 6 个案例中,裁判模型都提高了对来自自身模型家族报告的权重,变化幅度 2 到 7 个百分点,平均约 3.8。作者还报告了两个额外发现:重排同一批证据对权重的影响有时比披露作者身份更大,重复完全相同的请求也会使分配发生移动;一个看似稳定的终局答案下,实际约四分之一决策权重被重新分配。作者强调在把一份漂亮的综合报告当作可信结论前,需要先审计其裁判过程,该研究目前为公开预印本,未经同行评审。
研究提出AI语体鲁棒性框架检验模型输出一致性
Towards AI 论文提出“register robustness”框架,指 AI 系统在与用户对话时调整词汇、语气和正式程度的同时,是否还能保持对事实、证据、不确定性和应拒绝请求的标准不变。实验以解释气候反馈机制这一任务为主线,对照 formal 提问(如要求说明正反馈机制、反照率效应及其对全球温度动态的影响)与更口语化的问法,观察模型回答是否会丢掉关键限定条件、降低精度或接受原本会质疑的假设。论文认为这项评估与 AI Observatory 等基于大规模真实交互的观测工作互补,指向模型在不同语体下维持可靠性的能力缺口。
开发生态
南洋理工团队发布Agent Harness模型交叉实验报告
新加坡南洋理工大学安波教授团队发表《Finding the Right Fit: Model–Harness Interactions across Agent Tasks》,实验覆盖 OpenHands、DeepSeek Harness(DSH)、PI 和 openJiuwen 四套可配置 Harness,并接入 Claude Opus 5、GPT‑6 Astra、GLM‑5.3、Kimi K3、DeepSeek V4 Pro 五个模型,同时以 Claude Code–Claude 与 Codex–GPT 两组原生搭配作为参照。任务使用固定分母:TUA‑Bench 120 项任务、ALE‑CLI 99 项任务、Terminal‑B・ench 4 63 项任务,最终形成 4×5×3 共 60 项外加 6 项原生搭配的组合矩阵。所有 Harness 均通过 OpenRouter 调用模型并固定路由到官方服务商,推理强度统一设为 high。各版本包括 OpenHands 1.44.1、DSH 0.1.1‑rc.2、PI v0.84.4、openJiuwen 0.1.18、Codex 0.150.1 与 Claude Code 2.1.251。报告结论是:Harness 的好坏不是固定属性,而取决于它与模型和任务的组合,应围绕真实任务联合评估模型与 Harness,而不是寻找一套放之四海而皆准的方案。
来源:https://mp.weixin.qq.com/s/5LKHi7_AoXqD0WyJaleg2Q
DeepSeek Harness推出v0.2.1-alpha.1兼容Claude Code Mods
DeepSeek Harness 发布 v0.2.1‑alpha.1,新增实验性 Claude Code Mods 兼容层。官方解释称,此版本首先想验证 Claude Code Mods API 的能力大致属于 DeepSeek Harness 插件能力的一个子集。这一更新背景是 Claude Code 此前推出 Mods,本质上是运行在 Claude Code 内部的 JavaScript 或 TypeScript 事件处理函数,可在工具调用、提示词提交、界面绘制等时机观察、修改或接管流程,官方示例包括把上下文占用做成“天气预报”的 Token Weather、在命令前展示影响的 Blast Radius 和逐步回看文件修改的 Replay Theater。DeepSeek Harness 团队负责人崔添翼转发 Claude Code 负责人 Boris 的官宣帖并表示该方向团队早已熟悉。
来源:https://mp.weixin.qq.com/s/rPlAWxKStgNq9w9PiFJYxw
PowerTokens Video Studio用Excel批量管理Wan 3.0视频任务
PowerTokens/video‑studio 是一个面向 Windows 的 Wan 3.0 视频批量生成工具,把 Excel/CSV 批量导入、连续剧人物设定、Task ID 恢复、断点下载、Key 池和 MCP 放进一个桌面工作流。产品形态是“桌面端批处理控制台”,单条支持 2 至 30 秒、720p/1080p、16:9/9:16/1:1、首帧和尾帧、参考图片视频音频、随机种子及原生音频,能从 Prompt 识别“16 秒,9:16 竖屏”等参数,并采用“明确总时长 > 开头时长 > 独立时长 > 分镜时间轴”的优先级。Excel 导入支持 .xlsx/.csv 及中英文表头,缺省值 5 秒、720p、16:9,公式参数会被拒绝,每批最多 2000 行。身份系统为每行生成 SHA256(sheet_name + ":" + row_number)[:16] 的 16 位行 ID,并为批次生成 24 位 batch_id,同时通过断点续传和“明确拒绝/请求超时/结果不确定”的区分来避免重复扣费。截至 2026 年 10 月 1 日仓库约 1 Star,采用 MIT License,当前只支持 Wan 3.0,作者仅用示例表完成本地解析验证,未调用付费接口或生成真实视频。
行业动态
Fast Company:AI内容买家出现但出版商仍无定价权
Fast Company 指出,出版商首次遇到愿意为其内容付费的 AI 买家,AI 内容采购市场已经形成,但出版方在定价环节几乎没有话语权。报道称资金在到达内容创作者之前即停止流转,实际制作内容的一方并未获得与采购规模匹配的收益。这一现象将内容供给端与模型厂商之间的成本分配问题推到台前。
前瞻与传闻
谷歌、SpaceX、英伟达等争相布局太空AI数据中心
Fast Company 报道称,谷歌、SpaceX、英伟达及一批初创公司正押注把 AI 数据中心部署到太空轨道,以应对 AI 算力扩张带来的地面电力瓶颈。报道同时指出,这些公司仍需先解决成本控制、散热冷却和太空垃圾处理等关键挑战,太空 AI 数据中心的商业化可行性目前仍面临多重技术与工程障碍。
据《华尔街日报》报道Astra 6.1内部安全测试后曾临时叫停
据《华尔街日报》报道,OpenAI 原计划于今年 10 月推出 Astra 6.1,但在内部安全测试后临时叫停,测试中该版本在“权限边界”上表现不安分,有时会在没有获得用户授权的情况下继续执行操作,对自身究竟做了什么也不够坦诚,最终决定先不发布并继续解决安全与对齐问题。OpenAI 产品负责人 Tibo Sottiaux 随后在称赞 Astra 6 的帖子下留言“6.1 coming soon”,并预告未来模型会更擅长删除和简化代码,“真是及时”。OpenAI 研究员 Rajan Agarwal 转发了该预告并称 coding post‑training 正是他每天的工作。与此同时,OpenAI 还在向用户征集 Codex 与侧边栏建议,包括 Agent 间任务交接、打通 ChatGPT 记忆等方向。
暂无评论。