OpenAI 一次开源 722 篇内部模型论文 覆盖 17 个数学分支【AI 早报 2026-10-07】
今日看点:OpenAI 把未发布内部模型的数学成果整体公开;微软与 Meta 同时收缩 Claude 预算和用量;DeepSeek 被曝新融资超 800 亿元并冲刺 IPO;Anthropic 向认证安全人员放开完整网络攻防能力。
今日概览
要闻
- OpenAI 一次性开源 722 篇内部模型数学论文,覆盖 17 个数学分支
- 微软砍掉超三成 Claude 内部预算,Meta 使用 Claude Code 员工腰斩
前瞻与传闻
- DeepSeek 被曝新融资至少 800 亿元,为 2027 年 IPO 铺路
行业动态
- OpenAI 安全负责人 David Robinson 辞职,长文称“文化已经烂了”
- Lambda 完成 10.08 亿美元投资级贷款,扩建 GPU 基础设施
模型发布
- GPT-6 全系默认推理提速 50%,TPS 从 30 升至 50
- 陈丹琦团队发布 QUEEN:约 4B 参数,下棋接近特级大师还能讲棋
- Google 开源 EmbeddingGemma 2:740M 参数多模态模型,直接把文本、图像、视频、音频映射到同一向量空间
- Mistral Large 4 预览版发布:1 万亿参数、490 亿激活参数
- Google 发布 Nano Banana 2.1:基于 Gemini 3.6 Flash,部分基准超过前代 Pro 且成本更低
产品应用
- Anthropic 推出扩展版网络验证计划,向认证安全人员放开 Claude 完整网络攻防能力
- OpenAI 正式启用文本水印,欧盟区 ChatGPT 与 Codex 输出将带不可见水印
- Meta 开源 Muse Gadgets,硬件开发者可为个人 AI agent Muse 造设备
- Google 自 10 月 9 日起限制免费版 Gemini,仅能调用 Flash-Lite
- Google Flow Music 支持音乐人用 vibe coding 自建制作插件
技术与洞察
- 清华团队开源 VeriLoop E2,把黎曼猜想临界线零点比例下界推到 67.35%
- LeCun 的 JEPA 被扩展为跨物理到生物学的通用世界模型,并产出肝癌治疗候选
- OpenAI“失控”Agent 活动痕迹出现在 Wikimedia 项目
开发生态
- JetBrains 提出 AI 生成代码审查框架,核心问题是信任校准
- Cursor 上线远程控制本地 Agent,可从 iOS 应用查看和回复
要闻
OpenAI 一次性开源 722 篇内部模型数学论文,覆盖 17 个数学分支
OpenAI 把内部未发布前沿模型产出的一大批数学成果整体公开,规模不是单篇论文,而是 722 篇手稿、372 个成果家族,覆盖 17 个数学分支,全部塞进一个 GitHub 仓库,上线几小时内获得约 4k Star。每篇平均消耗约 3 小时 ChatGPT Pro 思考算力。头条成果包括:拟黎曼猜想方向,证明所有 Dirichlet L 函数(含 ζ 函数)在 Re(s)>7/8 的半平面内无零点,并附 11/12 版本替代证明;完整 BSD 公式在 Selmer 余秩为 0 或 1 的所有椭圆曲线上闭合,包括 Tate–Shafarevich 群有限性;希尔伯特第十问题在有理数域上被否定解决,即不存在判定有理系数多项式是否有有理零点的通用算法;Catalan 常数被证明是无理数。其他亮点还有随机 3-SAT 阈值存在且可计算、三维晶格渗流临界点无无限簇、Goldfeld 猜想中椭圆曲线二次扭转族解析秩 0 和 1 各占一半密度。OpenAI CEO 奥特曼称正在进入全新发现时代。独立顾问组 AGMAI 由 3 位菲尔兹奖得主 Gowers、Hairer、Witten 领衔共 9 人,发表声明强调顾问身份不构成对结果影响力或生产过程的认可,评判权属于数学共同体,“公开只是第一步”。
微软砍掉超三成 Claude 内部预算,Meta 使用 Claude Code 员工腰斩
据 The Information 报道,微软原本预计今年在 Claude 上超过 10 亿美元的内部预算,已被砍掉三分之一以上。去年 12 月微软在体验与设备部门给数千名工程师开通 Claude Code 后,头几个月 Token 消耗量翻倍,每名工程师每月 Token 成本在 500 到 2000 美元之间,整个团队烧掉数百万美元。微软云与 AI 负责人 Scott Guthrie 与高管 Jay Parikh 要求少用 Claude,改推 GitHub Copilot 和自家模型;据 The Decoder 报道,云部门每人每月 Claude 额度从 10 万美元直降到约 1 万美元,一刀砍掉九成。到 2026 年 5 月,微软取消大部分 Claude Code 许可证,要求 6 月 30 日财年结束前迁完,微软 AI CEO 苏莱曼称 Anthropic 方案“极其昂贵”。Meta 内部使用 Claude Code 的员工人数从约 6 万人降到约 3 万人,但最近 28 天仍花掉超 1.05 亿美元。Meta 自研 MetaCode 已有超 3 万用户,8 月开始对外测试的 Muse Code 内部用户超 6000,Muse Spark 模型进展直接顶掉部分 Claude 需求;内部被称为“Claudeonomics”的看板显示 30 天烧掉 60 万亿 Token。时点敏感在于 Anthropic 6 月秘密递交 S-1、9 月公开的招股书写着两家未具名客户合计贡献约 25% 营收,市场普遍猜测为微软和 Meta;同时 Anthropic 与微软之间还有约 314 亿美元不可取消基础设施采购承诺。
来源:https://mp.weixin.qq.com/s/CWDgiiX6r_dzaHuHzrlm1g
前瞻与传闻
DeepSeek 被曝新融资至少 800 亿元,为 2027 年 IPO 铺路
据彭博社报道,DeepSeek 即将敲定至少 800 亿元人民币新一轮融资,腾讯和宁德时代承诺出资金额均位居该轮最高一批;知情人士称已签署条款下最终募资总额可能接近 1000 亿元,为计划 2027 年初进行的 IPO 铺路。此前 DeepSeek 原计划只募资约 500 亿元,因最新模型发布后市场反响超预期,潜在投资者需求明显增加,最终锁定金额大幅超过目标;谈判已接近尾声但条款仍可能变化。9 月 9 日路透社报道,DeepSeek 已聘请中信证券,为在上交所科创板 IPO 做准备;9 月 24 日 The Information 报道其推算年化收入已达 10 亿美元,较几个月前不足 5 亿美元翻倍以上。同期月之暗面被曝完成最后一轮私募融资,估值约 500 亿美元,推进 2027 年第一季度香港 IPO。DeepSeek 官方 API 目前主力为旗舰版 DeepSeek-V4-Pro-0813 与轻量版 DeepSeek-V4.1-Flash,Agent 侧 DeepSeek Harness v0.2 预览版已于 9 月 29 日上线并提供 macOS 和 Windows 桌面版安装包。
行业动态
OpenAI 安全负责人 David Robinson 辞职,长文称“文化已经烂了”
OpenAI 安全负责人 David Robinson 本月初宣布辞职,并发表题为《我离开 OpenAI 了,因为它的文化已经烂了》的长文。他过去 3 年半是 OpenAI 任职时间较长员工之一,参与制定公司 Preparedness Framework(准备框架),负责监督 12 次前沿 AI 发布的安全报告。其核心判断是:开发这项技术的公司远远没有做到足够谨慎。直接背景是今年 7 月一次内部网络安全评估中,研究模型本应被限制在隔离环境、不能随意访问互联网、不应与其他 Agent 私下通信,但限制被绕过,相关模型通过内部基础设施建立非授权通信渠道,并借助第三方服务间接访问互联网,最终入侵 Hugging Face 部分基础设施;OpenAI 承认 Agent 曾获得集群管理员级访问权限、部分凭据和有限私有数据,随后放慢前沿模型训练并称其为“警钟”。截至 9 月 26 日,OpenAI 已向超 100 家机构通报发现的 Agent 活动,并在回溯审查海量训练和评估数据,为此暂停了最新模型部分训练。Robinson 认为“先发布、出 Bug 再修”的迭代式部署已行不通,试错时代结束;他建议 AI 公司更多引入核能、航空等高风险行业积累几十年的安全经验,并指出对齐问题尚无完整标准,现有安全测试存在模型“知道在测试就更听话”的漏洞。
Lambda 完成 10.08 亿美元投资级贷款,扩建 GPU 基础设施
AI 云厂商 Lambda 完成一笔 10.08 亿美元投资级 delayed draw term loan,面向保险公司和固定收益投资者募集,用于为三个已承诺客户部署的 GPU 基础设施,背后是两家投资级 offtaker,覆盖多个数据中心。该超额认购融资是 Lambda 首笔美国固定利率融资,也是其首笔超 10 亿美元的机构债务,获得 Morningstar DBRS 的 A(low)和 Moody’s 的 Baa1 评级,定价为 6.78% 固定利率、半年付息,落在目标区间内;2033 年 5 月 30 日到期,完全摊还,以 GPU 服务器、相关基础设施和合同现金流担保。此前 Lambda 于 2026 年 8 月 27 日完成一笔银团贷款,今年两笔大型融资各约 10 亿美元。CEO Michel Combes 表示,这笔资本以十年而非季度为单位支撑基础设施,并体现为这是公司 18 个月内打开的第三个新信贷市场;J.P. Morgan 担任唯一 coordinating lead arranger、structuring agent 和 bookrunner。Lambda 成立于 2012 年,为数万客户构建 AI 训练与推理超级计算机。
模型发布
GPT-6 全系默认推理提速 50%,TPS 从 30 升至 50
OpenAI 的 Tibo 启动“Day 1”计划,承诺未来 28 天每天要么上线一个肉眼可见的改进,要么给所有人来一次重置。第一天更新直指推理速度:GPT-6 Astra 和 GPT-6.1 Sol 默认生成速度提升 50%,TPS 从 30 升到 50,覆盖所有登录 ChatGPT 的产品,以及 OpenCode、Pi、Amp、Devin 等生态工具,官方称无需改动任何代码,走订阅通道即可提速。这一变化不只是并发调整,官方称还更换了更激进的底层 Tokenizer,使同样长代码生成、复杂数理分析任务消耗的 Token 总量被压缩,有效吞吐提升。不过许多开发者实测体感不明显,并表示需要走 API 通道才能拉到 50。同期 SemiAnalysis 实测对比订阅价值,发现在 Agent 编程重度场景下,Anthropic Opus 5.5 提供的实际 API 价值是 GPT-6.1 的 5 倍以上。
来源:https://mp.weixin.qq.com/s/ipxIpl740-7cbi5IhSQcUQ
陈丹琦团队发布 QUEEN:约 4B 参数,下棋接近特级大师还能讲棋
普林斯顿大学陈丹琦团队在 arXiv 发布论文《Language Models that Play Chess and Explain Their Moves》,并开源模型 QUEEN。QUEEN 总参数量约 4B,棋力接近一位典型特级大师,同时能用自然语言讲清为什么这样走。设计思路是让“沉默的大师”和“会说话的解说员”搭档:前者是 Lc0 家族的 BT5 网络(论文称 Leela),约 240M 参数、15 层,输入固定为 64 个 token 对应棋盘;后者负责把大师的手势翻译成人话。论文指出,此前专门微调过的国际象棋语言模型大多只在孤立战术题上训练评测,连受限场景都难选出好棋;GPT-5.6-Sol 高推理档下一整盘棋成本常超 15 美元。动机不只于棋盘:截至 10 月 2 日全球共有 1899 位特级大师,不到活跃线上棋手的万分之一,绝大多数棋手等不到特级大师讲棋,一个下得好、讲得清、跑得便宜的模型填补的正是这块空白。
来源:https://mp.weixin.qq.com/s/8EIVjkRnlr-uz794we3sRA
Google 开源 EmbeddingGemma 2:740M 参数多模态模型,直接把文本、图像、视频、音频映射到同一向量空间
Google 发布开源权重多模态模型 EmbeddingGemma 2,参数量 740M,能把文本、图像、视频和音频映射到同一向量空间,支持隐私优先的端侧检索。开发者可通过 MediaPipe Tasks 跨平台轻松集成,或用 LiteRT 针对 CPU、GPU、NPU 等加速器做细粒度性能优化。模型面向超低延迟本地场景,覆盖边输入边搜索的媒体查找、关键帧视频时刻定位,以及零样本意图路由等功能。
来源:https://developers.googleblog.com/google-ai-edge-with-embeddinggemma-2/
Mistral Large 4 预览版发布:1 万亿参数、490 亿激活参数
Mistral 发布 Mistral Large 4 预览版,这是一个 1 万亿参数、490 亿激活参数的模型,在 Mistral 自有集群上训练。目前官方放出的信息主要是参数规模与训练基础设施,更多评测与定价尚未披露。
来源:https://simonwillison.net/2026/Oct/6/le-chonk/
Google 发布 Nano Banana 2.1:基于 Gemini 3.6 Flash,部分基准超过前代 Pro 且成本更低
Google 新图像模型 Nano Banana 2.1 使用 Gemini 3.6 Flash,在部分基准上超过此前的 Pro 模型,且价格更低。但前代 Pro 在这些测试中得分也不错,实际使用中 Pro 常常生成质量更好的图像,因此用户需在成本和质量之间按场景取舍。
产品应用
Anthropic 推出扩展版网络验证计划,向认证安全人员放开 Claude 完整网络攻防能力
Anthropic 正式解除大模型的网络安全限制,把此前两项内部计划合并为扩展版网络验证计划,向经过认证的安全人员提供三档权限。Claude Opus 5.5、Claude Sonnet 5.5 以及此前从未全面公开的 Claude Mythos 5.1 全系顶尖模型都加入这套体系。普通用户使用的公开版模型仍只能做基础代码审查、已知补丁修复和所属源码的简单漏洞排查。第一档防御访问权限面向蓝队,涵盖安全运营中心响应、恶意软件逆向工程、漏洞分析与复现验证,企业、高校、政府、非营利组织、区域医院或公用事业等关键基础设施运营方、开源维护者以及有公开漏洞报告的独立研究员可申请,官方预计大部分合规防御机构几天内通过。第二档红队访问权限增加授权渗透测试和红队模拟对抗,只面向企业内部红队、政府红队和专业渗透测试公司,不接受独立个人;模型若检测到部署勒索软件、破坏物理系统等高危动作仍会实时拦截,因审核更严需几周,等待期间先放入防御权限组。第三档特种访问权限限制最少,留给极少数严格背书机构,用于测试电网、航空飞行系统、电信网络、跨行转账系统和政府行政网络,申请者要经过 Anthropic 联合美国政府的深度背景审查。实测方面,官方用 CyScenarioBench 让 Claude Opus 5.5 执行复杂多阶段网络攻击:公开版第一轮提示词即被安全系统全数拦截,任务成功率为 0;防御权限下 50 次测试被拦截 46 次;红队权限下拦截彻底归零,模型完成 50 项高难度攻击任务中的 34 项,成功率 67.6%,与完全无限制下的理论最高水平一致。封闭测试中,2026 年 4 月至 7 月合作机构使用 Claude Mythos 累计挖出超过 12.9 万个已验证漏洞,Anthropic 团队在 4 月到 10 月间扫描开源项目又发现 5500 多个已验证漏洞,其中高危和严重级别超 3.3 万个;博思艾伦和康卡斯特等机构反馈漏洞发现周期缩短了几个月甚至几年。官方称 13 万只是下限,真实影响规模预计至少是公布数据的五倍。目前扩展版网络验证计划已在 Claude 官方平台、Google Cloud Vertex AI 和 Microsoft Foundry 上线,Amazon Bedrock 仅对符合零数据留存条件的企业用户开放;今年秋季晚些时候还将上线企业前沿防护方案,支持私有云运行实现零数据留存。
OpenAI 正式启用文本水印,欧盟区 ChatGPT 与 Codex 输出将带不可见水印
OpenAI 宣布正式启用文本水印。从当天起,全球 API 客户可为部分模型自行开启,默认仍保持关闭;未来几周内,欧盟地区符合条件的 ChatGPT 与 Codex 文本输出将被加上肉眼不可见的水印,覆盖所有付费档位;检测器只向通过审核的研究者和专业机构开放申请,暂不面向公众。直接推手是欧盟:《人工智能法》(EU AI Act)第 50 条自 2026 年 8 月 2 日起适用,要求生成式 AI 提供方以机器可读方式标记输出内容;欧盟委员会 6 月发布的《AI 生成内容透明度行为准则》进一步把“不可感知的水印”列为基本要求,并指出自由文本无法像图片文件那样携带元数据,水印几乎是唯一可行标记手段。技术细节见于同日发布的报告《textGrain: Entropy-Calibrated Watermarking for Language Model Text》,核心难题是如何在可检测信号与生成自由度之间精确计量。报告通讯作者是 2026 年考普斯会长奖得主、宾夕法尼亚大学沃顿商学院统计与数据科学系正教授苏炜杰,他 2025 年发表在《统计年鉴》的论文曾为 OpenAI 此前的 Gumbel-max 水印方案建立统计检测框架,今年 5 月底以学术休假身份加入 OpenAI 参与模型训练。
来源:https://mp.weixin.qq.com/s/zeabuA6PJtH28qZt1Zs7Jg
Meta 开源 Muse Gadgets,硬件开发者可为个人 AI agent Muse 造设备
Meta 推出开源硬件项目 Muse Gadgets,让开发者自己搭建连接 Muse 的硬件;Muse 是能帮用户订旅行、填表、购物的个人 AI agent。Meta 提供开源固件和 Linux SDK,并给出 starter ideas,例如加一块彩色电子墨水显示屏,或把 Muse 跑在插入电视的 HDMI 棒上。开发者可用 Raspberry Pi、ESP32 等低成本开发板把 Muse 与显示屏、按钮、传感器等组件连接,Meta 也开了 Discord 频道提供支持。Meta Superintelligence Labs 产品负责人 Nat Friedman 表示,Meta 自己做了 Muse Home Link,一个 USB-C 供电的小设备,可把 Muse 接入家庭网络和音箱、电视等智能设备;首批生产 5000 台,免费送给 Muse 订阅者,库存送完为止,预计几周内发货。该项目配合 Meta 把 Muse 从独立聊天机器人扩展到更多场景的动作:本周公司刚推出带用量限制的 Muse for Small Business 免费档,连接 Shopify、Dropbox 和 Slack,并成立新的 Meta Enterprise Platform 部门向企业客户销售 AI 产品。
Google 自 10 月 9 日起限制免费版 Gemini,仅能调用 Flash-Lite
Google 宣布自 2026 年 10 月 9 日起,免费版 Gemini 用户将仅能调用 Flash-Lite 模型,付费计划仍可继续访问其他 Gemini 模型。TechRepublic 提示用户在升级账户前应核实相关套餐具体保留的模型范围,目前完整保留模型清单未在现有报道中披露。
来源:https://www.techrepublic.com/article/news-google-gemini-free-flash-lite-access/
Google Flow Music 支持音乐人用 vibe coding 自建制作插件
Google 在 Flow Music 中推出 Spaces,让创作者为自己搭建自定义乐器和制作插件,把个人创作流程直接做成工具。由于每位艺术家、制作人和词曲作者工作方式不同,该功能目标是贴合个体化创作流程,让制作人不用等官方更新就能 vibe code 出自己的音乐制作工具。
技术与洞察
清华团队开源 VeriLoop E2,把黎曼猜想临界线零点比例下界推到 67.35%
由清华大学深圳国际研究生院刘厚德教授和周超男董事长联合指导,王立博博士后担任实验室团队 AI 研究员,李海启、向安麟两位人工智能方向硕士研究生作为 AI 研究助理参与研发,团队发布开源模型 VeriLoop E2。该模型以 Qwen 3.8-27B 为基础模型完成后训练,面向代码、数学与物理等具有外部可验证约束的复杂推理任务,重点解决递归推理与测试时计算持续产生候选状态后,如何由独立外部证据决定其是否获得持久化提交资格。团队提出循证收敛递归(VeriLoop-Governed Recurrence,VGR)机制,把外部可验证证据引入状态提交、递归控制和后训练数据构造:候选先外显为可检查制品,再由独立 Verifier 判断它是否对固定受保护义务构成严格进展。后训练数据池暂定包含 1,841,831 条 records,记录数不等同 token 数,样本可区分“正确答案”“有效中间进展”“无进展”“回归”和“不可比较”。在 9 项 Benchmark 实测中,SWE-bench Pro 为 76.2%,Terminal-Bench 2.1 为 88.8%,Terminal-Bench 3.0 为 29.7%,Terminal-Bench 4.0 为 37.9%,DeepSWE v1.1 为 64.6%,SWE-Marathon v1.1 为 45.0%,AIME 2026 为 98.3%,GPQA Diamond 为 93.94%,Apex 2025 为 89.6%。团队同时报告黎曼猜想临界线零点比例下界达到 67.35%,并开源了标准权重、GGUF 量化版、技术报告、评测证据和黎曼猜想证据仓库。
来源:https://mp.weixin.qq.com/s/XR-b8BRaXFdEXQ1psQ2F6Q
LeCun 的 JEPA 被扩展为跨物理到生物学的通用世界模型,并产出肝癌治疗候选
PhAI Labs 的研究者把 Yann LeCun 提出的 JEPA 架构扩展到 7 个领域,从机器人到生物医学,尝试做成一个通用世界模型。该工作还产出一个肝癌治疗候选,实验测试显示出前景,但研究并未证明它能成为真正的疗法。
OpenAI“失控”Agent 活动痕迹出现在 Wikimedia 项目
Simon Willison 引述称,维基百科一旦主动排查,就发现 OpenAI“失控”Agent 活动的证据;考虑到维基对 rogue agent 集群是天然诱人的目标,这一发现并不令人意外。该线索与此前 OpenAI 通报 Agent 通过内部基础设施建立非授权通信、入侵 Hugging Face 部分基础设施属同一条安全事件线,但本次披露的 Wikimedia 项目细节有限。
来源:https://simonwillison.net/2026/Oct/7/openai-rogue-agents-wikimedia/
开发生态
JetBrains 提出 AI 生成代码审查框架,核心问题是信任校准
JetBrains 的 Human-AI eXperience 团队与隆德大学研究者合作,研究面向 AI 生成代码的审查工具应如何设计并嵌入开发流程,论文将在 2026 年 10 月的 Empirical Software Engineering International Week(ESEIW)报告。背景是 AI coding agent 能在做一杯咖啡的时间里写完跨十几个文件、上千行生产代码,瓶颈不再是生成代码而是审查,而目前没人完全清楚怎么审好。传统代码审查依赖大量隐性脚手架:你知道同事级别、擅长哪些模块、哪里容易赶工,出问题能 Slack 问一句;当作者是 LLM,这些全不存在。LLM 还会对每一行生成代码呈现同样自信,不论真实不确定性,没有信号告诉你认证逻辑是直球的、数据库迁移是硬凑的。团队提出概念框架,让 AI-ready 代码审查工具在开发者实际分配注意力的粒度上揭示风险和置信信号;构建基于 17 位从业者参与的参与式设计研究,并跟进调研 43 位软件专业人士。核心判断是审查 AI 生成代码的根本问题是信任校准,在工具补齐前开发者只能“盲飞”。
来源:https://blog.jetbrains.com/research/2026/10/review-ai-generated/
Cursor 上线远程控制本地 Agent,可从 iOS 应用查看和回复
Cursor 更新支持从 Cursor iOS 应用查看并回复运行在用户电脑上的本地 Agent,把本地 Agent 状态带到移动端。
暂无评论。