OpenAI 公开 722 篇数学论文:第 003 号对准黎曼假设【AI 早报 2026-10-08】
今日看点:OpenAI 一次性放出 722 篇由内部前沿模型产出的数学论文,其中 003 号声称证明准黎曼假设;欧洲 Mistral 与硅谷 Reflection 同期亮出开放权重大模型,正面挑战闭源旗舰;谷歌 Flash 级图像模型 Nano Banana 2.1 与 TikTok AI 购物助手也在同一天落地。
今日概览
要闻
- OpenAI 公开 722 篇数学论文,第 003 号对准黎曼假设
- Mistral Large 4 一万亿参数单挑 GPT-6,法律 Agent 得分近 3 倍
模型发布
- Reflection 发布 5010 亿参数开放模型 Beam,自称追到 GLM-5.2
- GPT-6 携 Intelligent UI 全球上线 ChatGPT
- 谷歌 Nano Banana 2.1 深夜发布,4K 直出 0.034 美元一张
开发生态
- Claude Haiku 5.5 上线 AWS Bedrock,比 Haiku 4.5 便宜约 75%
- GitHub:三分之一拉取请求已由智能体发起,密钥泄露每 2 秒一次
- OpenAI 推出 Decisions API:yes/no 判定比 Responses API 快约 10 倍
- 谷歌 Developer Knowledge API 与 MCP Server 进入公测
产品应用
- TikTok 上线 AI 购物助手与一键结账
- 微软 Surface Laptop Ultra 2599 美元起,内置 RTX Spark 本地跑大模型
- Cloudflare 用多智能体接管托管防守告警分析
技术与洞察
- NeurIPS 2026 SAGE:用结构信号纠偏,AC 任务通过率提升至近 8 倍
- USENIX Security 2026 MATE:给 GUI 智能体轨迹做规则感知审计
- QuantWM:2-bit KV Cache 压缩最高 6.20 倍而缓解时序闪烁
- 三名工程师让 GPT、Claude、Grok 分别驾驶丰田 Corolla
行业动态
- Zuckerberg 旗下 Biohub 牵头 18 亿美元,训练预测细胞行为的 AI 模型
- Valon 完成 1.5 亿美元 D 轮,估值 23 亿美元部署房贷智能体
- Axya 获 1700 万加元 A 轮,深化制造业采购 AI 风险检测
前瞻与传闻
- 大模型原生智能体手机 STEPX Neo 定于 10 月 13 日发布
要闻
1. OpenAI 公开 722 篇数学论文,第 003 号对准黎曼假设
OpenAI 在 GitHub 仓库 openai/math 集中放出 722 篇论文,按 17 个学科编排成 372 个结果族,覆盖约 4000 个问题;每个结果平均消耗约 3 小时 ChatGPT Pro 思考算力。总览 PDF 共 41 页,数论置于最前:编号 003 声称实部大于 7/8 的区域内黎曼 ζ 函数无零点,即“准黎曼假设”的一个区域版本;004 给出有理数版希尔伯特第十问题的否定答案;005 证明卡塔兰常数为无理数;017 给出 π 的无理性指数为 2 并附带证明 Flint Hills 级数收敛;002 与 006 则覆盖 BSD 猜想中“密度为 1 的二次扭曲满足完整 BSD 公式”的部分。这批成果源于 OpenAI 用约 4000 道人类未解问题替代已被刷满的数学评测,输出结果先汇总成族再按分量筛选为 372 族;项目带版本记录、引用格式、Lean 形式化、推理摘要、算力口径与问题数量说明。验证方式以 Lean 形式化为主,仓库已收录 162 篇论文主结果的 Lean 证明,有开发者在论坛自行编译准黎曼假设相关 2924 个模块,零错误零警告;其余五百多篇仍依赖人工阅读。OpenAI 的密集发布节奏包括 8 月 1 日《十项进展》、9 月 8 日宣称解决纳维–斯托克斯有限时间奇点(约 1 万个智能体并行 88 小时,模型 8 月 28 日才开训)、9 月 21 日新增 100 多个公开问题结果,直至 10 月 6 日的 722 篇。发布同日,挂靠普林斯顿高等研究院、由高尔斯与威滕等九人组成的数学与 AI 顾问组发声称,公开只是第一步,人类仍需理解并将这些成果纳入既有数学知识;逻辑学家 Jeremy Avigad 则在陶轩博客写道,一年前够正经发表的结果如今可被 AI 批量生成,令人重新思考数学训练的意义。
来源:https://mp.weixin.qq.com/s?__biz=MzkzNDQxOTU2MQ==&mid=2247521442&idx=1&sn=b7c4edbe4ac974e68c782be55511bb81
2. Mistral Large 4 一万亿参数单挑 GPT-6,法律 Agent 得分近 3 倍
法国 Mistral 放出新旗舰 Mistral Large 4,总参数达到 1 万亿,并计划月底全部开源权重。在 Artificial Analysis 智能指数中它拿下 38 分,与 GPT-6 Luna 持平,在欧美开放模型中排名第一,第二名 Thinking Machines 的 Inkling 为 25 分。硬核项目上它多项压过闭源旗舰:法律 Agent 测试得分约为 GPT-6 Astra 的近 3 倍,金融与视觉定位均胜 GPT-6 Astra,科学编程赢 Claude Opus 5。网络安全方面它在一道漏洞修复考题上取得 82% 的全场最高分,而 Claude Opus 5.5 与 GPT-6 Astra 直接拒答;在 40 道安全竞赛真题组成的 Cybench 上解出 93%,在内部 19 道题中解出 16 道。面对未贴标签的 CobaltStrike 加载程序,它能自行反编译、定位命名管道、提取加密载荷并完成 XOR 破解。整体网安指数中 Mistral Large 4 成功 50 次进入全球前五,同期 GPT-6 Astra 成功 33 次、被安全机制拦截 38 次,Claude Opus 5.5 成功 29 次、被拦 36 次;Mistral 在博客中批评一刀切拒答挡住的恰是正当漏洞研究与应急响应,同时该模型在 Lakera B3 基准上挡住 93.3% 的攻击,对越狱与恶意 Agent 的拒绝率高于所有开源模型。 来源:https://mp.weixin.qq.com/s/z1I-TZb4S-fdAWFUUAg6Xg
模型发布
3. Reflection 发布 5010 亿参数开放模型 Beam,自称追到 GLM-5.2
被称作“美版 DeepSeek”的 Reflection 于当地时间 10 月 5 日发布首款开放权重模型 Beam,为 MoE 架构,总参数 5010 亿,每 Token 激活 230 亿参数,面向编程、推理与 Agent 负载,预训练使用 23.8 万亿 Token。公司动用 1.05 万张 Nvidia GB300 连续进行 4 周高算力强化学习,生成超过 1 亿次 rollout,模型目前仍处最终红队测试,计划 10 月公开权重、技术报告与开发工具。亮点在推理效率:Reflection 称在部分高级推理任务上能以 GLM-5.2 约四分之一到三分之一的推理算力逼近其表现。横向对比显示差距:DeepSWE v1.1 中 Beam 得 44.4,与 GLM-5.2 的 44.0 持平,低于 GLM-5.3 的 61.0、Kimi K3 的 68.0 与 DeepSeek V4.1 Flash 的 74.2;Terminal Bench v2.1 上 Beam 为 80.1,对手分别为 88.2、88.3 与 90.6;HLE 上 Beam 36.2,低于 GLM-5.3 的 42.3 与 Kimi K3 的 46.9。Reflection 承认 Kimi K3 绝对能力领先,把卖点转向“每单位推理算力换来多少智能”。其创始人 Misha Laskin 与 Ioannis Antonoglou 出自 Google DeepMind,分别负责过 Gemini 奖励建模与 AlphaGo/AlphaZero 及 Gemini RLHF;公司路线因 DeepSeek V3 出现而从自建应用转向自训前沿开放模型,已融资数十亿美元并获 Nvidia 投资,通过 SpaceX、Nebius 锁定算力,2027 年计划发布更大模型。Hugging Face 数据显示过去一年中国模型占平台下载量约 41%,Vercel AI Gateway 8 月生产流量中开放权重模型处理 56% Token,去年 12 月不足 10%。 来源:https://mp.weixin.qq.com/s?__biz=MzU1NDA4NjU2MA==&mid=2247668042&idx=1&sn=7a669451df8c3833b1ba46e17388cd0c
4. GPT-6 携 Intelligent UI 全球上线 ChatGPT
OpenAI 宣布 GPT-6 正在全球范围内向 ChatGPT 推送,并配套 Intelligent UI:响应更快,可直接探索包含视觉与交互体验的内容,而非仅返回静态文本。官方通稿信息有限,未披露模型参数、上下文窗口、定价与 API 可用范围。 来源:https://openai.com/index/gpt-6-for-everyone
5. 谷歌 Nano Banana 2.1 深夜发布,4K 直出 0.034 美元一张
谷歌发布 Nano Banana 2.1,属 Gemini 3 系列,基于 Gemini 3.6 Flash,知识截止 2026 年 3 月,也称为 Gemini 3.6 Flash Image。核心能力包括蒙版局部编辑(圈哪改哪、其他区域不动)、人物与产品多轮一致性保持,最多可塞入 14 张参考图,画面更接近实拍并最高 4K 直出。定价为 Nano Banana 2 的一半,1K 分辨率每张 0.034 美元。Arena 盲投中,多图编辑排名第 4,前面只剩 OpenAI 三款 GPT Image;文生图第 5、单图编辑第 6,而上一代 Nano Banana 2 在同样三榜分别仅第 7、第 11、第 14。官方基准强调其在视觉设计、编辑、一致性上的领先,同时承认小文本渲染、3D 推理和事实性仍有改进空间;用途覆盖海报与复杂图表文字生成、长上下文现实知识、多语言本地化文字渲染。可用渠道包括 Gemini App、搜索 AI 模式、AI Studio、Flow,当天起陆续开放。 来源:https://mp.weixin.qq.com/s/_Lyrq30Opkz833ccsCN3Kg
开发生态
6. Claude Haiku 5.5 上线 AWS Bedrock,比 Haiku 4.5 便宜约 75%
Anthropic 宣称 Claude Haiku 5.5 是 Claude 5.5 家族中最快、最高效的模型,面向子智能体与高吞吐、成本敏感任务,多数任务成本比 Claude Haiku 4.5 低约 75%;它也是首个带 effort controls 的 Haiku,可按任务在成本与智能间调节,而非为整个负载固定一档。能力覆盖编码、工具使用、computer use 与 agentic 任务:可作为子智能体做请求路由、代码审查、长文档分类;在知识工作中抽取中小文档关键信息、做初扫与知识库快问快答;交互应用里响应足够快以支持简单对话;并能在生产级规模处理分类、摘要与文本生成等传统 NLP。它支持高分辨率图像,可作为重复浏览器/桌面任务的 computer use 子智能体,也适合快速迭代 UI/UX 与跨文件小改动。在 AWS 侧,Amazon Bedrock 提供区域数据驻留,统一接入 IAM、CloudTrail、CloudWatch 与 Bedrock Guardrails,用量进 AWS 账单;Claude Platform on AWS 则通过管理控制台直接使用 Anthropic 原生 API、功能与体验,计费与认证并入 AWS。 来源:https://aws.amazon.com/blogs/machine-learning/introducing-claude-haiku-5-5-on-aws/
7. GitHub:三分之一拉取请求已由智能体发起,密钥泄露每 2 秒一次
GitHub 披露九个季度数据:当前每 3 个拉取请求中就有 1 个涉及 AI 智能体,一年前该比例不足十分之一;若节奏持续,未来两年内推送至 GitHub 的大部分代码可能由智能体编写,且很多永远不会被人完整阅读。公开可见代码中约每 2 秒出现一个新密钥,过去三年每年翻倍。对比 Q2 2024 到 Q2 2026,被筛查的 push 增长 2.84 倍,携带凭据的 push 增长 2.59 倍,按 push 计的泄密率无可统计显著趋势,说明开发者并非更粗心,而是被产出速度甩开;同期开发者覆盖 push-path block 的比例从 6.63% 线性降至 3.93%,显示风险意识反而上升。为此 GitHub 与微软应用科学部门联合微调分类器,把 push protection 扩展到非结构化密钥:模型在不到 2 毫秒内评估整组候选密钥,有望把可拦截的密钥数量翻一倍以上。 来源:https://github.blog/ai-and-ml/github-copilot/secret-protection-must-scale-with-software/
8. OpenAI 推出 Decisions API:yes/no 判定比 Responses API 快约 10 倍
OpenAI 上线 Decisions API,把复杂评估压缩为三元输出:对文本与图像返回 yes/no 概率、类别选择或量表评分,速度约为 Responses API 的 10 倍,定价为每百万输入 token 0.10 美元。同时 OpenAI 将付费 API 层级从五档精简为三档。 来源:https://the-decoder.com/openai-launches-decisions-api-that-reduces-complex-evaluations-to-yes-no-or-pick-one
9. 谷歌 Developer Knowledge API 与 MCP Server 进入公测
谷歌推出 Developer Knowledge API 生态与 MCP Server 公测,为 AI 助手与智能体平台提供规范化、机器可读的文档检索方式,可搜索 Firebase、Google Cloud、Android 等平台的最新技术文档。通过官方 MCP 服务器,开发者能把工具直接接入 Google 文档语料库,使 AI 生成的代码与指导基于权威、实时上下文,减少过时信息影响。 来源:https://developers.googleblog.com/supercharge-your-development-with-the-google-developer-knowledge-api-ecosystem/
产品应用
10. TikTok 上线 AI 购物助手与一键结账
TikTok 周一宣布在应用内推出对话式 AI 购物助手与一键结账:助手是面向发现与购买的 AI 智能体,能在整段对话中理解上下文并记忆用户偏好与需求,实时提供商品细节、物流、尺码、库存信息并完成下单;新结账工具让用户可直接从 For You 信息流中一键向品牌购买。该功能与 Salesforce、Shopify、Shoplazza 和 Stripe 等商业与支付伙伴共同开发。TikTok Shop 于 2023 年 9 月在美国上线,eMarketer 估计其 2025 年美国销售额约 158 亿美元,约占美国社交电商 18%;把 AI 购物帮助内嵌进应用,目标是把用户留在站内而非流向 ChatGPT 等外部 AI,同时截留更多购物旅程。 来源:https://theaiinsider.tech/2026/10/07/tiktok-introduces-ai-shopping-assistant-and-one-click-checkout-across-its-app/
11. 微软 Surface Laptop Ultra 2599 美元起,内置 RTX Spark 本地跑大模型
据 TechRepublic 报道,微软 Surface Laptop Ultra 起售价 2599 美元,搭载 Nvidia RTX Spark GPU,内存最高 128GB,可在 Windows 笔记本上本地运行大型 AI 模型。报道未提供发售日期、地区、处理器型号、GPU 显存、性能基准与上市渠道细节。 来源:https://www.techrepublic.com/article/news-microsoft-surface-laptop-ultra-nvidia-rtx-spark/
12. Cloudflare 用多智能体接管托管防守告警分析
Cloudflare 介绍其内置多 AI 智能体安全运营 harness,用于 Managed Defense:告警很少单独出现,一次尖峰需要人判断关联与含义,harness 负责在告警持续涌入时收集数据、连接与聚合检测、补齐缺失来源。深层分析调用 OpenAI Daybreak Defense Network 及与 Anthropic 的合作模型,包括 GPT-5.6 Cyber 与 Mythos;初步分析与打分则使用 Cloudflare 开源决策模型 Clef。单一通用智能体原型暴露三处问题:上下文被当成权威、检测器描述/策略/威胁情报在单提示中角色混淆、以及出现证据不支持的幻觉。多智能体方案把调查拆分,向 Managed Defense 分析师输出关联告警、已确认证据、可见缺口与建议下一步,把时间集中到处置与缓解部署。 来源:https://blog.cloudflare.com/agentic-security-operations/
技术与洞察
13. NeurIPS 2026 SAGE:用结构信号纠偏,AC 任务通过率提升至近 8 倍
弗吉尼亚理工、威斯康星麦迪逊与达特茅斯团队在 NeurIPS 2026 提出 SAGE,用符号闭包分析(SCA)解释长推理中的探索偏差与累积偏差,再把诊断转为训练时的结构引导。实验覆盖 12 个基准、7 个模型家族,总体优于所比较的后训练方法;在 Andrews–Curtis 实例上,Qwen3 的 Lean 验证通过率接近基础模型的 8 倍,求解集合为 1190 个按论文设置构造的 AC 实例。AC 任务要求对群表示依次执行合法变换直至到达平凡表示,每步可验证合法,但合法不等于通向目标,成功信号要到序列结束才出现,因此把“局部合法、全局难成”的矛盾放大。SCA 先定义局部可行域 F 及其前缀封闭性,再用有效分支数与可行分支数解释为何深度越大可行前缀占比越受连乘制约,并把策略梯度波动拆为可行域内方差、不可行域内方差与两类轨迹平均信号差异造成的方差,说明“预算花在哪些分支”直接影响学习信号质量。 来源:https://mp.weixin.qq.com/s/-N-Wo8ra1YqC1-HHKkprnQ
14. USENIX Security 2026 MATE:给 GUI 智能体轨迹做规则感知审计
上海创智学院与复旦大学团队提出 MATE,首个面向移动/GUI 智能体执行轨迹进行规则感知的安全审计模型,已发表于 USENIX Security 2026。MATE 不简单打“安全/不安全”标签,而是把自然语言安全规则与指令、轨迹联合建模,输出风险类别和基于规则证据的审计解释。其思路是:GUI 智能体会真正打开应用、点击按钮、读取页面、转发消息、下载文件并在多步后产生结果,单次点击或滑动在不同 App、页面状态、用户目标与规则下含义完全不同,风险藏在“感知—决策—执行—反馈”链条里。现有方法要么依赖静态规则难以覆盖长轨迹上下文,要么用通用大模型 Judge 更灵活但推理成本高、延迟大且存在隐私暴露。MATE 的规则以可编辑文本存在,组织更新策略、调整权限边界或个人增加约束时无需重训模型;部署侧由 Trajectory Adapter 统一异构日志格式,Policy Retriever 检索相关规则。团队给出 3B 规模模型,强调规则可编辑、结果可解释与足够轻量。 来源:https://mp.weixin.qq.com/s/_twtM5_az_KwIjT7DsmLMw
15. QuantWM:2-bit KV Cache 压缩最高 6.20 倍而缓解时序闪烁
哈尔滨工业大学(深圳)iLearn-Lab 与新加坡国立大学 LV-Lab 提出免训练 2-bit KV Cache 量化框架 QuantWM,针对视频世界模型。以 LingBot-World-v2 生成约 5 秒、93 帧视频计,KV Cache 需超 21 GiB 显存。已有 2-bit 量化在 VBench 上接近 BF16,但 HY-World 1.5 的 temporal flickering 指标从 95.62% 到 95.85% 几乎不变,肉眼却可见闪烁、模糊与细节失真;团队因此逐帧比较 PSNR、SSIM、LPIPS。关键发现是仅量化 Key 比仅量化 Value 退化更明显,且 Key 的量化误差往往更小却导致更大输出误差,原因是量化改变了 Query 与历史 Key 的匹配分数相对排序,使注意力跳到另一帧或另一空间位置。QuantWM 由此设计两步:QSAC 用 Query 敏感性加权距离筛选候选聚类中心,并结合残差动态范围与敏感性估计 INT2 量化造成的注意力扰动;PSAC 以低秩形式保存 Key 量化误差在主方向上的分量并在缓存重构时补偿,采用 8 个主方向、INT8 补偿系数(LingBot-World-v2 某层前 8 个主方向覆盖约 71% Query 能量)。两项设计仅用已有内容的历史 Query 统计,无需重训。在 Matrix-Game-2、LingBot-World-v2、HY-World 1.5 上验证后,泛化至 LongCat-Video 与 Causal-Forcing,480p、93 帧下实现最高 6.20 倍 KV Cache 压缩。 来源:https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651061320&idx=2&sn=da665a8e02881b7e48eea58bf8431ec1
16. 三名工程师让 GPT、Claude、Grok 分别驾驶丰田 Corolla
据 Wired 报道,三名工程师让 GPT、Claude 与 Grok 分别控制同一辆丰田 Corolla 真车,任务是从一处前往 In-N-Out,最终只有一个模型成功完成全程。 来源:https://www.wired.com/story/ai-is-driving-cars-now-oh-boy/
行业动态
17. Zuckerberg 旗下 Biohub 牵头 18 亿美元,训练预测细胞行为的 AI 模型
由 Mark Zuckerberg 与 Priscilla Chan 支持的研究机构 Biohub 正协调一项 18 亿美元计划,训练预测细胞行为的 AI 模型。Meta、Google DeepMind、Isomorphic Labs 与美国能源部分别出资提供数据、实验设备与算力,首个数据集预计约一年后就绪。 来源:https://the-decoder.com/zuckerbergs-biohub-leads-a-1-8-billion-push-to-build-ai-models-that-predict-cell-behavior/
18. Valon 完成 1.5 亿美元 D 轮,估值 23 亿美元部署房贷智能体
Valon Technologies 宣布完成 1.5 亿美元 D 轮融资,估值 23 亿美元,为上一轮两倍;新投资方 Ribbit Capital 加入,Andreessen Horowitz 等继续跟投。ValonOS 是面向受监管金融的 AI 原生操作系统,其智能体处理房贷服务中的业主邮件、付款分配等任务,目前美国每六笔未偿房贷中就有一笔合同在该平台运行,客户包括 ServiceMac、Carrington Mortgage Services 与 Rithm Capital 旗下 Newrez。联合创始人兼总裁 Linda Du 认为,受监管行业部署 AI 智能体的主要障碍是上下文而非智能;公司计划把业务从房贷扩展到商业、个人、汽车与学生贷款,并在纽约、旧金山及远程岗位扩充工程、产品、部署与市场团队。 来源:https://theaiinsider.tech/2026/10/07/valon-raises-150m-series-d-at-a-2-3b-valuation-to-deploy-valonos-and-ai-agents-into-mortgage/
19. Axya 获 1700 万加元 A 轮,深化制造业采购 AI 风险检测
面向制造商的 AI 采购平台 Axya 完成 1700 万加元 A 轮,由 McRock Capital 领投,Yamaha Motor Ventures 及 BDC 工业创新风投基金、Real Ventures 等老股东跟投,并与 CIBC 建立银行合作以支持下一阶段扩张。Axya 聚焦航空航天、定制机械与车辆及自然资源领域,客户包括 MDA Space 与 GE Aerospace;平台把供应商网络接入 Infor、Epicor、Oracle、SAP、Microsoft Dynamics 与 Sage 等 ERP,且无需供应商使用新门户,公司称供应商采用率达 100%。AI 负责数据归一化、早期风险预警与节省识别,采购团队保留战略决策。创始人兼 CEO Félix Bélisle-Dockrill 称多数供应链仍依赖为更慢时代打造的工具,采购是制造业数字化投入巨大却最分散的职能之一。资金将用于深化风险检测、优化与自动化工作流的 AI 能力,扩充销售、客户成功与工程团队,并支持北美与国际扩张。 来源:https://theaiinsider.tech/2026/10/07/axya-announces-17m-cad-series-a-to-deepen-ai-risk-detection-for-manufacturers/
前瞻与传闻
20. 大模型原生智能体手机 STEPX Neo 定于 10 月 13 日发布
量子位报道,大模型原生智能体手机 STEPX Neo 将于 10 月 13 日正式发布,产品以大模型能力为核心,主打原生智能体交互。截至 2026 年 10 月 8 日,官方尚未公布具体硬件规格、售价与详细功能配置,发布会定于 5 天后举行。 来源:https://www.qbitai.com/2026/10/501915.html
暂无评论。