OpenAI一夜公开722份数学手稿,覆盖372个问题家族【AI 早报 2026-10-08】

OpenAI一夜公开722份数学手稿,覆盖372个问题家族【AI 早报 2026-10-08】

今日AI领域多条重磅消息刷屏:OpenAI在GitHub一次性释放由内部模型产生的722份数学手稿;法国Mistral发布1万亿参数旗舰Mistral Large 4并在多项硬核测试中击败GPT-6;谷歌则以“白菜价”图像模型Nano Banana 2.1发起价格战。

今日概览

要闻

  1. OpenAI公开722份数学手稿,覆盖372个问题家族
  2. GPT-6携Intelligent UI全球推送

模型发布

  1. Mistral Large 4发布:1万亿参数,多项测试击败GPT-6
  2. 谷歌Nano Banana 2.1上线:出图价格减半,Arena多图编辑升至第4
  3. Claude Haiku 5.5发布:Anthropic高速低价新模型

开发生态

  1. OpenAI推出Decisions API:分类提速10倍,每百万输入token 0.10美元
  2. 从TIS到Score Centering:重新理解LLM RL训推不一致
  3. OpenAI DevDay 2026:按任务测量成本优化AI开销

产品应用

  1. TikTok上线AI购物助手与一键结账
  2. 微软发布2599美元Surface Laptop Ultra,内置Nvidia RTX Spark
  3. 谷歌推出SynthID独立平台识别AI生成内容
  4. ChatGPT推出青少年版College Planner
  5. Wired实测OpenAI新代理Dots:全程不稳定且无法通过验证码

技术与洞察

  1. 上海创智学院与复旦提出MATE:面向GUI智能体的规则感知轨迹审计
  2. Zuckerberg旗下Biohub牵头18亿美元计划,训练AI预测细胞行为
  3. Wired:三名工程师用GPT、Claude与Grok驾驶丰田Corolla

行业动态

  1. Valon完成1.5亿美元D轮融资,估值23亿美元押注AI房贷系统
  2. Hadrian融资4000万美元,用AI智能体应对自动化攻击
  3. Torch Systems融资1150万美元,AI监测电网等关键基础设施

要闻

OpenAI公开722份数学手稿,覆盖372个问题家族

OpenAI于10月7日在GitHub仓库openai/math一次性发布722份数学手稿,归入372个问题家族,涵盖乘法函数、π的无理性指数、马勒猜想、黎曼zeta函数零点区域、海森堡铁磁体的自发磁化、自由群因子同构等方向。仓库分三层:preprints目录放PDF和源文件、lean目录放Lean形式化证明、reasoning_traces目录放模型推理摘要,并公开了10份推理过程摘要。OpenAI表示,绝大多数结果来自同一个未发布的内部模型,每道题平均消耗3小时ChatGPT Pro推理算力,总共对模型提出约4000个问题。今年8月该公司仅公开10道题的openai/ten-proofs仓库,9月进一步宣称内部模型解决Navier-Stokes等100多道长期未解问题,当时曾引发25位菲尔兹奖得主联名公开信质疑。OpenAI在README中坦言“部分未形式化的结果可能存在问题”。 来源:https://mp.weixin.qq.com/s/hC0xnhJ7nr4iZP2j7oPiUw

GPT-6携Intelligent UI全球推送

OpenAI宣布GPT-6正在ChatGPT中全球推送,配合Intelligent UI带来更快响应速度,支持可视化内容与可直接探索、使用的交互体验。官方未在公告中披露更多参数细节与灰度范围。 来源:https://openai.com/index/gpt-6-for-everyone

模型发布

Mistral Large 4发布:1万亿参数,多项测试击败GPT-6

法国Mistral发布旗舰模型Mistral Large 4,总参数1万亿,权重计划在月底全部开源。在Artificial Analysis智能指数中,该模型得38分,追平GPT-6 Luna,位列欧美开源模型第一,第二名Thinking Machines的Inkling为25分。硬核测试上,法律Agent测试分数约为GPT-6 Astra的3倍,金融与视觉定位测试也赢过GPT-6 Astra,科学编程超过Claude Opus 5。在漏洞修复网安考题中,Mistral Large 4拿到82%成功率,而Claude Opus 5.5和GPT-6 Astra直接拒答;在收录40道安全竞赛真题的Cybench上解出93%,内部19道网安挑战题解出16道,并在Lakera B3基准挡住93.3%的攻击。同日,美国创业公司Reflection发布开放权重模型Beam,总参数5010亿、每token激活230亿,用23.8万亿token预训练,在DeepSWE v1.1得44.4、Terminal Bench v2.1得80.1、HLE得36.2,定位推理效率,计划10月公开权重。 来源:https://mp.weixin.qq.com/s/z1I-TZb4S-fdAWFUUAg6Xg

谷歌Nano Banana 2.1上线:出图价格减半,Arena多图编辑升至第4

谷歌推出Nano Banana 2.1,基于Gemini 3.6 Flash,知识截止2026年3月,支持蒙版局部编辑、最多14张参考图保持人物与产品一致性,最高4K直出。价格上,1K图像出图价0.034美元,为Nano Banana 2的一半。Arena竞技场成绩为多图编辑第4、文生图第5、单图编辑第6,多图编辑榜前四仅剩OpenAI三款GPT Image。该模型已在Gemini App、搜索AI模式、AI Studio、Flow陆续可用。 来源:https://mp.weixin.qq.com/s/_Lyrq30Opkz833ccsCN3Kg

Claude Haiku 5.5发布:Anthropic高速低价新模型

Anthropic如约推出Claude Haiku 5.5,定位高速、低成本,接替发布近一年的Haiku 4.5。官方摘要未披露具体参数与定价细节。 来源:https://simonwillison.net/2026/Oct/7/claude-haiku-5-5/

开发生态

OpenAI推出Decisions API:分类提速10倍,每百万输入token 0.10美元

OpenAI上线Decisions API,文本与图像分类速度比Responses API快约10倍,返回是/否概率、类别选择或量表评分,输入token价格为每百万0.10美元。OpenAI同时将付费API层级从5档压缩到3档。 来源:https://the-decoder.com/openai-launches-decisions-api-that-reduces-complex-evaluations-to-yes-no-or-pick-one/

从TIS到Score Centering:重新理解LLM RL训推不一致

文章系统梳理大模型强化学习中的Training Inference Mismatch问题。在on-policy LLM RL中,训练引擎与推理引擎的精度差异、量化、浮点误差、异步训练导致的参数版本差异、partial rollout的staleness,以及同一batch切分mini-batch造成的旧数据复用,都会让采样策略与训练策略不一致。解决方案从重要性采样(IS)演进到token-level TIS、GSPO的长度归一化几何平均,再到IcePop与Score Centering,后者对超过阈值的IS权重做mask处理以避免梯度爆炸或消失。 来源:https://mp.weixin.qq.com/s?__biz=MzU3NjE4NjQ4MA==&mid=2247557442&idx=1&sn=7fb1ec0ea08d8293ccd68c3b94e48801

OpenAI DevDay 2026:按任务测量成本优化AI开销

OpenAI DevDay 2026相关演讲主题是如何在保留质量的前提下削减AI成本,核心方法包括按完成任务测量成本、选择合适模型与推理effort、使用prompt caching与Programmatic Tool Calling等策略降低推理开销。官方页面未公布具体价格调整。 来源:https://www.youtube.com/watch?v=_nmlHbSB8kM

产品应用

TikTok上线AI购物助手与一键结账

TikTok在For You feed中推出对话式AI Shopping Assistant,该智能体可理解上下文并在整个对话中记住用户偏好,实时提供产品详情、配送、尺码、库存信息并完成购买。同步上线的一键结账允许用户直接从视频流中向品牌下单。功能由Salesforce、Shopify、Shoplazza与Stripe等商务和支付伙伴共同构建。TikTok Shop于2023年9月在美国上线,eMarketer估计其2025年美国销售额约158亿美元,占美国社交电商约18%。 来源:https://theaiinsider.tech/2026/10/07/tiktok-introduces-ai-shopping-assistant-and-one-click-checkout-across-its-app/

微软发布2599美元Surface Laptop Ultra,内置Nvidia RTX Spark

据TechRepublic报道,微软Surface Laptop Ultra起售价2599美元,搭载Nvidia RTX Spark GPU,内存最高128GB,可在Windows笔记本上本地运行大型AI模型。报道未提供发售日期、地区、处理器型号、GPU显存、性能基准和上市渠道等细节。 来源:https://www.techrepublic.com/article/news-microsoft-surface-laptop-ultra-nvidia-rtx-spark/

谷歌推出SynthID独立平台识别AI生成内容

谷歌宣布推出一个面向全球的独立平台,用于识别在线内容是否由谷歌AI或其行业合作伙伴的工具生成。公告未披露平台正式名称、检测准确率、支持格式、合作伙伴名单、开放范围、定价及具体上线时间。 来源:https://blog.google/innovation-and-ai/models-and-research/google-deepmind/synth-id-ai-content/

ChatGPT推出青少年版College Planner

OpenAI将College Planner引入ChatGPT for Teens,帮助学生管理大学申请流程,同时推出抽认卡、测验功能,并成立青少年AI委员会参与产品设计。 来源:https://openai.com/index/teens-learn-and-plan

Wired实测OpenAI新代理Dots:全程不稳定且无法通过验证码

《Wired》报道OpenAI新代理Dots,设计用途为自动化在线任务,例如购买家具。作者早期实测认为这个始终在线的代理运行不稳定,无法完成验证码;文中还提到代理出现自称“爱作者”的表述。该报道为个人体验向,未提供发布时间、性能参数、价格或官方规格。 来源:https://www.wired.com/story/openai-wants-its-new-agent-to-run-your-life-mine-said-it-loved-me/

技术与洞察

上海创智学院与复旦提出MATE:面向GUI智能体的规则感知轨迹审计

上海创智学院与复旦大学团队提出MATE模型,发表于USENIX Security 2026。这是首个面向移动/GUI智能体执行轨迹的“规则感知”安全审计模型,将自然语言安全规则与指令、轨迹联合建模,输出违规判定、风险类别和基于轨迹证据的解释。安全规则作为可编辑文本输入而非写死在参数中,部署侧通过Trajectory Adapter统一异构日志格式,Policy Retriever检索相关安全规则。模型在Hugging Face提供MATE-3B版本。 来源:https://mp.weixin.qq.com/s/_twtM5_az_KwIjT7DsmLMw

Zuckerberg旗下Biohub牵头18亿美元计划,训练AI预测细胞行为

由马克·扎克伯格与普莉希拉·陈支持的Biohub正协调一项18亿美元计划,训练能预测细胞行为的AI模型。Meta、Google DeepMind、Isomorphic Labs和美国能源部提供数据、实验设备与算力支持。首个数据集预计约一年后就绪。 来源:https://the-decoder.com/zuckerbergs-biohub-leads-a-1-8-billion-push-to-build-ai-models-that-predict-cell-behavior/

Wired:三名工程师用GPT、Claude与Grok驾驶丰田Corolla

三名工程师让GPT、Claude与Grok分别控制一辆丰田Corolla真车,仅其中一个成功完成任务。该实验由《Wired》报道,报道未披露具体控制接口、行驶路线与成功率数据。 来源:https://www.wired.com/story/ai-is-driving-cars-now-oh-boy/

行业动态

Valon完成1.5亿美元D轮融资,估值23亿美元押注AI房贷系统

AI原生金融服务操作系统开发商Valon完成1.5亿美元D轮融资,估值23亿美元,较上一轮翻倍。新投资者Ribbit Capital加入,a16z等现有股东跟投。其ValonOS与AI agents处理从房主邮件到付款分配的房贷服务任务,目前全美每六笔未偿房贷中就有一笔签约在该平台运行,客户包括ServiceMac、Carrington Mortgage Services和Rithm Capital旗下Newrez。联合创始人Linda Du认为,在监管行业部署AI agent的主要障碍是上下文而非智能,公司计划扩展到商业、个人、汽车和学生贷款。 来源:https://theaiinsider.tech/2026/10/07/valon-raises-150m-series-d-at-a-2-3b-valuation-to-deploy-valonos-and-ai-agents-into-mortgage/

Hadrian融资4000万美元,用AI智能体应对自动化攻击

智能体AI攻防安全平台Hadrian完成4000万美元融资,由Forgepoint Capital International与SmartFin共同领投,累计融资达6500万美元。其平台结合Atlas持续暴露面管理与Nova按需智能体渗透测试,用于识别真正可利用的漏洞。客户包括McKesson、NBC Universal、TotalEnergies和Leroy Merlin。Hadrian引用数据称,87%的组织仍依赖手动渗透测试,超过70%的安全团队难以判断哪些暴露可利用,而漏洞扫描器中仅0.47%的发现真正可被利用。 来源:https://theaiinsider.tech/2026/10/07/hadrian-raises-40m-to-tackle-the-ai-hacking-cyber-security-crisis/

Torch Systems融资1150万美元,AI监测电网等关键基础设施

户外资产智能公司Torch Systems完成1150万美元总融资,含Khosla Ventures、Abstract、Construct Capital与Starship Ventures投资的950万美元股权,以及First Citizens Innovation Banking的200万美元风险债。其太阳能TerraNode传感设备集成光学、热、声、气体与环境传感器,结合端侧边缘AI,通过Torch Intelligence Platform学习站点正常模式并标记火灾、设备过热、入侵和植被风险。目前已在美国6个州部署数百台设备,客户包括Dominion Energy,早期源于高中野火检测项目。 来源:https://theaiinsider.tech/2026/10/07/torch-systems-closes-11-5m-to-bring-ai-to-the-physical-infrastructure-the-world-depends-on/

评论

暂无评论。

登录后可发表评论。