Claude Code 写出的 VibeQwen 单流解码提速 90%【AI 早报 2026-10-06】

Claude Code 写出的 VibeQwen 单流解码提速 90%【AI 早报 2026-10-06】

今日重点包括 Baseten 用 Claude Code 生成的专用推理引擎首次以量化指标跑赢 vLLM、Reflection 宣布 501B 开源 MoE Beam,以及多家实验室在订阅额度、模型评测、代码评审与具身智能方向的新进展。

今日概览

要闻

  1. Claude Code 写出的 VibeQwen 单流解码提速 90%

模型发布

  1. Reflection 宣布 501B/23B 开源 MoE Beam
  2. GLM 5.3 上线 Amazon Bedrock,含安全基准 84.5 分
  3. Aleph Alpha 开源 78B 英德 MoE Kolibri
  4. Reka AI 发布 19B 全模态模型 Rho-1

开发生态

  1. GitHub 开源代码评审基准 ReviewBench
  2. Tibo 承诺 28 天每天改进 Codex,未达标就重置额度
  3. Photon 获 450 万美元种子轮,做 iMessage/WhatsApp 智能体

产品应用

  1. Shopify Canvas 支持对话式建站
  2. ChatGPT 图片生成加载界面将出现商品轮播广告

技术与洞察

  1. VA-Bench:12 个模型目标识别接近满分,完整任务成功率约一半
  2. Claude 自我对弈 Elo 从 1500 升至 1760,GPT-6 Astra 跌至 1400
  3. Harvey 联创谈应用公司如何建立研究实验室
  4. Graphite 研究:AI 写作仍有 1.3 万个固定痕迹
  5. FlexiTac 开源触觉传感器 3 分钟组装,已接入 LeRobot

行业动态

  1. SemiAnalysis 实测:同价位 Claude 的 API 等价 Token 价值约为 ChatGPT 5 倍
  2. Meta、微软缩减 Claude 使用预算
  3. Armadin 融资 2.555 亿美元,估值超 25 亿美元

前瞻与传闻

  1. Hinton 等发 RSI 论文:AI 参与研发或让一年进步压缩到约 5 周
  2. Google 把首颗 TPU 送入轨道,测试太空 AI 算力

要闻

Claude Code 写出的 VibeQwen 单流解码提速 90%

Baseten 工程师 Shawn Rushefsky 给 Claude Code 一张 NVIDIA B200、论文与目标模型权重,让它为 Qwen-3.6-35B-A3B 写一套专用推理引擎,并持续优化到超过 vLLM。最终生成的引擎名为 VibeQwen,在 NVFP4 精度、单张 B200 上运行,对照实验时使用的 vLLM 0.25.1。单流解码速度从 vLLM 的 943 token/s 提高到 1792 token/s,约为原来的 1.90 倍,即快 90%;首 token 时间从 28ms 降到 12ms,减少约 57%。并发 32 时,单副本总输出吞吐从 6030 token/s 提高到 10307 token/s,约为 vLLM 的 1.71 倍。Claude 主要自主工作约一周,消耗约 200 个 B200 小时、约 17 亿 token,其中绝大部分是缓存输入,项目成本为数千美元量级。原文也指出,该测试文本偏结构化、重复,适合推测解码,且没有公布双方完整配置和消融结果,因此 90% 暂无法拆解到具体优化项。第二轮他把更新过的知识库用于 SAM 3.1,生成的推理服务叫 Sammie,在单张 H100 上达到每秒 91 张图,比 Meta 参考服务器吞吐高 50%。

来源:https://mp.weixin.qq.com/s?__biz=MjM5ODkzMzMwMQ==&mid=2650454821&idx=1&sn=7dc9fca09ea050dfed621de1c861a4b8

模型发布

Reflection 宣布 501B/23B 开源 MoE Beam

Reflection 宣布推出文本模型 Beam,参数规模为总 501B、激活 23B 的 MoE,面向编码、智能体和科学类任务,并称从零开始训练。官方计划本月以 Apache 2.0 许可放出全量权重,同时承诺发布技术报告和开源集成。训练规模方面,官方帖子称预训练使用 23.8T token,部分数据来自对数亿份 PDF 的 OCR 处理;强化学习/OPD 阶段在 10K 张 GB300 上完成超过 1 亿次 rollout,覆盖约 100 万个任务。Reflection 自行汇总的结果为 SWE-bench Verified 80.9 分,推理效率相比 GLM 5.2 高 3—4 倍,并称预训练和强化学习各约四周,在约 10500 张 GB300 上完成。Axios 提前报道还提到,Reflection 每月为 Colossus 算力支付 1.5 亿美元,并与 Nebius 有 10 亿美元合作。第三方早期评测中,Artificial Analysis 预计 Beam 会是同智能水平下 token 效率较高的开源模型之一;Elie Bakouch 则估算其 BF16 预训练 MFU 约 12%,并认为架构是 3:1 交错的全局/滑动窗口注意力。

来源:https://www.latent.space/p/ainews-reflection-beam-501b-a23b

GLM 5.3 上线 Amazon Bedrock,含安全基准 84.5 分

Z.ai 的 GLM 5.3 已上线 Amazon Bedrock,该模型在 Hugging Face 上标注为 753B 参数 MoE,针对编码和长时程智能体任务优化。Bedrock 侧提供全托管 API、跨 Region 推理、prompt caching 和服务分层,用户无需自建推理基础设施,目前面向符合条件的企业客户开放。相比 GLM 5.2,Z.ai 称内部编码基准提升 50%,并在 DeepSWE、Terminal Bench 3.0、FrontierSWE 等编码基准上有竞争力;同时公布了 CyberGym 安全基准 84.5 分的成绩。Bedrock 文章还演示了用 OpenAI 兼容 API 调用 GLM 5.3,并接入开源 AI 渗透测试智能体 Strix 执行授权安全测试。文章也强调,GLM 5.3 的典型场景包括多步推理、工具增强工作流和长上下文保持。

来源:https://aws.amazon.com/blogs/machine-learning/introducing-glm-5-3-on-amazon-bedrock/

Aleph Alpha 开源 78B 英德 MoE Kolibri

Aleph Alpha 发布了 Kolibri,一个德英双语 MoE 模型,总参数 78B,每个 token 激活约 3B 参数。官方称训练数据中超过 21% 为德语,模型在德国和芬兰的 768 张 B200 GPU 上完成训练。Kolibri 的权重已按 Apache 2.0 许可免费开放下载。这是 Aleph Alpha 当前较明确地以开源权重形式发布的模型,参数规模、激活比例、训练数据构成和许可方式都可直接核验。截止目前,官方摘要未披露该模型在具体基准上的完整成绩。

来源:https://the-decoder.com/aleph-alpha-releases-kolibri-an-open-weight-model-that-makes-the-case-for-european-ai-sovereignty/

Reka AI 发布 19B 全模态模型 Rho-1

Reka AI 发布 Rho-1,一个 190 亿参数的全模态模型,能够在同一个神经网络中处理并生成文本、图像、视频和机器人控制动作。训练方面仅使用 320 张 H100 GPU,耗时约三个月,官方称所需算力远低于当前顶级模型。Rho-1 没有把不同任务路由到专用系统,而是将所有模态统一表示为 token,并放进同一个共享上下文窗口。官方摘要没有给出 Rho-1 的具体基准分数或部署细节。

来源:https://the-decoder.com/reka-ais-omni-model-rho-1-handles-text-images-video-and-robot-control-in-a-single-model

开发生态

GitHub 开源代码评审基准 ReviewBench

GitHub 发布了面向智能体代码评审的离线基准 ReviewBench,用于衡量不同 AI reviewer 在真实 pull request 上的能力差异。其分布参照 GitHub 上超过 1 亿个真实 pull request 的语言、仓库规模和大小分布,并采用多来源 golden set 和统一评分规则。该基准经过资深工程师独立验证,支持按严重程度、类别和 precision-recall 偏好拆分结果。GitHub 称,借助 ReviewBench,其对 Copilot code review 的离线评估已能更好预判生产实验方向,从而帮助团队判断一次改动是否值得上线。

来源:https://github.blog/ai-and-ml/github-copilot/reviewbench-an-open-benchmark-for-ai-code-review/

Tibo 承诺 28 天每天改进 Codex,未达标就重置额度

OpenAI 的 ChatGPT 和 Codex 负责人 Tibo Sottiaux 在 X 上承诺,未来 28 天每天要么推出一项对大多数 Codex 和 Work 用户明显有用的改进,要么进行一次完整额度重置。他表示自己可以在认为必要时直接按下重置按钮,不需要层层审批,并自嘲“还能重置多少次,取决于我们把东西弄坏多少次”。Tibo 还提到,自己加入 OpenAI 第三天就把生产环境弄宕机。在访谈中,他直言当前模型、推理强度、多智能体模式和 Ultra 模式的选择过于复杂,用户几乎需要“模型选择器博士学位”;他希望应用逐渐退到幕后。他本人的业务分析、功能研究和上线后复盘所需代码已主要由 Codex 编写,手写代码只剩周末刷 LeetCode 的场景。

来源:https://mp.weixin.qq.com/s?__biz=MjM5MDE0Mjc4MA==&mid=2651294469&idx=1&sn=28cfb919a0d097c02710453694c19342

Photon 获 450 万美元种子轮,做 iMessage/WhatsApp 智能体

AI 初创公司 Photon 获得 450 万美元种子轮融资,由 Gradient 和 A* 共同领投,Vercel、HSG、Z Fellows、Llama Ventures、Karman 及天使投资人跟投。公司称已有超过 4 万名开发者注册,收入在四个月内增长 10 倍,流失率低于 3%,过去一个月消息量增长 5 倍。Photon 提供统一 API、渠道框架、CLI 和可观测性套件,支持开发者在 iMessage、WhatsApp、Telegram、SMS、邮件和语音等渠道构建智能体。其开源 iMessage bot 至今仍占 98% 使用量,4 月上线的托管平台称具备 99.95% 可用性、SOC 2 Type II 和 HIPAA 合规。公开客户包括 Corgi Insurance、Boardy、Ditto 和 Rho,Photon 还为 Nous Research 的 Hermes agent 提供底层支持。

来源:https://theaiinsider.tech/2026/10/05/photon-announces-4-5m-seed-round-to-help-developers-build-ai-agents-for-imessage-and-whatsapp/

产品应用

Shopify Canvas 支持对话式建站

Shopify 推出建站工具 Canvas,商家可以通过与 AI 智能体 Sidekick 对话来搭建网店,而不必再拖拽主题区块或为此修改代码。商家描述需求后,页面改动会实时出现,并可查看整店或放大细节;Shopify 强调这不是静态预览,而是商店真实代码的渲染结果。Canvas 中 Sidekick 会截图记录自己的操作,随页面更新同步观察当前效果;用户仍可点击单个元素直接编辑。为实现这一点,Shopify 向 Sidekick 开放了主题文件访问权限,并简化了主题架构。目前 Canvas 仅支持桌面端,尚未支持第三方主题、app 区块和扩展、多市场、翻译、灰度发布或主题更新,Shopify 表示会逐步补齐。

来源:https://theaiinsider.tech/2026/10/05/shopifys-canvas-lets-merchants-build-online-stores-by-chatting-with-ai/

ChatGPT 图片生成加载界面将出现商品轮播广告

ChatGPT 将推出一种新的广告形式:美国用户在等待图片生成时会看到展示广告。这些广告会以商品轮播的形式填充图片生成界面的加载屏幕。The Decoder 的报道没有披露该广告形式的计费方式、开放行业或更细粒度产品规则。这意味着 ChatGPT 的广告位从对话场景进一步延伸到图片生成等待场景。

来源:https://the-decoder.com/chatgpts-new-ad-format-fills-the-image-generation-loading-screen-with-product-carousels

技术与洞察

VA-Bench:12 个模型目标识别接近满分,完整任务成功率约一半

VA-Bench 将空间智能放入“观察—推理—行动—修正”闭环,测试模型观看示范视频后,自行决定切换视角、给出移动距离和旋转角度、控制夹爪并在线修正。测试覆盖 12 个主要多模态模型,包含 14 类机器人操作任务、280 个经过物理验证的基础场景,其中 11 类为单臂、3 类为双臂。成绩靠前的 Qwen3.8-max、Opus-5 和 GPT-5.6-sol,目标识别与定位达到 100%,操作语义理解达到 99.6%—100%,但完整任务成功率分别只有 53.93%、52.86% 和 51.55%。子任务完成率为 65.9%—68.6%,说明失败多见于任务稳定完成阶段而非完全不懂。错误发现得分上,三者分别为 73.6%、70.8% 和 69.9%,但在线修正得分只有 46.7%、27.3% 和 32.4%。双臂任务进一步放大差距,Qwen3.8-max 从单臂平均 65.61% 降到 11.11%,Opus-5 从 64.09% 降到 11.67%。对照实验还显示,一旦模型失去主动切换视角能力、被改为直接提供 5 个固定视角,4 个模型成功率全部下降。

来源:https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651061111&idx=2&sn=cad2d261764e3894f685585728ae08b6

Claude 自我对弈 Elo 从 1500 升至 1760,GPT-6 Astra 跌至 1400

LMArena AI 能力负责人 Peter Gostev 做了“AI 自学下棋”实验:模型与不同强度档位的 Stockfish 对弈 200 盘,自行选择难度、记笔记,不被允许调用国际象棋引擎代下,也没有更新模型参数。Claude Opus 5.5 在前 75 盘还在 1500 分附近,200 盘后页面 Elo 升到 1760。GPT-6 Astra 第 29 盘还有 1810 分,200 盘后降到 1400;它对阵满血 Stockfish 共 68 盘,一盘未胜。作者也说明,该页面 Elo 只根据最近 50 盘对 Skill 0 和 1800 档的成绩估算,不参与满血档,也不能等同于人类棋手 1760 分水平。

来源:https://mp.weixin.qq.com/s/cmNRJwZ_JRMuxHskNyIn-w

Harvey 联创谈应用公司如何建立研究实验室

Harvey 联合创始人兼总裁 Gabe Pereyra 在 Sequoia 活动上表示,AI 应用公司很难在资金、人才和算力上正面战胜基础模型公司,但可以借助开源模型、专业训练平台和外部研究团队建立自己的研究能力。Harvey 于 2026 年 9 月 9 日宣布完成 5.5 亿美元融资,估值 155 亿美元,并披露全美百大律所中超过 80% 已使用其产品。方法论上,Harvey 强调先建真实任务的评测标准和训练数据,再与专业研究团队合作做后训练,并建立模型路由、分层评测和持续反馈的生产基础设施。公司公开了 LegalAgentBench、合同数据集和尽职调查数据集,后者最大虚拟资料室包含约 8000 万个 token。由于法律材料高度敏感,Harvey 采用领域专家设计任务与评分标准、AI 生成关联合成材料、专业人员校正的流程,并与 Fireworks、Baseten、Trajectory、Applied Compute 等团队开展不同项目。

来源:https://mp.weixin.qq.com/s?__biz=MzI4NTgxMDk1NA==&mid=2247518464&idx=1&sn=8bf99bf96dfc6b64dc38459d174cb7d0

Graphite 研究:AI 写作仍有 1.3 万个固定痕迹

营销公司 Graphite 发布研究,从前沿 AI 模型中找出 13000 个在 AI 写作中出现频率至少是人类文本两倍的短语。研究用 ChatGPT 发布前发表的 1 万篇文章作人类对照组,再让不同模型基于摘要重写这些文章,比较用词和句式。具体痕迹上,Claude Opus 5.5 偏好“dependable”,并频繁解释事情为何重要,相关表达频率最高可达人类作者的 116 倍;OpenAI Astra 倾向使用对能力边际的模糊表述和“通过否定的方式定义主题”,这类句式比人类文本常见 100 倍以上。各家实验室都大幅减少破折号使用,Gemini 3.1 Pro 几乎完全不用。Graphite 首席 AI 官 Greg Druck 说,痕迹总数仍保持稳定,因为去掉旧习惯后,新模型版本又会冒出新习惯;他还称 Claude 模型在用词模式上正逐渐接近人类,而 GPT 模型距离在拉大。

来源:https://theaiinsider.tech/2026/10/05/graphite-study-finds-ai-models-still-leave-thousands-of-writing-tells/

FlexiTac 开源触觉传感器 3 分钟组装,已接入 LeRobot

哥伦比亚大学李昀烛团队在 IROS 2026 触觉专题研讨会上介绍了开源柔性压阻式触觉传感器平台 FlexiTac。该平台完整开源了物料清单、组装说明和读取触觉数据的软件,采用 FPC 与力敏薄膜层叠结构,备料后仅需 3 分钟即可装配完成。传感器可弯曲、裁剪并包覆在不同几何表面,能做成触觉手套、指尖传感器或机器人皮肤,兼顾低成本、柔性、可扩展性和批次一致性。团队称 2024 年录视频制作的传感器时隔一年半仍可用旧数据训练的模型工作;仿真侧因传感机制简单,只需构建弹簧-阻尼系统并标定 3 个超参数。技术栈已集成进 LeRobot,配有可打印 SO-100 机械臂的本科生也能接入;与普渡大学合作的 VTAP Gripper 入围 IROS 最佳论文奖,ADI 正推进商业化版本,其触觉分辨率达到人类手指的 5 倍。

来源:https://mp.weixin.qq.com/s?__biz=MzA5ODEzMjIyMA==&mid=2247746662&idx=1&sn=4119c301a06e8be70446807411e9e033

行业动态

SemiAnalysis 实测:同价位 Claude 的 API 等价 Token 价值约为 ChatGPT 5 倍

SemiAnalysis 对 Anthropic、OpenAI、Meta、MiniMax、月之暗面和智谱的订阅套餐做了极限压测。其核心结论是,同样月费下 Anthropic 给用户的 API 等价 Token 普遍是 OpenAI 的约 5 倍,Token 总量接近 3 倍。账本层面,Anthropic 订阅用户只贡献 10% 收入,却消耗 41.7% 推理算力,相当于把每兆瓦算力综合收入拉低 3600 万美元;若一个用户把 200 美元套餐里的 Opus 5.5 额度打满,Anthropic 该订单毛利率为 -369%。200 美元档下,ChatGPT Pro 200 可跑出价值 2897 美元的 API 等价 Token,Claude Max 20x 可跑出 2485 美元,但 Fable 5.1 最多只能消耗总额度 50%。日常编码的 Opus 5.5 对 GPT-6.1 Sol 更悬殊:Claude Max 20x 可跑出 286 亿 Token、API 价值 11726 美元,为月费 58.6 倍;ChatGPT Pro 200 为 102 亿 Token、价值 2084 美元,只有月费 10.4 倍。100 美元档下,Claude Max 5x 为 140 亿 Token、价值 5725 美元,ChatGPT Pro 100 只有 51 亿 Token、价值 1055 美元;20 美元档下,Claude Pro 为 29 亿 Token、价值 1178 美元,ChatGPT Plus 只有 10 亿 Token、价值 211 美元。测试还发现 OpenAI 已在月底将 200 美元套餐 Token 额度砍半,并新推 500 美元档;新版 100/200/500 三档每美元购买到的 Token 量已经一致。国产套餐中,MiniMax Token Ultra 售价 132 美元可跑出 API 等价价值 3088 美元,倍数 23.4;智谱 GLM Coding Max 售价 168 美元可跑出 1942 美元,倍数 11.6。为测出隐藏限制,团队拆分未缓存输入、缓存写入、缓存读取和生成输出四类分别压测,并使用《战争与和平》文本、随机标记和长论文提示词控制缓存与输出。测试期间他们还抓到厂商灰度实验:三个相同账号中,一个老账号额度低 20%,厂商承认在极小范围内 A/B 调整用量上限。

来源:https://mp.weixin.qq.com/s?__biz=Mzg3MTkxMjYzOA==&mid=2247519452&idx=1&sn=4f129e3c5efa2e16b429f93a1124524f

Meta、微软缩减 Claude 使用预算

Meta 和微软正在大幅减少对 Anthropic Claude 的使用。微软把云部门每名员工的月度 Claude 预算从 10 万美元直接压到 1 万美元,Meta 则把 Claude Code 用户数从约 6 万减半至 3 万人。两家公司都在同时推广自家 AI 工具。对 Anthropic 来说,少数大客户的高集中度正在从收入优势转化为战略风险。

来源:https://the-decoder.com/meta-and-microsoft-pull-back-from-claude-as-anthropic-transforms-from-partner-into-competitor

Armadin 融资 2.555 亿美元,估值超 25 亿美元

AI 网络安全公司 Armadin 完成 2.555 亿美元 B 轮融资,估值超过 25 亿美元,累计融资达到 4.45 亿美元。本轮由 Andreessen Horowitz 和 Accel 共同领投,新投资方包括 Bain Capital Ventures 和 Redpoint,现有股东包括 Google Ventures、Kleiner Perkins、Menlo Ventures 和 In-Q-Tel。Armadin 使用一群模拟黑客行为的 AI 智能体来发现组织防御中的弱点,新资金将用于扩展平台、研究、训练和市场推广。公司创始团队包括 CEO Kevin Mandia,他曾创办 Mandiant 并将其出售给 Google;CTO Travis Lanham 负责产品和工程,首席进攻安全官 Evan Peña 负责红队经验,首席架构师 David Slater 负责 AI 技术架构。董事会成员还包括 CrowdStrike CEO兼创始人 George Kurtz、Accel 合伙人 Ping Li 和 Ballistic Ventures 联合创始人 Jake Seid。

来源:https://theaiinsider.tech/2026/10/05/armadin-hits-2-5b-valuation-with-255-5m-series-b-for-ai-hacker-agent-swarms/

前瞻与传闻

Hinton 等发 RSI 论文:AI 参与研发或让一年进步压缩到约 5 周

Geoffrey Hinton、Yoshua Bengio、强化学习先驱 Andrew Barto、OpenAI 首席科学家 Jakub Pachocki 等 22 位作者发表论文《What if automating AI R&D triggers an intelligence explosion?》,讨论 AI 参与研发下一代 AI 后可能触发的递归自我改进。论文核心判断包括:一旦 AI 能完整参与下一代 AI 的研发,自我改进反馈回路可能真正闭环;AI 研发自动化跨过某个临界点后,原本需要数年完成的进步可能被压缩到几个月;未来 AI 实验室规模可能从几千人研究员扩展到数百万人级;极端情况下,今天一年完成的 AI 进步未来可能只要约 5 周。论文引用 Anthropic 内部数据称,AI 生成且获批的代码从 2025 年 1 月的低个位数比例升至 2026 年 5 月的超过 80%;Claude 在仅接受高层人类监督下自主承担 AI 研发工作的比例,从 2026 年 3 月的约 1% 升至同年 8 月的 26%。论文还提到,截至 2026 年 9 月,OpenAI 内部系统已能经常完成原本人类员工需要数天完成的研发任务。作者强调这类“软件驱动的智能爆炸”不等同于芯片变快,更依赖算法、训练方法、Agent 工作流和合成数据可快速复用的特点。

来源:https://mp.weixin.qq.com/s?__biz=MzU3NjE4NjQ4MA==&mid=2247557428&idx=1&sn=379059763359d1d01c926418ebc91016

Google 把首颗 TPU 送入轨道,测试太空 AI 算力

Google 首次把自家芯片送入太空:一颗由 Planet Labs 建造的原型轨道算力卫星搭载 SpaceX 火箭从加州发射,任务将验证 Google TPU 能否在轨道中持续工作。卫星会以 15 分钟为间隔短时运行 TPU,以保护电源和热管理系统;Project Suncatcher 负责人 Travis Beals 表示,地面测试无法完全复现真实条件。后续演示计划在明年由两颗专用卫星通过激光互联,承担更重负载。Google 的长期设想是让 81 颗卫星近距离编队形成轨道数据中心,但坦言目前还不存在能以足够低成本规模发射的火箭。Google 还发布了将发表于《Joule》的白皮书,预测 SpaceX 到 2035 年可把发射价格降到接近每公斤 200 美元,这需要约 1800 次 Starship 发射。更新后的辐射测试显示,现有 Google 芯片可承受五年寿命期的大型推理负载,但仍不适合大规模训练。

来源:https://theaiinsider.tech/2026/10/05/google-sends-its-first-tpu-into-orbit-to-test-space-based-ai-compute/

评论

暂无评论。

登录后可发表评论。