Anthropic公开3万Agent研发下一代Claude核心数据【AI 早报 2026-09-19】

Anthropic公开3万Agent研发下一代Claude核心数据【AI 早报 2026-09-19】

今日早报涵盖Anthropic首次公开AI研发自动化与安全监控核心指标、通义千问全模态模型升级、国产医疗影像AI登Science开源、PrismML发布超小尺寸三进制大模型、千问办公助力天文观测等核心资讯。

今日概览

  1. Anthropic公开3万Agent研发下一代Claude核心数据
  2. 千问办公3天搭建仿真环境协助预警8颗超新星
  3. 通义千问发布新一代全模态模型Qwen3.8-Omni-Flash
  4. 达摩院通用医疗影像AI模型DAMO RADAR登Science并开源
  5. PrismML发布5.9GB三进制Bonsai 2 27B模型保留98.2%性能
  6. Jina AI发布jina-ocr-v1文档解析模型单卡推理速度翻倍
  7. 紫东太初开源9B参数空间具身智能多模态大模型ZDTaichu5.0
  8. Anthropic与埃森哲合作投入10亿美元评估前沿AI安全
  9. 研究者从零搭建可调用工具的25M参数LLM Pebble
  10. 2026年主流LLM模型格式对比:GGUF、GPTQ等详解
  11. 提出LLM间直接语义通信的Cache-to-Cache范式
  12. Claude Code新增AGENTS.md支持

大模型进展

Anthropic公开3万Agent研发下一代Claude核心数据

Anthropic首次向公众公开AI研发自动化的三项核心指标。截至2026年8月,Claude主导的研发工作占比达26%,AI深度协作及以上级别的研发工作占比超过90%,完全自主操作的研发比例为0。Anthropic内部当前约有30000个AI Agent从事研发与工程工作,实时在线监控覆盖率100%,2026年8月分析了超过10亿次Agent决策,其中0.002%的动作被直接拦截,约每47000次操作拦截1次;事后离线监控覆盖率同样100%,每周标记约10万份记录,最终筛选出约50份最高优先级记录交予人类复核。抽样2026年7月中旬一周的算力消耗显示,AI研发总算力中安全研究所占比约6%,AI自主研发算力中安全研究所占比约12%。Anthropic计划邀请多家独立第三方机构进驻公司,全程监督上述指标。 来源:https://mp.weixin.qq.com/s?__biz=Mzg3MTkxMjYzOA==&mid=2247519062&idx=1&sn=06eac96ac1876878d586ef266792a968

通义千问发布新一代全模态模型Qwen3.8-Omni-Flash

Qwen3.8-Omni-Flash是阿里推出的新一代原生全模态模型,支持文本、图像、音频、视频输入及1M长上下文,核心目标是提升真实生产力场景中的Agent能力。在累计30项评测中,相比上一代Qwen3.5-Omni-Plus平均得分提升超过26%;音视频Agent、Coding和长程任务方面,WildClawBench-MM提升36.5分,AgenticVBench提升22.3分,UniClawBench取得69.6分。基础能力上,LongAudioSpan提升8.3分,OmniVideoBench提升9.6分,多说话人识别的DER从88.11降至3.35,cpWER从89.61降至17.18。其音视频能力接近Gemini 3.8 Flash,音频能力整体超过后者,API每小时音频输入价格降幅超过98%,每小时音视频输入价格降幅超过93%。同时阿里开源了Qwen-MM-Plugins与Qwen-Live Harness,分别支持长音视频工作流与实时全模态交互。 来源:https://mp.weixin.qq.com/s?__biz=MjM5NTg0NDE1Mw==&mid=2652628269&idx=1&sn=1ee2ce1720d33f4a7643f712eaf341c9

PrismML发布5.9GB三进制Bonsai 2 27B模型保留98.2%性能

PrismML发布基于Qwen3.8 27B的三进制权重模型Ternary Bonsai 2 27B,总参数量27.36B,文件体积仅5.93GB,相比FP16版本的53.80GB压缩比超过90%。模型在20项基准测试中平均保留父模型98.2%的性能,支持文本、图像输入及262K token上下文,可在16GB内存笔记本或单张24GB GPU上运行,需配合PrismML的llama.cpp fork或MLX运行时。模型权重采用Apache 2.0协议,视觉塔在GGUF格式中作为独立0.63GB文件存储,仅在图像输入时加载。本次发布距首款Bonsai 27B仅2个月,首款三进制版本性能保留约95%,本次性能损失进一步缩小。 来源:https://www.marktechpost.com/2026/09/18/prismml-releases-ternary-bonsai-2-27b-a-5-9-gb-apache-2-0-model-retaining-98-2-of-qwen3-8-27b-performance/

紫东太初开源9B参数空间具身智能多模态大模型ZDTaichu5.0

9月15日,紫东太初正式开源ZDTaichu5.0-9B通用多模态大模型,该模型在9项国际空间理解基准测试中取得8项同参数通用组第一,在复杂空间推理能力的MindCube-tiny测试中得分为78.27,较Qwen3.5-9B高出20.67个百分点。模型未牺牲通用多模态能力,OCR、图文理解、视觉数学、代码Agent等能力仍保持第一梯队水平,支持任意分辨率输入。此次开源不仅开放模型权重,还同步公开了完整的空间多模态数据生产管线详细方案,覆盖原始数据收集、去重、标注、预训练、SFT、强化学习全流程,降低产业方二次开发门槛。 来源:https://mp.weixin.qq.com/s?__biz=MzU5OTI0NTc3Mg==&mid=2247558337&idx=1&sn=751ed172389eb735f7efcb4ff5ce8e1a

Jina AI发布jina-ocr-v1文档解析模型单卡推理速度翻倍

Jina AI正式发布jina-ocr-v1端到端文档解析模型,总参数量3.4B,解码时每个Token仅激活570M参数,在OmniDocBench v1.6与olmOCR-Bench两大基准上均刷新同级别最佳成绩,14款主流端到端系统的吞吐实测中以2.57页/秒领跑。在单张NVIDIA L4低成本显卡上,通过专门设计的推测解码草稿头FastMTP,生成速度几乎翻倍,且输出序列与标准自回归解码严格一致。模型延续DeepSeek-OCR的紧凑视觉编码与MoE解码路线,后训练阶段通过Dense Verifiable Rewards奖励机制在olmOCR-Bench上提升7.4分,现已在Hugging Face、魔搭、arXiv开源,同时提供API服务。 来源:https://mp.weixin.qq.com/s?__biz=MzkyODIxMjczMA==&mid=2247503626&idx=1&sn=8b4cd6a8470c0ac7a4bca09f3ab1425f

研究者从零搭建可调用工具的25M参数LLM Pebble

一名开发者发布了从零开始训练的小型语言模型Pebble,总参数量2500万,支持工具调用(如计算器、天气API),训练过程仅使用单张GPU,耗时3周,未使用HuggingFace等现成框架。该项目的目标是填补现有LLM教学内容的空白:既不使用“注意力就像高亮关键词”这类无效类比,也不使用动辄上万行代码的生产级框架,而是提供一套可完整复现、规模足够小、能在一下午读完的现代LLM实现方案,涵盖分词器、Transformer、训练循环、对齐、部署全流程。 来源:https://pub.towardsai.net/i-built-a-tool-calling-llm-from-absolute-zero-heres-everything-i-learned-bad8ece610d3?source=rss----98111c9905da---4

行业应用落地

千问办公3天搭建仿真环境协助预警8颗超新星

中国科学院国家天文台科研团队基于千问办公的Agent Harness框架,用时不到3天、成本仅千元左右,搭建了一套科研级望远镜仿真环境。该环境将望远镜组件和传感器接口包装为MCP协议,Agent可读取设备状态与可观测条件,随后接入“司天”探路者和“司天”原型机,实现瞬变观测的自动调度。这套系统已协助天文学家预警了8颗超新星,解决了真实望远镜无法承受Agent反复试错、临时高价值目标无法预演调度等痛点。此前国家天文台基于千问开发的星语望远镜StarWhisper Telescope已被列入斯坦福大学《AI Index Report 2026》Science章节,是2025年物理天文领域的代表性AI Agent。 来源:https://mp.weixin.qq.com/s?__biz=MTMwNDMwODQ0MQ==&mid=2653113785&idx=1&sn=62ac6619e846a2d7090b8ed72d174ec2

达摩院通用医疗影像AI模型DAMO RADAR登Science并开源

阿里巴巴达摩院联合浙江大学医学院附属第一医院等机构研发的通用医疗影像AI模型DAMO RADAR登上《科学》期刊。该模型面向腹部增强CT诊断,可一次性识别超过146种病症,在近4万次真实检查中平均AUC达到0.913,成为首个达到影像科专家水平的通用医学影像AI模型。在与26名影像科医生的对比测试中,其平均准确率超过其中23名医生;在AI提示下,放射科医生诊断敏感性提高10%,用时减少30%以上,低年资医生可达高年资医生诊断水平。该模型现已正式开源,未来有望拓展到其他类型医疗影像。 来源:https://mp.weixin.qq.com/s?__biz=MjM5NTg0NDE1Mw==&mid=2652628269&idx=2&sn=318a825c50d91868315ae83a5fae6605

技术研究与开源

2026年主流LLM模型格式对比:GGUF、GPTQ等详解

该文章厘清了LLM模型格式的两层概念:容器格式(定义张量在磁盘上的存储方式,如safetensors、GGUF、PyTorch pickle)与量化方法(定义权重如何压缩到更少比特,如GPTQ、AWQ、EXL2)。文章给出了权重内存的估算规则:权重内存≈参数量×每权重比特数÷8,例如8B参数的FP16模型约16GB,4.5比特量化后约4.5GB。其中GGUF是llama.cpp使用的二进制格式,2023年8月推出以替代旧版GGML,支持单文件部署、可扩展、内存映射加载,可携带分词器、特殊令牌与对话模板;EXL2/EXL3则是量化方法与存储布局绑定的方案,仅适用于特定推理库。文章还指出多数量化模型的权重仍存储在.safetensors文件中,量化信息存在于张量内容与配置文件中,而非新的容器格式。 来源:https://www.marktechpost.com/2026/09/18/gguf-vs-gptq-vs-awq-vs-exl2-llm-model-formats-explained-2026/

提出LLM间直接语义通信的Cache-to-Cache范式

针对现有多LLM系统通过文本通信导致语义信息丢失、生成延迟高的问题,研究者提出Cache-to-Cache(C2C)范式,实现LLM间的直接语义通信。该方法通过神经网络将源模型的KV-Cache投影并融合到目标模型的KV-Cache中,实现直接语义传输,同时使用可学习的门控机制选择受益于缓存通信的目标层。实验显示,C2C比单模型平均准确率高6.4%-14.2%,比文本通信范式高约3.1%-5.4%,同时延迟平均降低2.5倍。相关代码已开源。 来源:https://arxiv.org/abs/2510.03215

Claude Code新增AGENTS.md支持

Claude Code在2.1.277版本中新增对AGENTS.md文件的支持,当项目文件夹中不存在CLAUDE.md文件时,Claude会自动检测并使用AGENTS.md文件作为项目指令配置,进一步扩展了AI编程工具的项目适配能力。 来源:https://simonwillison.net/2026/Sep/18/thariq-shihipar/

行业合作与安全

Anthropic与埃森哲合作投入10亿美元评估前沿AI安全

Anthropic与埃森哲达成合作,共同开展前沿AI的独立评估工作,这是Anthropic近期推进“在内部嵌入评估者”承诺的组成部分。双方预计在未来5年内为该领域投入至少10亿美元,用于建设AI安全评估的能力储备。 来源:https://www.anthropic.com/news/accenture-embedded-evaluation

评论

暂无评论。

登录后可发表评论。