AI 资讯日报 · 2026-08-14
今日 AI 圈迎来多款重磅发布:DeepSeek V4 Pro 正式版开放权重、Harness 插件化框架开源,智谱 GLM-5.3 与 Google Gemini 3.7 Flash 同日亮相,模型竞赛与 Agent 工具链竞争同步升温。
今日概览
- DeepSeek V4 Pro 0813 正式版发布
- DeepSeek 开源 Harness:附 2 万字保姆级教程
- xAI 发布 Grok 4.6
- Ilya 首个模型发布
- 智谱发布 GLM-5.3,Google 推出 Gemini 3.7 Flash,DeepSeek 开放 V4 Pro 权重
- GLM-5.3 抢先实测登顶
- DeepSeek Harness 震撼开源:一切皆插件
- DeepSeek V4 Pro 上线:跑通腾讯财报 1100 万 token
- Meta 开源 Muse Glimmer:30B 端侧 Agent 模型
- Anthropic 将 Claude Cowork 带入 Chrome 扩展
- Claude 扫清 2000 阶以下哈达玛矩阵
- AI 编程公司 Cognition 拟融资超 10 亿美元
- DeepSeek V4 Pro 正式版发布(与第 1 条重复,合并)
- Google 发布 Gemini 3.7 Flash
- InstEmb:面向 Oxygen 商品知识表征的未来感知指令嵌入
大模型
DeepSeek V4 Pro 0813 正式版发布
DeepSeek V4 Pro 0813 正式版于今日发布,成为当天最受关注的 AI 资讯。据相关报道,其性能接近 Fable,但价格仅为后者的百分之一,性价比极为突出。正式版同时开放了模型权重,允许开发者下载使用。该模型在推理速度和综合能力上均有明显提升,发布后社区反响热烈。多家媒体与开发者将其列为今日头条级更新,认为这是 DeepSeek 系列的一次重要迭代。
DeepSeek V4 Pro 上线:跑通腾讯财报 1100 万 token
DeepSeek V4 Pro 上线后,有开发者将其用于实际金融场景测试,用腾讯财报作为测试材料,一次性处理了高达 1100 万 token 的数据量。测试结果显示,模型在 AI 财务解读方面表现出极高的精准度,能够在大规模长文本场景下保持稳定的理解与分析能力。这一实测案例展示了 V4 Pro 在超长上下文、金融文档处理等重负载任务上的实际应用潜力。对于需要处理海量文本的企业用户而言,V4 Pro 的长文本能力具备较强的实用价值。
xAI 发布 Grok 4.6
xAI 发布了 Grok 4.6,相关视频实测显示其性能“飙升超震撼”。Grok 4.6 是 xAI 在 Grok 系列上的又一次重要迭代,实测者认为这标志着 AI 能力的一个新里程碑。关于具体的技术细节和基准数据,现有信息未给出更多细节。作为马斯克旗下 xAI 的主力模型,Grok 4.6 的发布延续了该公司在开源与高性能模型上的竞争节奏。
Ilya 首个模型发布
Ilya Sutskever 的首款模型正式发布,这位 AI 领域的重要人物亲自操刀,新架构在效率上表现突出。该模型发布引发业界高度关注,被视为 Ilya 离开原机构后独立探索的重要成果。新架构的效率提升被认为是其最大亮点,可能在推理成本或训练效率上带来显著改善。具体的技术细节和基准测试结果尚未披露,但“效率炸裂”的评价指向其在同等算力下的更强表现。
智谱发布 GLM-5.3,Google 推出 Gemini 3.7 Flash,DeepSeek 开放 V4 Pro 权重
今日多款旗舰模型集中亮相:智谱发布 GLM-5.3,Google 推出 Gemini 3.7 Flash,DeepSeek 则开放 V4 Pro 权重并发布 Harness 框架辅助 Agent 执行。此外还有多模态模型 dots3 预览版同步亮相。这一波密集发布标志着大模型竞争进入白热化阶段,各家在通用能力、多模态与 Agent 工具链上全面发力。对于开发者而言,同日多款模型可选,意味着在性能、价格与生态之间拥有更丰富的决策空间。
GLM-5.3 抢先实测登顶
AICodeKing 发布视频称其提前获得 GLM-5.3 的体验资格,并在个人基准测试中将其排在第一位,评价为“全基准碾压”。实测聚焦于代码生成与推理能力,认为 GLM-5.3 相较前代有跨越式提升。这一来自第三方开发者的抢先测试,为 GLM-5.3 的综合能力提供了初步佐证。在国产大模型与国际模型的正面竞争中,GLM-5.3 的实测表现值得持续关注。完整的第三方基准评测仍需等待更广泛的验证。
Google 发布 Gemini 3.7 Flash
Google DeepMind 正式发布 Gemini 3.7 Flash,这是 Gemini 系列的新一代快速推理模型。该模型主打极速响应与低能耗,多模态能力得到全面升级。针对开发者场景,Gemini 3.7 Flash 在速度与成本的平衡上做了优化,适合需要高频调用、低延迟响应的应用。官方博客称其为“极速低耗”的代表,定位偏向轻量级、高性价比的 API 服务。它的发布补充了 Google 在 Flash 系列上的产品线,与旗舰模型形成搭配。
AI 产品与 Agent
DeepSeek 开源 Harness:附 2 万字保姆级教程
DeepSeek 开源了 Harness 框架,该项目对标 Claude Code 迅速走红。Harness 采用 MIT 协议,界面与插件体系全部开放,内测期间已有超过三百个插件涌现。这一开源动作被视为 DeepSeek 在 Agent 工具链上的一次重要布局。社区同时发布了万少的 2 万字保姆级教程,帮助开发者快速上手。Harness 的插件化设计让其在实际使用中具备极高的灵活性和可扩展性。
DeepSeek Harness 震撼开源:一切皆插件
DeepSeek Harness 正式开源,核心理念是“一切皆插件”。开源详情显示,该框架的插件化设计灵活度极高,MCP(Model Context Protocol)集成变得非常简单,开发者可以快速将其打造为效率工具。继 V4 Pro 发布后,Harness 的开源进一步巩固了 DeepSeek 在模型加工具链上的完整生态。社区对其评价为“未来已来”,认为插件化将成为 Agent 开发的主流范式。该框架的开源协议与开放性也为开发者提供了低门槛的参与机会。
Meta 开源 Muse Glimmer:30B 端侧 Agent 模型
Meta 开源了 Muse Glimmer,一个 300 亿参数的本地 Agent 模型,采用 Apache 2.0 协议。该模型专为本地任务优化,可在消费级 GPU 上运行智能体,无需依赖云端 API。Muse Glimmer 具备多模态能力,并采用多阶段训练策略,在编程自动化等任务上表现更强。这一开源动作瞄准端侧智能体部署场景,降低了对云服务的依赖,同时兼顾了数据隐私与离线运行需求。对于希望在本地运行 Agent 的开发者来说,这是又一个值得关注的选项。
Anthropic 将 Claude Cowork 带入 Chrome 扩展
Anthropic 将 Claude Cowork 引入其 Chrome 扩展,用户可在浏览器侧边栏中运行该 AI 助手。Claude Cowork 支持技能与插件,能够在浏览器环境中执行更多操作,被评价为“效率狂飙”。这一更新将 Claude 的能力从独立应用延伸到浏览器场景,覆盖网页阅读、信息整理、表单操作等日常任务。浏览器是用户日常工作中最高频的场景之一,Claude Cowork 的嵌入意味着 Anthropic 正在积极抢占浏览器入口。借助侧边栏形态,用户无需切换应用即可调用 Claude 的技能和插件。
Claude 扫清 2000 阶以下哈达玛矩阵
Claude 在数学领域取得突破,扫清了 2000 阶以下的哈达玛矩阵问题。哈达玛矩阵是组合数学与编码理论中的重要研究对象,此前大量低阶情况尚未被完全解决。这一进展被评价为“AI 开始清空数学待解列表”,展示了模型在严谨数学推理上的能力。量子位的报道称“好数学家不挑模型”,暗示 Claude 在数学任务上的表现达到专业水平。AI 在数学证明与计算数学上的持续突破,正在改变数学家的工作方式。
AI 编程公司 Cognition 拟融资超 10 亿美元
AI 编程公司 Cognition 拟融资超 10 亿美元,估值在三个月内涨至 400 亿美元,涨幅达 50%。与此同时,其 ARR 翻倍,若本轮融资完成,其估值将超过 Cursor 母公司(约 293 亿美元)。Cognition 是 AI 编程助手 Devin 的开发商,此轮融资表明资本市场对 AI 编程赛道的高度热情。AI 编程工具正成为继对话模型之后最热门的商业化方向之一。
研究前沿
InstEmb:面向 Oxygen 商品知识表征的未来感知指令嵌入
京东技术团队的研究成果 InstEmb 入选 ICML 2026。InstEmb 是一种未来感知指令嵌入方法,能够预判模型下一步的回答,使 embedding 不再局限于短视的表征。该研究面向 Oxygen AIIC 商品知识体系,旨在让模型更深入地理解商品知识。其核心创新在于将“未来信息”纳入嵌入学习,使表征更贴近真实推理过程。这一方向有望提升商品推荐、问答等场景中的语义理解效果。ICML 的认可也说明业界对动态、任务导向型嵌入研究的关注度在提升。
暂无评论。