大模型与产品
DeepSeek官方宣布大模型API最高降价60%
本周二晚间,DeepSeek开放平台发布公告,宣布再次调整大模型API定价,整体降幅最高达60%。调整后闲时价格统一为:输入(缓存命中)0.02元/百万token、输入(缓存未命中)1元/百万token、输出4元/百万token,高峰时段价格仍为闲时的两倍。此次定价调整延续了DeepSeek此前高性价比的定位,相较于行业同参数级别模型的API价格具备明显优势,有望进一步吸引中小开发者接入使用,推动AI应用的普及。 来源:https://mp.weixin.qq.com/s/D-I1TCpkSsPuKLFVd-6fDA
面壁智能联合OpenBMB开源2B参数端侧模型MiniCPM5-2B,性能超越12B谷歌Gemma 4
9月8日,北京端侧大模型独角兽面壁智能联合OpenBMB开源社区,正式发布新一代端侧语言基座模型MiniCPM5-2B,参数规模仅为2B。该模型支持工具调用、深度搜索、代码生成等任务,已完成英特尔、瑞芯微、Arm等主流芯片或计算平台的首日适配。根据Artificial Analysis评测榜单,MiniCPM5-2B以23分位列全球4B以下开源模型第一,智能密度高于Qwen3.5 9B和参数规模为其6倍的谷歌Gemma 4 12B模型,在Agentic Index指标上得分20分,远超同级模型的平均10分以下水平。面壁智能同时开源了自研强化学习框架Meshy、强化学习策略JustRL II以及完整训练配方和配套数据集,为开发者提供可复现的技术路径。截至2026年8月,MiniCPM系列开源模型全球下载量已突破5000万次。 来源:https://mp.weixin.qq.com/s?__biz=MzA4MTQ4NjQzMw==&mid=2652809987&idx=3&sn=eac062cb2954eea1552b9ac1f689104a
OpenAI上线ChatGPT Sites建站工具,建站流程简化如撰写Google文档
OpenAI近日正式上线ChatGPT Sites建站工具,将网站搭建流程简化到类似撰写Google文档的程度,用户仅需通过自然语言提示即可快速生成完整网页。该工具大幅降低了非技术用户搭建网站的门槛,无需掌握HTML、CSS等前端技术,也不需要复杂的设计操作,即可快速产出可用页面,目前已经面向OpenAI付费用户开放测试,后续有望进一步拓展自定义功能,满足更多样化的建站需求,拓展AI在内容创作、轻量级应用开发领域的落地场景。 来源:https://www.fastcompany.com/91602695/chatgpt-sites-makes-building-a-website-feel-like-making-a-google-doc?utm_source=postup&utm_medium=email&utm_campaign=artificial-intelligence&position=12&partner=newsletter&campaign_date=09102026
OpenAI发布最强模型GPT-6 Astra,自称已达AGI引争议
OpenAI近日正式发布旗下最新一代大模型GPT-6 Astra,官方宣称该模型能力已达到通用人工智能(AGI)水平,是OpenAI迄今发布的最强模型。此前OpenAI在攻克千禧年数学难题时曾提及所用模型能力超过GPT-6 Astra,此次正式发布也引发了外界对模型能力边界的广泛讨论。不过该声明也引发了外界关于AGI判定标准的广泛争议,部分研究者认为当前模型的“AGI”表述更多是营销话术,尚未达到真正的通用智能水平,同时模型能力提升也带来了新的安全风险担忧。 来源:https://www.fastcompany.com/91601838/openai-unleashes-astra-its-most-capable-and-controversial-model-yet?utm_source=postup&utm_medium=email&utm_campaign=artificial-intelligence&position=14&partner=newsletter&campaign_date=09092026
OpenAI Codex负责人分享Codex从内部工具到产品的打造全过程
OpenAI Codex核心负责人Tibo Sottiaux近日接受深度访谈,分享了Codex从最初的公司内部工具发展为对外产品的完整历程,以及OpenAI内部如何用AI工具重构整个软件开发流程。Tibo Sottiaux背景横跨应用数学、供应链优化、Google地图研发和DeepMind研究,其团队通过将代码编写、Code Review、依赖维护等软件开发核心环节逐步自动化,大幅提升了研发效率。访谈中提到,当写代码的成本趋近于零时,软件工程师的核心价值已经转向更高层的架构设计、需求梳理和问题定义,整个软件行业的开发逻辑正在被深刻改写。 来源:https://mp.weixin.qq.com/s?__biz=Mzg3NDc2MjQxMg==&mid=2247495222&idx=1&sn=d91d670f745443866118725c793bd564
Agent技术进展
字节Seed团队一天连发3篇自进化Agent相关论文,围绕闭环递归自我改进(RSI)打出组合拳
字节跳动Seed团队近日连发3篇围绕闭环递归自我改进(Closed-Loop RSI)的Agent研究论文,三篇论文并非孤立工作,而是共同构成了一套可落地的自进化Agent技术方案。三篇论文分别针对三个核心问题给出答案:《Aspire》验证了仅给出模糊自然语言目标时,模型是否具备自我进化的能力;《S3Gym》验证了自测试、自评判机制能否转化为实际的自我改进效果;《HarnessDev》则探索了模型能否自主构建并迭代优化Agent的运行框架(harness)。三篇论文共用项目页self-developing-agents.github.io,为自进化Agent的研发提供了可复用的技术路径。 来源:https://mp.weixin.qq.com/s?__biz=Mzk0MTYzMzMxMA==&mid=2247511340&idx=1&sn=0916e760ff2308781151f02311457d14
美团技术团队发布《Agent评测白皮书》系列首篇:Agent评测全览
美团技术团队正式发布《Agent评测白皮书》系列首篇,系统梳理了当前Agent评测的现状与痛点。白皮书指出,过去三年基座模型能力持续进化、Agent框架功能不断丰富,使得搭建Agent的门槛逐年降低,Agent落地场景随之越来越多、越来越发散,但真正完成冷启动、灰度扩量到全量的Agent项目屈指可数,核心原因之一是Agent评测方法的认知非常稀缺。白皮书总结了当前Agent项目普遍面临的“停在Demo”“卡在扩量”等共性失败原因,也提到随着Agent评测体系的逐步完善,行业有望走出“demo好看、落地拉胯”的怪圈,推动Agent技术真正实现规模化落地。 来源:https://tech.meituan.com/2026/09/10/Agent-Evaluation-White-Paper-01.html
小米正式上线桌面Agent应用MiMo Desktop
小米近日正式开放桌面端Agent应用MiMo Desktop的邀测,这是MiMo首个面向个人真实工作场景的桌面Agent产品,邀测期间用户可免费体验小米两款新一代模型MiMo-X-Pro-Preview和MiMo-X-Flash-Preview。根据实测反馈,MiMo Desktop擅长处理长程复杂任务,交付质量较高,任务执行过程中缓存命中率高达99%,能有效节省token消耗,目前已经支持接入Blender完成3D建模等复杂操作,展现了较强的场景适配能力。 来源:https://mp.weixin.qq.com/s?__biz=MzkwMzE4NjU5NA==&mid=2247520450&idx=1&sn=c0d5f7f4360c2384c4f742a08ffe6c25
行业动态与融资
AI编程助手Devin母公司Cognition完成20亿美元融资,估值达480亿美元
AI编程助手Devin的开发商Cognition近日宣布完成20亿美元融资,投后估值达480亿美元,较今年5月的26亿美元估值翻了近两番。本轮融资由Andreessen Horowitz、Accel、Founders Fund、General Catalyst和Avenir共同领投。Cognition披露,其年化经常性收入从5月的4.92亿美元增长至目前的9亿美元,预计2026年底将达到40-50亿美元。目前Cognition已经服务了多家企业客户,在AI辅助软件开发赛道已经成为核心玩家。 来源:https://theaiinsider.tech/2026/09/09/cognition-secures-2b-at-48b-valuation-as-ai-coding-race-intensifies/
研究前沿
OpenAI宣称攻克千禧年数学难题,1万个Agent耗时88小时解出纳维-斯托克斯方程证明,引发学术争议
OpenAI近日宣布,其内部多智能体系统完成了对千禧年大奖难题之一——纳维尔斯托克斯方程存在性与光滑性问题的解答,同时公开了长达165页的证明论文以及Lean形式化验证结果。纳维尔斯托克斯方程是描述流体运动的核心数学模型,其光滑解是否存在长期困扰数学界,若证明成立将是对流体力学基础理论的重大突破。OpenAI表示该证明由超过1万个AI Agent协同完成,耗时88小时,使用的内部模型能力显著超过GPT-6 Astra。不过该成果迅速引发学术争议:纽约大学数学家Tristan Buckmaster及合作者指控OpenAI“截胡”了其团队一年多的核心研究成果,质疑OpenAI是否利用了他们在Codex上留下的未公开研究草稿与对话内容,OpenAI对此予以否认。该成果也引发了科技界和数学界的广泛关注,清华姚班传奇陈立杰评价这是“不可思议的时代”,菲尔兹奖得主陶哲轩也称其为“非凡的成就”,但也表示尚未完全消化证明细节,同时提醒学界需要区分AI解题能力进步与人类数学知识增长的差异。 来源:https://mp.weixin.qq.com/s?__biz=Mzg3MTkxMjYzOA==&mid=2247517862&idx=1&sn=2634e817527b02295ce293caa5c9894b
阿里巴巴高德发布全球首个3D原生城市世界模型ABot-Earth 0.7
9月10日,阿里巴巴集团旗下高德地图正式发布全球首个3D原生城市世界模型ABot-Earth 0.7。该模型是面向城市场景的3D世界理解模型,不仅支持高精度的3D城市重建,还能理解城市元素之间的空间关系与动态变化,有望成为AI理解真实物理世界的核心入口,可支撑自动驾驶、城市数字孪生、实时路况预测等多类场景的应用落地,进一步拓展大模型在空间智能领域的边界。 来源:https://www.qbitai.com/2026/09/486900.html
谷歌DeepMind发布AlphaGenome Atlas,完成90亿种人类基因突变的全面测算
谷歌DeepMind近日正式发布重磅成果AlphaGenome Atlas,这是全球首个覆盖全基因组的可搜索预测数据库,完成了生命科学史上首次对全人类基因组所有潜在单碱基突变的全面测算,总计覆盖90亿种基因突变。作为AlphaFold绘制“蛋白质宇宙”之后,AI对人类生命密码的又一次全局性测绘,该数据库将为遗传病研究、基因疗法开发、功能基因组学研究等领域提供核心数据支撑,大幅加速生命科学领域的研发效率。 来源:https://mp.weixin.qq.com/s/P1MtqQ15A8p4KNTH1ARiyw
暂无评论。