arXiv限流新规:每人每月仅能投2篇,AI论文两年暴涨6倍压垮审核【AI 早报 2026-10-03】

arXiv限流新规:每人每月仅能投2篇,AI论文两年暴涨6倍压垮审核【AI 早报 2026-10-03】

今日看点:arXiv首次对全学科实施统一月度投稿上限,AI论文激增正压垮人工审核;Anthropic下一代旗舰Fable 5.5被曝灰度上线;AIBuildAI开源全自动后训练Agent,在PostTrainBench上以46.6分逼近人类专家。

今日概览

要闻

  1. arXiv限流新规:每人每月仅能投2篇,AI论文两年暴涨6倍压垮审核

模型发布

  1. Anthropic下一代旗舰Fable 5.5被曝灰度上线,开发者实测能力断层领先
  2. StartLux开源决策模型StartLux-Decision,38项基准31项高于Jev
  3. 阿里TaoLive开源音视频模型TaoMate-H3:三步LoRA推理,支持分钟级连续创作

开发生态

  1. AIBuildAI开源递归自进化后训练Agent,PostTrainBench拿46.6分逼近人类专家
  2. OpenAI DevDay 2026发布GPT-6.1 Sol与Agents API计算机使用等开发者更新
  3. Anthropic为Claude Code引入Mods系统,开发者可用TypeScript重写AI编程工具
  4. 华为等开源LegoFlow框架:从1200万PR中筛出5000个SWE任务训练Qwen3.5
  5. Cloudflare联合Ceramic.ai、Exa和Linkup推出AI Gateway Web Search API
  6. 4.6k Star论文写作指南新增paper-writing Skill,可调用Claude Code检查LaTeX与匿名信息

产品应用

  1. CopilotKit开源OpenDots:可自托管的AI同事模板,每个Dot配一台云端电脑
  2. Meta回应Muse未授权读取私人消息:需用户手动开启三项权限
  3. 开源校园Agent CourseRaptor拆解:31个工具、三端入口与本地凭证保护

技术与洞察

  1. 两周41篇Jev论文涌出,医疗、Agent、6G等场景实测最高快20倍
  2. 美国亚利桑那州法院因AI生成视频推翻过失杀人案判决,或为全美首例
  3. 新方法LEGO-Anything将照片转为Blender代码,Agent自评几何精度仅如抛硬币

行业动态

  1. a16z报告:美国VC上半年86%的钱投给AI,企业大模型落地率仅2%
  2. NVIDIA DGX Spark推出64GB统一内存版,支持百亿参数模型本地部署
  3. Reddit将于2026年11月停RSS、2027年3月关公共API,收紧AI数据出口
  4. 初创公司Satlyt获800万美元种子轮融资,要把AI模型搬到卫星上运行

要闻

arXiv限流新规:每人每月仅能投2篇,AI论文两年暴涨6倍压垮审核

2026年10月1日起,arXiv正式实施最新投稿限制:每位提交者每自然月最多提交2篇论文,同时处于活跃提交状态的论文不超过3篇,规则覆盖计算机科学、数学、物理等全部学科分类,且无法通过切换投稿分类重新计算额度。2026年9月,arXiv投稿量达到40363篇,创35年来历史新高,比2016年9月的9869篇大幅增长,较2024年同期的20569篇也已翻倍;同期平台还收到近9000张等待人工处理的支持工单。其中,人工智能分类(cs.AI)的月投稿量从2024年初的数百篇增长至2026年9月的3000篇以上,两年间增幅超过6倍。arXiv官方博客《Fair Moderation, Equitable Access, and AI》指出,AI正在打破论文生产的现实上限,审核员观察到越来越多薄论文(thin papers)和香肠论文(salami papers);据受访审核员估计,自2025年初AI低质量投稿明显增长后,平台拒稿率已从平均约4%升至10%–12%。arXiv强调不反对使用AI,但要求披露并确保学术实质;对于多人合作论文,配额只计算实际提交者,不计入其他共同作者,被拒稿件同样消耗当月额度。

来源:https://mp.weixin.qq.com/s?__biz=MjM5MDE0Mjc4MA==&mid=2651294387&idx=1&sn=1680160e51fff6a986127337614c7afb

模型发布

Anthropic下一代旗舰Fable 5.5被曝灰度上线,开发者实测能力断层领先

一批开发者近日发现,Claude网页端悄然灰度到了Anthropic下一代旗舰Fable 5.5,但界面仍显示“Fable 5.1”。知名爆料人Chetaslua晒出截图:在未联网、未调用任何工具的情况下,被路由的实验模型答出了OpenAI编程Agent Codex负责人Tibo(本名Thibault Sottiaux)给付费用户重置额度的梗。作为对照,API上的原版Fable 5.1会将Tibo误认为法国独立开发者Thibault Louis-Lucas,称其“重置”是把事业推倒重来;而被路由到Claude Code里的“Fable 5.1”则准确说出了Sottiaux和额度重置梗。开发者JAZII晒出的对照显示,9月18日就曾测出过“Fable 5.1被路由”,当时社区将其称为Fable 5.2,目前Opus和Sonnet都直接跳到了5.5,下一代Fable也只能是5.5。AI圈开发者Salio表示5.1和5.5的差距大到离谱,认为Anthropic在憋大招,外界猜测Fable 5.5可能在下周正式发布。

来源:https://mp.weixin.qq.com/s/tYfFOOrx2zS3n5UmAz1syQ

StartLux开源决策模型StartLux-Decision,38项基准31项高于Jev

StartLux(原点星辉)将自建Auto Research方法用于决策模型研发,用3天时间完成StartLux-Decision的研发与验证,并一次性推出0.8B、2B、4B、9B、27B五档版本。在独立Decision Index 0.2.1评测中,27B版本得分63.88,38项基准中31项高于Jev 1.13的57.91,高出5.97分;27B在上海人工智能实验室的七项评测中平均准确率达91.82%,高于Jev的88.74%和Intern-Decision-4B的90.02%。公开JevBench上,27B答对208/231题,比Jev多9题,Hard子集111道难题少错8题。在单卡H200、BF16短请求测试中,4B平均耗时26毫秒,0.8B、2B、9B、27B分别为12.2、15.5、35.7和102.3毫秒;模型直接输出选择及概率,不必生成回答文本。五档模型均提供原始权重及Q8_0、Q4_K_M、BF16三种GGUF版本。StartLux-Decision支持选择题、是非题和等级评分,可在一次请求中完成多个判断,演示覆盖客服工单分流、购物筛选下单、办公协作配置及Mario、StarCraft II、DOOM等游戏场景。

来源:https://mp.weixin.qq.com/s?__biz=MjM5MDE0Mjc4MA==&mid=2651294387&idx=2&sn=9030fd2bd31a5497a05147cba914a098

阿里TaoLive开源音视频模型TaoMate-H3:三步LoRA推理,支持分钟级连续创作

阿里巴巴TaoLive AIGC团队研发的音视频联合流式生成模型TaoMate-H3已开源推理代码与LoRA权重,可在GitHub和Hugging Face下载。基于MiniMax H3,TaoMate-H3将三步LoRA推理与自回归生成结合,能根据文本描述连续生成包含人物对白、歌声或环境音的视频,支持分钟级续写及480p、768p、1080p级横竖屏输出。与整段视频反复去噪不同,TaoMate-H3以小片段为单位推进,每个片段仅需三步去噪(沿0→16→33→49时间状态推进),无需等待整段视频完成生成,优先完成当前片段再生成后续内容,从而显著缩短首段产出时间。训练阶段采用Self Forcing自回归训练,让模型以自身生成的历史片段为条件继续生成,缓解仅依赖真实历史训练带来的分布差。模型通过音视频KV缓存持续更新和分段音频引导,实现跨越提示词边界的连续续写,适用于电商讲解、虚拟角色表演、动漫对白及特效场景。

来源:https://mp.weixin.qq.com/s/mUH1ltRoiNzs2FbJ2xIsnA

开发生态

AIBuildAI开源递归自进化后训练Agent,PostTrainBench拿46.6分逼近人类专家

AIBuildAI团队发布了PostTrain Agent,一个用于自主后训练大语言模型的递归自我改进(RSI)Agent,并开源了全部代码与配套知识库。给定基座模型、目标能力和算力预算,该Agent可自己设计后训练算法、收集和整理数据、写代码、跑实验并迭代改进,全程无人介入。在自主后训练基准PostTrainBench上,RSI Agent以46.6分排名第一,超过所有前沿模型与Agent系统,接近人类专家表现(51.1)。PostTrainBench(ICML 2026)要求Agent在单张H100上、10小时内自主设计并执行后训练方案,覆盖Qwen3-4B-Base等4个基座模型和数学推理、写作、代码、健康咨询等7类任务,产出的checkpoint在Agent看不到的评测集上打分。该系统采用“整实验树搜索”:设计员Agent播下若干互异起始方案,实验员端到端跑完实验并修改,选择器按预期收益、证据、新颖性和成本为候选排序。相比把编码Agent直接指向任务的线性搜索方案,该设计可并行探索不同思路,并利用配套知识库减少选错算法、数据重叠等典型错误。

来源:https://mp.weixin.qq.com/s/HQAWOH5cQoG905fwoMOK1w

OpenAI DevDay 2026发布GPT-6.1 Sol与Agents API计算机使用等开发者更新

OpenAI在DevDay 2026上宣布了一系列面向产品和开发者的更新,包括GPT-6.1 Sol、面向Agents API的计算机使用(computer use)、云端Codex环境、Decisions API以及ChatGPT的新插件能力。

来源:https://www.infoq.com/news/2026/10/openai-devday-2026/?utm_campaign=infoq_content&utm_source=infoq&utm_medium=feed&utm_term=global

Anthropic为Claude Code引入Mods系统,开发者可用TypeScript重写AI编程工具

Anthropic正在为Claude Code添加“Mods”系统,本质是在工具内部直接运行的中间件。开发者可以用JavaScript或TypeScript重塑界面和行为,包括添加自定义面板、拦截工具调用或接入新命令。

来源:https://the-decoder.com/claude-codes-new-mods-system-lets-developers-rewrite-the-ai-coding-tool-from-the-inside/

华为等开源LegoFlow框架:从1200万PR中筛出5000个SWE任务训练Qwen3.5

华为、香港中文大学、香港科技大学的研究员联合推出LegoFlow,一个交互式代码数据工程框架,目前数据、代码、文档已全部开源。LegoFlow把代码数据工程组织为Root、Curator、Tracer、Trainer、Evaluator等block,每个block封装为插件技能,Claude Code、Codex等编码智能体可直接调用。Curator负责把GitHub仓库和拉取请求转化为经过验证的任务,Tracer使用编码智能体生成并筛选轨迹,Trainer进行SFT/RL训练,Evaluator返回基准评测结果。团队发布LegoFlow-SWE,包含从1200万个候选PR中筛选出的5000个任务,覆盖8种编程语言和20个任务标签,以及2780条验证成功的高质量轨迹。仅用1000条轨迹训练Qwen3.5-35B-A3B-Base,即可在SWE-bench Verified和Pro上分别达到70.2%和48.8%;在极少人工设定下,经过两轮迭代,该模型在SWE-bench Verified上从7.6%提升至64.4%。

来源:https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651060898&idx=2&sn=7c342e5f7de860d0e928dab50043d6b5

Cloudflare联合Ceramic.ai、Exa和Linkup推出AI Gateway Web Search API

Cloudflare宣布与Ceramic.ai、Exa和Linkup合作,通过AI Gateway推出Web Search API,为Agent提供联网搜索能力。当Agent需要获取实时网页时,通常只能猜测URL再curl抓取,遇到猜错就会返回404;Web Search API让Agent像人类一样从搜索引擎查询开始,把新鲜的结构化网页摘要直接注入上下文。Cloudflare表示合作伙伴承诺遵守其公开的“Verified bots”爬虫标准,搜索结果需包含被爬取内容的位置链接。

来源:https://blog.cloudflare.com/introducing-web-search-api/

4.6k Star论文写作指南新增paper-writing Skill,可调用Claude Code检查LaTeX与匿名信息

MLNLP社区的Paper-Writing-Tips项目已获得4.6k+ GitHub Stars和541 Forks,累计超过90次提交。此次更新将论文写作经验整理为Claude Code可调用的paper-writing skill,可读取LaTeX文件或整个论文目录,检查公式符号、LaTeX排版、图表、英文表达、参考文献和匿名信息,并给出具体问题位置与修改建议。安装方式为下载仓库中的skill,解压到项目根目录的.claude/skills/下,重启Claude Code后输入/paper-writing即可调用;除了单文件检查,还支持投稿前终检,重点检查匿名性、页数、图片、表格、公式和参考文献。该skill覆盖检查缺失图片、宏包冲突、未解析引用、变量符号统一、三线表规范、拼写冠词时态等常见问题。

来源:https://mp.weixin.qq.com/s?__biz=MzU3NjE4NjQ4MA==&mid=2247557407&idx=1&sn=d70ff0ea7cda1fde716286d26675bcec

产品应用

CopilotKit开源OpenDots:可自托管的AI同事模板,每个Dot配一台云端电脑

CopilotKit团队推出完全开源、可自行托管的“AI同事”模板OpenDots,每个AI员工(Dot)拥有自己的名字、角色、权限和一台隔离的云端电脑。借助同门OpenBot容器服务,每个Dot可分配独立的浏览器档案、文件系统和终端,执行打开网站、写文件、运行shell命令等任务,实时画面和终端输出会直接渲染在对话框里。技术上,整条链路靠AG-UI协议把Agent的流式消息、工具调用和状态接到前端,模型层用TanStack AI接任意OpenAI兼容服务,CopilotKit Intelligence负责持久化对话线程。OpenDots内置human-in-the-loop审批卡片,AI草稿需用户点击Approve & save才会落库;同时支持WebRTC实时语音通话和通过Channels SDK接入Slack,电话未挂时长任务已在后台运行。项目已在GitHub狂飙1600 star。

来源:https://mp.weixin.qq.com/s?__biz=Mzk0MTYzMzMxMA==&mid=2247512359&idx=2&sn=386e90882ad25266ce7a3ae79e1a0f96

Meta回应Muse未授权读取私人消息:需用户手动开启三项权限

Meta公关副总裁Andy Stone和Meta Superintelligence Labs高管David Singleton回应Inc.专栏作家Jason Aten的指控,称AI agent Muse读取其Mac私人消息完全是opt-in。Singleton详细说明,启用Messages集成需要三步:用户必须在macOS系统设置中手动开启Full Disk Access、启用Messages连接器,并完全重启应用,即使存在bug也无法绕过。Aten则坚称当时Full Disk Access已经关闭,且Muse自称一直在同步设备通知;Singleton回应称AI当时混淆并给出了错误解释,同时指向Muse的安全架构和漏洞赏金计划。该争议正值Muse登上App Store榜首,但外界 skepticism 仍存,部分源于Meta在Cambridge Analytica等数据隐私诉讼中的历史。

来源:https://theaiinsider.tech/2026/10/02/meta-disputes-journalists-claim-that-muse-ai-agent-read-private-messages-without-consent/

开源校园Agent CourseRaptor拆解:31个工具、三端入口与本地凭证保护

开源项目CourseRaptor把课表、成绩、考试、通知、待办、知识库、文档生成和手机日历拆成可被Agent调用的工具,组织成十大能力线,当前默认可调用31个工具。项目版本0.3.0,采用ISC License,当前只适配南京工业大学,GitHub快照约20 Star。CourseRaptor提供终端TUI、本地Web UI、QQ官方机器人和无头CLI四种入口,但都调用同一个createRaptorAgent()装配出的ToolLoopAgent,入口层只负责输入输出,Agent层负责工具循环,学校适配层负责NJTECH协议。项目核心设计是让模型理解意图、选择工具并解释边界,而不是自行猜节次、拼接成绩口径或直接构造教务写请求。本地Web UI默认监听127.0.0.1:3210,可查看思考过程、工具调用和会话归档;skills/njtech-jwgl/提供不经过LLM对话的教务查询脚本,适合二次封装和定时任务。

来源:https://mp.weixin.qq.com/s?__biz=MzU2NzkxNDY0Ng==&mid=2247491133&idx=1&sn=7e4337fbf2b203547509825ebb5eb8ae

技术与洞察

两周41篇Jev论文涌出,医疗、Agent、6G等场景实测最高快20倍

Jev是9月15日发布的一类System One决策模型,不生成文字,只输出候选选项的概率。发布第一周,GitHub累计相关项目约两千,star事件超四万;两周内arXiv出现41篇Jev论文,10月1日一天就涌出8篇。在评测中,Jev在27个数据集上击败Qwen3.8-27B直接读数;医疗领域与GPT-6 Sol几乎战平(78.4% vs 78.2%),2823题仅花8美分;Agent场景中AndroidWorld成功率79%、执行时间省30%。行业落地方面,Jev比GPT-5.6 Luna快4.8倍、便宜3.8倍,6G决策延迟降低20%–60%。微软LLM2Jev论文证明通用LLM天生就是决策模型:冻结的Qwen3.5-4B在JevBench公开231题中答对188题,准确率81.4%,ECE仅0.057;微调则呈“规模决定收益”,0.6B小模型Banking77暴涨42.6个百分点,而4B强模型跑完一整个epoch后JevBench从81.4%跌到76.2%。复旦Chinese-Jev通用版准确率69.20%,反超闭源Jev的68.35%,ECE从11.45%压到3.78%,单条决策延迟14毫秒,比Jev API的284毫秒快20.3倍。

来源:https://mp.weixin.qq.com/s?__biz=Mzk0MTYzMzMxMA==&mid=2247512359&idx=1&sn=aff847902dc9dd4347138fc88c2d9fec

美国亚利桑那州法院因AI生成视频推翻过失杀人案判决,或为全美首例

Fast Company报道,美国亚利桑那州法院在一起过失杀人案中因采纳一段AI生成的视频作为证据或庭审材料,将原判推翻。该案或为美国法院首次因AI生成内容直接导致既有刑事判决被撤销的案例。此前,美国法院系统使用人工智能主要限于行政管理与法律检索等辅助性工作,并未直接进入定罪量刑环节。截至目前,法院尚未披露具体案号、被告信息及原判决量刑细节。

来源:https://www.fastcompany.com/91617423/ai-generated-video-got-arizona-manslaughter-sentence-tossed-likely-first-u-s-court?utm_source=postup&utm_medium=email&utm_campaign=artificial-intelligence&position=2&partner=newsletter&campaign_date=10032026

新方法LEGO-Anything将照片转为Blender代码,Agent自评几何精度仅如抛硬币

LEGO-Anything方法将单张照片转为可编辑的Blender代码以生成3D场景。在配套基准测试中,GPT-6 Astra以最高53%的重建准确率领先。但所有受测Agent的最大弱点是无法判断自身几何精度,表现仅如抛硬币。

来源:https://the-decoder.com/ai-agents-build-3d-scenes-from-photos-but-have-no-idea-if-they-got-it-right/

行业动态

a16z报告:美国VC上半年86%的钱投给AI,企业大模型落地率仅2%

a16z Growth团队发布最新一期State of Markets。2026年上半年,美国VC共向AI公司投入约3559亿美元,占同期4127亿美元投资总额的86%,而2025年这一比例为65.5%;从交易数量看,AI公司占美国VC交易笔数的43.2%,与2025年的43.3%基本持平。2026年上半年美国VC总投资额已超过4000亿美元,其中1亿美元以上的大额融资占全部投资金额的87.5%。Alphabet、Amazon、Meta、Microsoft和Oracle 2026年资本开支预计约7800亿美元,2025年为4160亿美元,2027年起五家公司年度CapEx合计可能超过1万亿美元。a16z指出,69%的S&P 500公司已有正式运行的AI项目,但能够量化业务影响的约30%,持续追踪明确指标的只有2%。OpenRouter上与Agent相关的Token使用量增长约14倍;Hebbia通过Cache复用把部分金融聊天Workload成本降低约10倍,Databricks用Router压低成本约35%,Elise AI通过Fine-tune小模型降低成本约60%。a16z接下来将重点看消费Agent、机器人、自动驾驶、AI4Bio、个人健康以及Coding之外更多企业应用。

来源:https://mp.weixin.qq.com/s?__biz=Mzg3NDkyMTQ5Mw==&mid=2247502150&idx=1&sn=b49da3a2db0f335dbfccfecb92e03769

NVIDIA DGX Spark推出64GB统一内存版,支持百亿参数模型本地部署

NVIDIA宣布DGX Spark将于本月推出64GB统一内存配置,由Acer、ASUS、Dell、Gigabyte、HP和MSI等制造商合作伙伴发售,预装DGX OS和NVIDIA AI软件栈。新SKU保留与128GB型号相同的GB10 Grace Blackwell Superchip、NVIDIA ConnectX-7网络和CUDA加速软件栈,支持最高1000亿参数模型及Agentic应用完全本地运行。两台64GB设备可通过NVIDIA Sync Cluster Assistant集群,无需额外设置;在NVIDIA的Qwen 3.8 27B测试中,集群性能相比单机最高提升1.7倍。平台开箱即支持NVIDIA Agent Toolkit、CUDA-X AI库、Nemotron开放模型以及Ollama、vLLM、PyTorch等运行时。Blender是首批支持该平台的主要创作者应用之一,将提供预构建可下载安装程序。

来源:https://blogs.nvidia.com/blog/local-ai-dgx-spark-64gb-sync/

Reddit将于2026年11月停RSS、2027年3月关公共API,收紧AI数据出口

Reddit宣布将于2026年11月13日结束RSS feeds支持,并将在2027年3月关闭公共API,以应对大规模抓取和自动化滥用。平台用户生成内容正通过AI授权交易成为重要收入来源,Reddit第二季度非广告收入同比增长24%至4300万美元。公共API关闭将影响依赖程序化访问Reddit对话的社交聆听产品、研究工具和AI助手,此后想用Reddit数据回答问题需签署商业协议。Reddit建议版主在截止日期前将警报工作流迁移到Discord Relay Devvit应用,并表示没有RSS的替代方案用于版主以外场景。平台还将限制Old Reddit访问,仅允许登录版主和过去六个月活跃用户访问;已批准的第三方应用和机器人开发者须在2027年1月12日前完成注册,否则失去API访问。

来源:https://theaiinsider.tech/2026/10/02/reddit-ends-rss-feeds-and-public-api-tightening-control-over-data-prized-by-ai-firms/

初创公司Satlyt获800万美元种子轮融资,要把AI模型搬到卫星上运行

总部位于Sunnyvale和内罗毕的初创公司Satlyt获得800万美元种子轮融资,由Houston的Non Sibi Ventures领投,用于构建让AI模型在卫星上运行并在太空共享计算工作负载的软件。联合创始人Rama Afullo曾在Google Cloud和SpaceX Starlink工作,其轨道计算内部提案曾遭两家公司拒绝;Satlyt不做航天器,而是做跨平台软件层,Afullo将其比喻为Android,SpaceX等则类似iPhone。今年早些时候,Satlyt已在Momentus航天器上运行Google DeepMind的Gemma模型,把机载错误传输数据量减少超过60%,每年可为每颗卫星节省数十万美元。其软件将于周四搭载SpaceX发射的TakeMe2Space卫星升空,服务NASA、空间监视初创Stellerian和TakeMe2Space。公司计划明年演示跨两颗卫星的共享云,并希望在本十年末覆盖20%的卫星。

来源:https://theaiinsider.tech/2026/10/02/satlyt-announces-8m-seed-to-run-ai-models-across-satellites-in-orbit/

评论

暂无评论。

登录后可发表评论。