Claude Code 烧 890 万 token 才考 67 分,它 509 万就考了 73 分
先说一笔账。
阶跃星辰自己搭了个长程任务基准,叫 Multi-Frame,150 道题。同一批题,Claude Code 平均每道烧掉约 890 万 token,通过率 67.3%。另一个选手只烧了 509 万 token,通过率 73.3%。
烧的钱少了四成,分数还多 6 个百分点。这个选手叫 Step Code——阶跃星辰 9 月 22 日刚开源的终端编程 Agent,MIT 协议,代码全量公开。
很多文章在拿它的跑分跟 Claude Code 比,其实没比到点子上。真正值得看的,是它把「token 经济学」这三个字,直接写进了编程 Agent 的竞争规则里。
它到底是个啥
先厘清一个容易搞混的概念:Step Code 不是模型,是 Harness——智能体的骨架。它跑在终端里,负责读代码、改代码、跑测试、交付,模型通过订阅(Step Plan)或 API key 接进来。
打个比方:模型是发动机,Harness 是整车。发动机一样聪明,但油耗能差一倍——差的从来不是发动机,是变速箱和底盘怎么调。
我写稿子前从 GitHub API 实时拉了一次数据:588 个 Star、52 个 Fork、47 个 open issue,8 位贡献者,主语言 TypeScript。有意思的是,仓库的创建时间其实是 6 月 1 日,代码是 9 月 22 日才公开推送的。也就是说,阶跃在仓库里闷头发育了三个多月,才把它放出来见人。
跑分背后:那 21 分是 harness 挣的
官方口径,Terminal-Bench 2.1 共 89 题,Step Code 过了 72 题,通过率 80.9%,并列第一。同场的 Codex 是 78.7%,Claude Code 77.5%,Kimi Code 74.2%。
但有个细节,官方通稿没展开说,反而最说明问题:Step 家自己的模型 Step 3.7 Flash,裸跑 Terminal-Bench 2.1 只有 59.5 分(这是 HuggingFace 模型卡上白纸黑字写的)。
59.5 到 80.9,中间这 20 多分的差距,就是 harness 的价值。当然这不算严格对照实验——Step Code 默认挂的未必是 Flash 这一个模型——但它至少说明一件事:光换更强的模型,不是唯一的涨价理由。把任务拆开、把上下文管好,同样的模型能考出高得多的分。
省 token 的原理,其实不玄
省 token 不是靠砍能力换来的,官方说法就一句:长任务拆给并行子代理,各自隔离上下文,冗余信息不进主对话。
翻译成人话:Claude Code 那种「一条主线从头跑到尾」的搞法,上下文里会积累大量垃圾——前 20 轮读过的文件、已经跑完的测试输出、早就改掉的旧代码,全堆在对话里,每推进一步都重新给模型喂一遍。钱是这么烧掉的。
Step Code 的做法是把长任务切成小块,扔给一个个子代理分别处理,各自只带自己那摊事的上下文,汇总时只回传结论。主对话里永远只有精炼后的信息。同样一道题,账单自然就瘦下来了。
对 Claude Code 用户:搬家成本几乎为零
这是我从 README 原文里挖到的,比跑分实用得多。
首次启动,Step Code 会自动导入 Claude Code 和 Codex 的 MCP 配置——源文件一个字不动,密钥不内联。大部分 Claude Code 插件开箱即用,/plugin 统一管理。项目里已有的 CLAUDE.md 会被原样识别,/init 还能帮你生成一份 AGENTS.md。
换句话说,你从 Claude Code 切过去,配置基本不用重写。这个兼容策略的意图很清楚:不抢你的习惯,只抢你的账单。
安装也只要一行:
curl -fsSL https://static-openapi.stepfun.com/stepcode/install.sh | bash
装完 step login 登录,进项目目录敲 step 就进交互界面,也可以无头一把梭:
step -p "这个项目的技术栈是什么?每个目录负责什么?怎么在本地跑起来?"
另外两个内置能力值得点名:StepPage 一条命令把本地页面发布成带版本管理和回滚的静态网站;/goal 托管长任务自主推进,/cron 定时执行。
但软肋也很直白
夸完了,该泼冷水了。
第一,它只绑 Step 模型。 README 的 provider 列表里就 Step 一家,它是 Step 模型的专属座驾,暂时接不了别家模型。这意味着它的天花板,绑死在 Step 模型的口碑上。Step 5 站住了,这是护城河;站不住,用户会用脚投票,回到模型中立的 Harness(比如 OpenCode)去。这条路没有回头箭。
第二,Windows 还是二等公民。 PowerShell 安装处于 beta 阶段,官方自己都建议去 WSL 里装。社区里踩坑的集中在 Windows:自定义 Git 目录下误选 WSL Bash、权限配置改了不生效。
第三,没有 GUI。 47 个 open issue 里,评论最多的不是 bug,是那句「什么时候出桌面版」。想要图形界面的,还得再等等。
我的判断
判断一:编程 Agent 正式进入 token 经济学时代。 Claude Code 已经把「能力上限」这条赛道跑到头了,下半场卷的是单位成本。我可以下一个可证伪的预测:半年内,主流编程 CLI 的发布通稿,都会把「单任务 token 消耗」列成核心指标,就像手机厂卷续航一样。
判断二:Step Code 是 Step 5 开源的先头部队。 阶跃 9 月 20 日刚发了旗舰基模 Step 5 Preview——6000 亿总参数、270 亿激活的稀疏 MoE,杀进全球开源前三,官宣 10 月 15 日正式开源。Step Code 比模型早开源 25 天,先把「车」铺到开发者手里,等「发动机」到位直接上车。到那天,Step Code 大概率会迎来一波集中导流。
判断三:现在 588 个 Star 是时间差,不是质量差。 开源 9 天能到这个数,日均 60+。等 10 月中旬模型开源联动,补涨几乎是必然的。现在上车的,是早期共建者,不是围观者。
相关链接:
- Step Code GitHub:https://github.com/stepfun-ai/Step-Code
- Step Code 官方文档:https://platform.stepfun.ai/docs/en/step-code
- Step 平台(订阅/API):https://platform.stepfun.com
暂无评论。