【摘要】
第一,OpenRouter9月7日至13日周度钱包份额显示,OpenAI模型合计美元支出超过Anthropic,为2024年2月26日以来首次;Peter Walker将转折主要归于9月4日上线的GPT-6 Astra,但同期Luna降价带来的海量token也放大了OpenAI整体账单。
第二,Astra单模型占OpenAI与Anthropic合计支出的19%,高于Claude Opus 5的16%;Sol与Luna各10%,Sonnet 5为7%,Fable 5.1为6%。这个排序说明反超不是单纯“便宜模型冲量”,而是旗舰高价能力先转化付费。
第三,OpenRouter只覆盖通过它路由的API流量,不含ChatGPT/Claude直连订阅、企业年框和私有部署;它适合看开发者按需调用趋势,不适合直接推算两家公司总营收。
第四,对采购方的判断应回归单位任务成本:长程Agent、软件工程、浏览器操作可用Astra类旗舰做小流量验证;高并发分类、摘要、轻量对话用Luna类低价模型压成本;Claude仍保留代码评审、长上下文和合规要求高的工作负载,不宜因单周支出反转全量替换。
一、数据本身:钱包份额和token份额不是一回事
Peter Walker在X发布的是weekly wallet share,分母只取OpenRouter上OpenAI与Anthropic模型的美元支出,不取全平台所有模型,也不取token量。9月7日至13日核心数:
| 模型 | 在OpenAI+Anthropic合计支出占比 | 定位与价格参照 |
|---|---|---|
| GPT-6 Astra | 19% | 旗舰长程Agent,OpenRouter标价输入10美元/百万token、输出50美元/百万token,1.1M上下文 |
| Claude Opus 5 | 16% | 高端推理与代码,OpenRouter/Anthropic标价约输入5美元、输出25美元档,部分材料列高价档不同 |
| GPT-5.6 Sol | 10% | 中高价推理与综合任务 |
| GPT-5.6 Luna | 10% | 低价高量,7月30日降价后输入0.20美元、输出1.20美元/百万token |
| Claude Sonnet 5 | 7% | 中价代码与通用工作流 |
| Claude Fable 5.1 | 6% | 代码Agent与长程工作流,标价10/50美元档 |
读这张表要先去掉两个错觉。Astra占比高,部分来自单价高;Luna占比只有10%却可能处理远超Astra的token量,因为单价差50倍输入、约42倍输出。因此“OpenAI花钱超过Anthropic”和“OpenAI token超过Anthropic”是两个问题:前者看预算分配,后者看调用量;本次破线的是前者。
Anthropic过去两年半在OpenRouter保持支出领先,底层是Claude在代码、Agent、长上下文开发者工作里的高粘性。开发者愿意为稳定代码评审、长文档、工具调用付溢价,使Anthropic即使token份额不一定最高,也能拿住钱包份额。本次被反超,说明OpenAI用“贵旗舰+便宜量大”两端同时切,而不只靠单一价格战。
二、Astra为什么能在上线一周就转化付费
Astra 9月4日在OpenRouter列位,9月7日至13日是首个完整周。OpenRouter页给的定位是高级分析、软件工程、深度研究、科学工作、文档生成,以及浏览器/计算机长程Agent,上下文1.05M—1.1M,标准牌价10/50,Flex低至5/25,Fast到20/100。
它切入的是开发者最肯花钱的几类任务:
软件工程端到端。代码重构、测试生成、Issue定位、PR评审、仓库级检索;与Codex类执行环境配合可做长程修复。
浏览器与计算机使用。填表、查后台、跑CRM、整理表格、跨系统核对;这类任务原来人工成本高,模型若稳定,企业愿意按旗舰价试。
研究与文档。长PDF、专利、合规、财报、实验数据;1M级上下文减少分块,但超长提示缓存与分层摘要仍要计算成本。
安全与专业工作。OpenAI材料把Astra列入Preparedness网络安全Critical档,OSWorld 2.0、Terminal-Bench、FrontierMath等外部材料可作能力参照,但不同测试版本、工具权限、是否人工介入差异很大,不能直接等同于生产准确率。
上线首周高支出有三重原因:新模型评测流量、存量业务小流量迁移、A/B对比Claude/其他旗舰。Walker数据能证明“首周已产生计费”,不能证明“八周后仍保留同样份额”。企业看这类反转,重点不是发布会当周,而是随后4到8周留存、失败率、人工接手率和单任务总成本。
三、Luna是隐藏变量:低价模型决定总账单底盘
Astra吸引 headline,Luna决定OpenAI整体支出能否超过Anthropic。Luna 7月9日发布、7月30日降价80%,最终输入0.20、输出1.20美元/百万token,上下文约1.05M,带推理控制和工具调用。
适用场景很明确:
分类、意图识别、日志摘要;
客服初筛、工单归类、知识库问答;
轻量Agent子步骤,例如格式化、抽取、校验;
高并发聊天、批量重写、规则化数据清洗。
这类任务token量巨大但单价极低。若企业把原来用中价Sonnet/Opus/Fable做的一部分轻量调用迁到Luna,token份额会快速上升,支出份额未必同比例上升;但Luna与Astra同属OpenAI账号、同套路由和预算体系,整体账单会被两端共同抬升。OpenAI这套组合相当于用Luna吃“量”、Astra吃“贵”,对Anthropic形成上下夹击:中价Claude若既被低价模型抢轻活、又被旗舰模型抢重活,钱包份额就会双向承压。
四、Anthropic侧不能只看成“被打垮”
单周支出被反超不等于Anthropic基本面恶化。几个边界要写清:
OpenRouter只是路由渠道。Claude直连API、Amazon Bedrock、Google Vertex、企业订阅、Claude Code自有流量都不完全等同OpenRouter钱包份额;Claude Code等应用即使走第三方路由,也可能调用非Anthropic模型,模型与工具外壳已经解耦。
Anthropic高端定位仍在。Opus 5占16%、Fable 5.1占6%,在代码Agent和长程工作流中仍有付费基本盘;若企业重视系统提示稳定性、长文档、代码评审可解释性,Claude未必因一周支出数据被替换。
价格与额度策略会影响后续。部分材料称9月14日起Claude Code标准周上限提高25%,但临时加码到期,实际相对此前减少约17%;该调整晚于9月7日至13日反超周,不能算作当周反超原因,可能影响其后数周路由选择。重度Agent用户若遇到额度、并发、排队限制,会把手边可迁移负载试投别家,但核心代码库工作是否迁移还看质量与合规。
因此更稳妥的结论是:OpenRouter数据标志OpenAI在“开发者按需API钱包”上重回对Anthropic领先,但不证明Anthropic收入、企业合约或整体开发者心智被反超。
五、对采购和成本治理的落地建议
按任务分层而不是按品牌全量切换:
长程Agent与高价值工程。Astra、Opus 5、Fable 5.1做小流量试点;用同一批真实工单比首次解决率、人工接手率、平均工具调用次数、因权限错误导致的回滚数。按“任务成功且无需人工重做”的成本计费,不按token单价计费。
代码评审与日常开发。Sonnet 5、Fable 5.1、Sol混用;设置仓库级规则,敏感分支只允许特定模型,生成代码必须人工review和单元测试。
高并发轻量NLP。Luna及同价位模型承接分类、摘要、抽取、初稿;设置最大上下文、最大输出、敏感词回退和人工抽检。
跨App与浏览器执行。Astra类计算机使用只给沙箱、只读账号、白名单网址、操作录屏;支付、凭证、删除、对外发送默认人工确认。
成本报表要分三列:token量、美元支出、成功任务数。只看token会低估Astra,只看美元会低估Luna;只看单价会忽略缓存命中、重试、工具调用和人工补救。OpenRouter可提供多供应商路由,企业自制中台应保留Balanced/Nitro/Exacto类策略,并按业务线分摊,不把所有模型预算混成一个总数。
六、结论
OpenAI在OpenRouter周支出反超Anthropic,是Astra旗舰高价转化与Luna低价放量共同作用的结果,也是2026年开发者API从“选最聪明模型”转向“按任务买执行力”的缩影。Astra首周19%合计支出占比说明新旗舰具备付费吸引力,但首周含发布期评测和迁移试探,不能单独推断长期格局;Anthropic在代码、长上下文、合规敏感工作里仍有Opus和Fable基本盘,Claude Code等应用流量也不等于Anthropic模型收入。
对企业来说,这次反超的真正价值不是站队,而是重算模型组合:重活给可审计旗舰,轻活给低价大模型,所有跨系统执行给沙箱和人工闸。OpenRouter钱包份额适合作为路由渠道趋势指标,不适合替代全量营收、直连API和企业合同判断;后续看10月至11月留存、看Astra高价任务的成功率、看Luna低价任务的人工补救率,比看单周谁第一更有意义。