📄

Reflection AI Beam 发布:501B 参数只激活 23B 的开放权重模型

2026-10-06 10:18 👁 30 阅读

🏷️ 标签

https://reflection.ai/blog/introducing-beam

先说几个判断:

第一,Beam 的核心不是“大”,而是“省”:5010 亿总参数里,每个 token 只激活 230 亿,约等于 4.6%。用 MoE(混合专家)把“体量”和“单次要算的算力”拆开,是它敢说对标更大模型的逻辑。

第二,官方给出的对标对象是智谱 GLM-5.2(总体可比)和千问 Qwen 3.8-Max(代码 / 智能体接近),但补了一句关键前提:比的是“用更少推理算力达到相近结果”,不是裸能力碾压。在原始能力上,官方自己点名 Kimi K3 等仍领先。

第三,它是 Apache 2.0 开放权重,但权重不是发布当天就放出,而是“本月内”连同技术报告、模型卡一起给,目前走候补名单加自托管。

第四,训练侧很重:RL 阶段在 1.05 万张 NVIDIA GB300 上跑四周、生成超 1 亿次 rollout。英伟达既是投资方,也是算力供给方,这层关系值得记一笔。

下面把这些点展开说一说。

一、事件描述

Reflection AI(据媒体报道是一家获英伟达投资的初创公司)推出首款开放权重大模型 Beam。据外媒报道于当地时间周一(2026 年 10 月 5 日)发布;官方博文标题是“Introducing Beam: Reflection’s 501B open-weight model”,正文未标注具体发布日期,只说明权重将在“本月内”放出。

下面用一张表理清官方已确认的事实:

事项 官方已确认内容 口径说明
发布主体 Reflection AI 媒体报道 + 官方
模型定位 501B 开放权重模型,面向编码 / 推理 / 智能体 官方博文
架构 稀疏 MoE,501B 总参 / 23B 激活 官方
预训练数据 23.8 万亿 token 官方
RL 投入 1.05 万张 GB300,4 周,1 亿 + rollout 官方
上下文 有效 1M(RL 阶段用 256K) 官方
许可证 Apache 2.0(本月内放权重 + 报告 + 模型卡) 官方
可用性 候补名单 + 自托管,正文未提 HuggingFace 官方
对标 总体可比 GLM-5.2,代码 / 智能体接近 Qwen 3.8-Max 官方

表:Beam 发布要点(依据 Reflection AI 官方博文整理)

二、501B 总参、23B 激活:MoE 把“大小”和“开销”拆开

Beam 是一个稀疏混合专家模型(sparse Mixture-of-Experts)。通俗地说,它内部塞了大量专家参数(总计 5010 亿),但面对每个输入的 token,路由机制只激活其中一小部分,实际参与计算的只有 230 亿。官方还提到它结合了交错局部与全局注意力、细粒度路由专家、受控残差流,以及多种负载均衡策略,让专家利用尽量均匀。

两种口径摆在一起看:

口径 数值
总参数 501B(约 5010 亿)
每 token 激活参数 23B(约 230 亿)
激活占比 约 4.6%

表:Beam 参数的两种口径(官方)

说明白点:比较 MoE 模型时,该看“激活参数”而不是“总参数”。Beam 的 23B 激活,意味着单次推理的算力消耗更接近一个 230 亿参数的稠密模型,而不是 5010 亿。这正是它声称“用 3–4 倍更少推理算力,达到与 GLM-5.2 相近分数”的底气所在。

三、它到底和谁比、比什么

官方原话是:Beam “advances the Western open-weight frontier and is competitive with larger open models like GLM 5.2 and approaching Qwen 3.8-Max on coding and agentic tasks”(推进西方开放权重前沿,与 GLM-5.2 这类更大的开放模型可比,并在代码和智能体任务上接近 Qwen 3.8-Max)。

这句话要拆成两层读。第一层,比 GLM-5.2 是“总体可比”,而且是在少 3–4 倍推理算力下做到;第二层,比 Qwen 3.8-Max 是“代码与智能体接近”,但 Qwen 属于 2T+ 参数家族,原始能力仍领先,Beam 的优势在推理时效率。官方还明确说,在原始能力上 Kimi K3 等模型仍然领先。

几个基准的对比(取自官方表格):

基准 Beam GLM-5.2 Qwen 3.8-Max
DeepSWE v1.1 44.4 44.0 51.0
SWE Bench Pro v1 65.5 62.1 67.7
Terminal Bench v2.1 80.1 81.0 86.6
AIME 2026 97.8 99.2 —
GPQA Diamond 90.5 91.2 —
HLE(无工具) 36.2 40.5 —

表:Beam 与对标模型基准分数(官方博文;“—”表示官方未列出该对比项)

把其中一项画成条形会更直观:

图:SWE Bench Pro v1 分数对比(数据来源:Reflection AI 官方博文,分数越高越好;条形按真实数值线性映射)

Beam           ██████████████████████████████████████           65.5
GLM-5.2        █████████████████████████████████████             62.1
Qwen 3.8-Max   ████████████████████████████████████████         67.7

说明:条形长度按各模型 SWE Bench Pro v1 分数真实数值线性缩放。Beam(65.5)略高于 GLM-5.2(62.1),略低于 Qwen 3.8-Max(67.7)。这一项上三者差距都不大,更能体现 Beam 的卖点不是“分最高”,而是“用 23B 激活参数跑到这个区间”。具体基准分数会随版本与评测设定变动,请以官方最新模型卡为准。

四、训练侧:很重的 RL

官方披露,RL(强化学习)阶段在 1.05 万张 NVIDIA GB300 GPU 上跑了四周,生成超过 1 亿次 rollout,RL 阶段最大上下文为 256K;预训练则用了 23.8 万亿 token。

值得记一笔的是英伟达的双重角色:既是 Reflection AI 的投资方,又提供了这次训练的主力算力(GB300)。对一家想用“高效 MoE + 重度 RL”去追前沿的初创来说,这种“资本 + 算力”的绑定并不罕见,但摆在明面上时,关系就清楚了。

五、开放权重,但“本月内”才放

官方明确:权重将以 Apache 2.0 许可证放出,连同技术报告、模型卡、开发工件,以及一套用于运行、评估、微调的“full stack”。目前模型向“选定用户”开放早期版本,走候补名单(platform.reflection.ai),并支持自托管。

注意两点:一是“开放权重”不等于“今天就能下载”——公告时点权重尚未放出,只承诺本月内;二是官方正文没点名 HuggingFace 作为分发渠道,而是说会有一批分发合作伙伴和开源库集成。想自己部署的人,得等权重和那套栈真正落地。

六、结语

Beam 是 Reflection AI(据媒体报道获英伟达投资)推出的首款开放权重大模型:稀疏 MoE,5010 亿总参、每 token 激活 230 亿,面向编码、推理与智能体,有效上下文 1M,将以 Apache 2.0 在本月内放出权重。官方把它定位为“西方开放权重前沿”的代表,声称总体可比智谱 GLM-5.2、在代码与智能体任务上接近千问 Qwen 3.8-Max,且用 3–4 倍更少的推理算力达到相近结果;在原始能力上,官方承认 Kimi K3 等仍领先。

值得冷静看待的有三处:一是“对标中国模型”是效率维度的对标,不是裸能力碾压,几个基准里 Beam 与 GLM-5.2 互有胜负、较 Qwen 3.8-Max 仍稍逊;二是权重承诺“本月内”放出而非已就绪,当前仅候补加自托管路线;三是训练重度依赖英伟达 GB300 算力,投资方与算力方的身份重合,是理解这家初创公司路径时绕不开的背景。对使用者来说,真正要等的,是权重落地后第三方能否独立复现这些分数——那比发布当天的新闻稿更说明问题。