先说几个判断:
第一,Beam 的核心不是“大”,而是“省”:5010 亿总参数里,每个 token 只激活 230 亿,约等于 4.6%。用 MoE(混合专家)把“体量”和“单次要算的算力”拆开,是它敢说对标更大模型的逻辑。
第二,官方给出的对标对象是智谱 GLM-5.2(总体可比)和千问 Qwen 3.8-Max(代码 / 智能体接近),但补了一句关键前提:比的是“用更少推理算力达到相近结果”,不是裸能力碾压。在原始能力上,官方自己点名 Kimi K3 等仍领先。
第三,它是 Apache 2.0 开放权重,但权重不是发布当天就放出,而是“本月内”连同技术报告、模型卡一起给,目前走候补名单加自托管。
第四,训练侧很重:RL 阶段在 1.05 万张 NVIDIA GB300 上跑四周、生成超 1 亿次 rollout。英伟达既是投资方,也是算力供给方,这层关系值得记一笔。
下面把这些点展开说一说。
一、事件描述
Reflection AI(据媒体报道是一家获英伟达投资的初创公司)推出首款开放权重大模型 Beam。据外媒报道于当地时间周一(2026 年 10 月 5 日)发布;官方博文标题是“Introducing Beam: Reflection’s 501B open-weight model”,正文未标注具体发布日期,只说明权重将在“本月内”放出。
下面用一张表理清官方已确认的事实:
| 事项 | 官方已确认内容 | 口径说明 |
|---|---|---|
| 发布主体 | Reflection AI | 媒体报道 + 官方 |
| 模型定位 | 501B 开放权重模型,面向编码 / 推理 / 智能体 | 官方博文 |
| 架构 | 稀疏 MoE,501B 总参 / 23B 激活 | 官方 |
| 预训练数据 | 23.8 万亿 token | 官方 |
| RL 投入 | 1.05 万张 GB300,4 周,1 亿 + rollout | 官方 |
| 上下文 | 有效 1M(RL 阶段用 256K) | 官方 |
| 许可证 | Apache 2.0(本月内放权重 + 报告 + 模型卡) | 官方 |
| 可用性 | 候补名单 + 自托管,正文未提 HuggingFace | 官方 |
| 对标 | 总体可比 GLM-5.2,代码 / 智能体接近 Qwen 3.8-Max | 官方 |
表:Beam 发布要点(依据 Reflection AI 官方博文整理)
二、501B 总参、23B 激活:MoE 把“大小”和“开销”拆开
Beam 是一个稀疏混合专家模型(sparse Mixture-of-Experts)。通俗地说,它内部塞了大量专家参数(总计 5010 亿),但面对每个输入的 token,路由机制只激活其中一小部分,实际参与计算的只有 230 亿。官方还提到它结合了交错局部与全局注意力、细粒度路由专家、受控残差流,以及多种负载均衡策略,让专家利用尽量均匀。
两种口径摆在一起看:
| 口径 | 数值 |
|---|---|
| 总参数 | 501B(约 5010 亿) |
| 每 token 激活参数 | 23B(约 230 亿) |
| 激活占比 | 约 4.6% |
表:Beam 参数的两种口径(官方)
说明白点:比较 MoE 模型时,该看“激活参数”而不是“总参数”。Beam 的 23B 激活,意味着单次推理的算力消耗更接近一个 230 亿参数的稠密模型,而不是 5010 亿。这正是它声称“用 3–4 倍更少推理算力,达到与 GLM-5.2 相近分数”的底气所在。
三、它到底和谁比、比什么
官方原话是:Beam “advances the Western open-weight frontier and is competitive with larger open models like GLM 5.2 and approaching Qwen 3.8-Max on coding and agentic tasks”(推进西方开放权重前沿,与 GLM-5.2 这类更大的开放模型可比,并在代码和智能体任务上接近 Qwen 3.8-Max)。
这句话要拆成两层读。第一层,比 GLM-5.2 是“总体可比”,而且是在少 3–4 倍推理算力下做到;第二层,比 Qwen 3.8-Max 是“代码与智能体接近”,但 Qwen 属于 2T+ 参数家族,原始能力仍领先,Beam 的优势在推理时效率。官方还明确说,在原始能力上 Kimi K3 等模型仍然领先。
几个基准的对比(取自官方表格):
| 基准 | Beam | GLM-5.2 | Qwen 3.8-Max |
|---|---|---|---|
| DeepSWE v1.1 | 44.4 | 44.0 | 51.0 |
| SWE Bench Pro v1 | 65.5 | 62.1 | 67.7 |
| Terminal Bench v2.1 | 80.1 | 81.0 | 86.6 |
| AIME 2026 | 97.8 | 99.2 | — |
| GPQA Diamond | 90.5 | 91.2 | — |
| HLE(无工具) | 36.2 | 40.5 | — |
表:Beam 与对标模型基准分数(官方博文;“—”表示官方未列出该对比项)
把其中一项画成条形会更直观:
图:SWE Bench Pro v1 分数对比(数据来源:Reflection AI 官方博文,分数越高越好;条形按真实数值线性映射)
Beam ██████████████████████████████████████ 65.5
GLM-5.2 █████████████████████████████████████ 62.1
Qwen 3.8-Max ████████████████████████████████████████ 67.7
说明:条形长度按各模型 SWE Bench Pro v1 分数真实数值线性缩放。Beam(65.5)略高于 GLM-5.2(62.1),略低于 Qwen 3.8-Max(67.7)。这一项上三者差距都不大,更能体现 Beam 的卖点不是“分最高”,而是“用 23B 激活参数跑到这个区间”。具体基准分数会随版本与评测设定变动,请以官方最新模型卡为准。
四、训练侧:很重的 RL
官方披露,RL(强化学习)阶段在 1.05 万张 NVIDIA GB300 GPU 上跑了四周,生成超过 1 亿次 rollout,RL 阶段最大上下文为 256K;预训练则用了 23.8 万亿 token。
值得记一笔的是英伟达的双重角色:既是 Reflection AI 的投资方,又提供了这次训练的主力算力(GB300)。对一家想用“高效 MoE + 重度 RL”去追前沿的初创来说,这种“资本 + 算力”的绑定并不罕见,但摆在明面上时,关系就清楚了。
五、开放权重,但“本月内”才放
官方明确:权重将以 Apache 2.0 许可证放出,连同技术报告、模型卡、开发工件,以及一套用于运行、评估、微调的“full stack”。目前模型向“选定用户”开放早期版本,走候补名单(platform.reflection.ai),并支持自托管。
注意两点:一是“开放权重”不等于“今天就能下载”——公告时点权重尚未放出,只承诺本月内;二是官方正文没点名 HuggingFace 作为分发渠道,而是说会有一批分发合作伙伴和开源库集成。想自己部署的人,得等权重和那套栈真正落地。
六、结语
Beam 是 Reflection AI(据媒体报道获英伟达投资)推出的首款开放权重大模型:稀疏 MoE,5010 亿总参、每 token 激活 230 亿,面向编码、推理与智能体,有效上下文 1M,将以 Apache 2.0 在本月内放出权重。官方把它定位为“西方开放权重前沿”的代表,声称总体可比智谱 GLM-5.2、在代码与智能体任务上接近千问 Qwen 3.8-Max,且用 3–4 倍更少的推理算力达到相近结果;在原始能力上,官方承认 Kimi K3 等仍领先。
值得冷静看待的有三处:一是“对标中国模型”是效率维度的对标,不是裸能力碾压,几个基准里 Beam 与 GLM-5.2 互有胜负、较 Qwen 3.8-Max 仍稍逊;二是权重承诺“本月内”放出而非已就绪,当前仅候补加自托管路线;三是训练重度依赖英伟达 GB300 算力,投资方与算力方的身份重合,是理解这家初创公司路径时绕不开的背景。对使用者来说,真正要等的,是权重落地后第三方能否独立复现这些分数——那比发布当天的新闻稿更说明问题。