先说几个判断:
第一,Rho-1 想做的不是“又强一点”,而是把今天常见的多模态管线“坍缩”掉:不再有“规划模型指挥、再去调用视觉 / 视频 / 动作专家”的交接,文本、图像、视频、机器人动作全部变成同一个上下文里的 token。
第二,它用 320 张 H100、约 3 个月从零训出来——Reka 自己说这只是现代前沿模型算力的“一小部分”。这个量级本身,比参数更像是这个故事的看点。
第三,演示很顺:一句话的对话里连续完成“画灯塔 → 框选 → 动起来 → 改成雪景 → 问答”。但官方明列的限制也很硬:原生视频只有 672×384、长视频会结构性漂移、跨帧定位不稳、编辑脆弱,机器人只在仿真里验证过。
第四,它不是产品,是研究预览:没有公开定价、没有下载,只向具身机器人和交互仿真团队开放联系合作。看它,该看方向,别看“能不能今天就用”。
下面把这些点展开说一说。
一、事件描述
2026 年 10 月 5 日,Reka Labs 放出 Rho-1 的研究预览(research preview)。官方原话:这是“我们的 19B 全模态推理模型,从零训练”。它要解决的问题,是当下多数 AI 系统的形态——一堆串起来的管线。
| 事项 | 官方已确认内容 | 口径说明 |
|---|---|---|
| 发布与状态 | 2026-10-05,研究预览 | 官方标注 |
| 规模与定位 | 19B,omni-reasoning,从零训练 | 官方 |
| 统一方式 | 文本 / 视觉 / 机器人动作统一为同一上下文里的 token | 官方 |
| 架构 | 每个 transformer block 分两条专家流,共享注意力与状态 | 官方 |
| 训练算力 | 320 张 H100,约 3 个月,从零 | 官方 |
| 视频速度 | 基础版中位 0.79× 实时,首帧约 6 秒 | 官方 |
| 蒸馏 | 去噪 99 步压到 8 步 | 官方 |
| 原生视频上限 | 672×384 | 官方 |
| 机器人 | 仅 LIBERO 仿真验证,无真实机器人 | 官方 |
| 获取 | 研究预览,无公开定价 / 下载,联系合作 | 官方 |
表:Reka Rho-1 发布要点(依据 Reka 官方研究页整理)
二、“坍缩”掉的是什么
官方概括得很直接:今天多数系统是“agentic pipelines”——一个规划模型决定要做什么,再去调用视觉、视频、动作等专家。Rho-1 的做法是“collapses that stack”:把文本、视觉和机器人动作,都变成同一个上下文窗口里的 token。
具体怎么编码,官方分了两类:
| token 类型 | 编码内容 |
|---|---|
| 离散 token | 文本、符号推理、高层指令 |
| 连续 token | 图像潜变量、视频帧、机器人动作、本体感知 |
表:Rho-1 的两种 token 口径(官方)
关键在于,机器人动作和未来视频帧,都是从“同一个潜状态”解码出来的。于是策略可以“在脑子里先模拟接下来几秒”,动作也像文本和像素一样,被当作原生连续 token 处理。这跟“模型吐一段指令、外部去执行”的管线,是两种哲学。
三、两条专家流,但共享一个 KV cache
架构上,Rho-1 在每个 transformer block 里把计算拆成两条专家权重流:
- 理解流(understanding stream):负责语言和视觉解析。
- 生成流(generation stream):把潜变量去噪成图像和视频。
两者不是各干各的。官方说,两条流的 token 互相注意,跑在同一个 KV cache 上;用户指令、思维链痕迹、之前的视频帧、发出的运动策略,全都累积在同一个上下文里。需要时,理解流发出一个离散的“切换 token”,生成流立刻从累积状态渲染——官方称之为“零延迟交接”(zero-latency handoffs)。
这个设计的卖点,正是消除管线里“等上一个专家返回、再交给下一个”的停顿。
四、320 张 H100、3 个月:这个量级本身值得看
Reka 在博文里专门强调:帖子里所有结果,都来自一个“仅用 320 张 H100、训练 3 个月、从零训出来”的 checkpoint,并直言这只是现代前沿语言与视频模型背后算力“的一小部分”。
这是个有意为之的对照。当行业习惯用万卡、数月甚至更久去堆前沿模型时,Rho-1 想证明的是:用相对克制的算力,也能把“统一多模态”这件事跑通一个可演示的版本。代价也很清楚——后面那些限制,官方自己归因到“训练算力与数据规模偏小”。
五、演示与速度:一次对话里的闭环
官方记录了一段连续 5 轮、单一网络、状态只增不减的对话:
- 画:用户让画一座红白条纹灯塔的低空俯视图,模型生成 image:0。
- 框:用户说“给灯塔画个框”,模型直接发坐标 token 框选。
- 动:用户让“无人机缓缓飞向灯塔”,模型基于原图潜表示生成 video:0。
- 改:用户让“改成暴风雪”,生成 video:1,保持相机运动和物体一致。
- 问:用户问“两段视频哪里变了”,模型读潜状态差异作答。
速度数据上,基础版视频生成中位 0.79× 实时、首帧约 6 秒;蒸馏版把去噪从 99 步压到 8 步,几乎不损质量,把一个 5.3 秒的片段在约 1 秒内返回,官方称比它测过的任何视频模型都快。
和“多智能体管线”比首片段延迟,官方给的对照是:
图:首片段延迟对照(数据来源:Reka 官方研究页;条形按真实数值线性映射,单位秒,越短越好)
多智能体管线 ████████████████ 13.8
Rho-1 ████████ 7.0
说明:条形长度按各方案首片段(first chunk)延迟真实数值线性缩放。Rho-1 的 7.0 秒约为多智能体管线 13.8 秒的一半,差距主要来自省去了管线里的模型间交接。该对照来自官方图示,实际数值会随任务与部署变动。
六、能力边界:哪些还不行
官方把限制摊开讲,这反而是最该被认真读的部分:
| 限制项 | 官方描述 |
|---|---|
| 原生视频分辨率 | 目前封顶 672×384 |
| 长程漂移 | 长 rollout 先发生结构性退化(如房间布局错乱),再发生视觉退化 |
| 跨时间定位 | 静态图上的检测与坐标定位可靠,跨视频帧尚不稳 |
| 编辑稳定性 | 定向视觉编辑仍早期,跨多样 prompt 的一致性脆弱 |
| 机器人 | 仅在 LIBERO 仿真任务验证,未上真实机器人 |
表:Rho-1 官方列出的能力边界(依据研究页 Limitations 章节)
尤其最后一条,机器人部分展示的是一个 LIBERO 仿真任务(7 个动作通道、腕部视角等),没有任何真实机器人部署。Reka 还提到用配对的逆动力学模型、拿网络视频做预训练来超越遥操作日志,但本次验证仍停留在仿真。
七、它不是产品,是研究预览
Rho-1 目前是 research preview,官方页面没有公开定价、没有下载链接、没有普遍开放接口。合作通道写得很明确:如果你在做具身机器人、交互仿真环境或闭环视觉—动作系统,想大规模部署优化的全模态架构,可以发邮件到 contact@reka.ai 谈合作。
换句话说,它面向的是“能接住这种架构的团队”,而不是普通开发者自助调用。看它的正确姿势,是把它当作“统一多模态”这条路线的早期路标,而不是一个今天就能替换管线的工具。
八、结语
Rho-1 是 Reka 在 2026 年 10 月 5 日放出的研究预览:一个从零训练的 19B 全模态推理模型,把文本、图像、视频生成和机器人动作统一成同一上下文里的 token,用两条共享注意力的专家流(理解 + 生成)替代“规划调用专家”的管线,训练仅用 320 张 H100、约 3 个月。演示里它能在一句对话里连续完成画灯塔、框选、动画、改雪景与问答;官方也坦白它的边界:原生视频仅 672×384、长视频会结构性漂移、跨帧定位与编辑仍脆弱、机器人只在 LIBERO 仿真验证。
值得冷静看待的有三处:一是“坍缩多模态栈”是架构方向而非成熟产品,所有亮眼演示都建立在相对克制的算力上,限制同样源于此;二是机器人能力距离真实部署还有仿真到现实的鸿沟;三是它不公开、不售卖,只找特定团队合作。对行业来说,Rho-1 真正有价值的,不是“又一个能画能动的模型”,而是它用很小的代价,把“一个模型管完看、想、做”这件事从概念往前推了一步——这一步能走多远,要看后续算力和数据能不能跟上。