📄

Reka Rho-1 研究预览:把文本、图像、视频和机器人动作塞进同一个上下文

2026-10-07 08:54 👁 16 阅读

🏷️ 标签

https://reka.ai/labs/research/rho-1-collapsing-the-multimodal-stack

先说几个判断:

第一,Rho-1 想做的不是“又强一点”,而是把今天常见的多模态管线“坍缩”掉:不再有“规划模型指挥、再去调用视觉 / 视频 / 动作专家”的交接,文本、图像、视频、机器人动作全部变成同一个上下文里的 token。

第二,它用 320 张 H100、约 3 个月从零训出来——Reka 自己说这只是现代前沿模型算力的“一小部分”。这个量级本身,比参数更像是这个故事的看点。

第三,演示很顺:一句话的对话里连续完成“画灯塔 → 框选 → 动起来 → 改成雪景 → 问答”。但官方明列的限制也很硬:原生视频只有 672×384、长视频会结构性漂移、跨帧定位不稳、编辑脆弱,机器人只在仿真里验证过。

第四,它不是产品,是研究预览:没有公开定价、没有下载,只向具身机器人和交互仿真团队开放联系合作。看它,该看方向,别看“能不能今天就用”。

下面把这些点展开说一说。

一、事件描述

2026 年 10 月 5 日,Reka Labs 放出 Rho-1 的研究预览(research preview)。官方原话:这是“我们的 19B 全模态推理模型,从零训练”。它要解决的问题,是当下多数 AI 系统的形态——一堆串起来的管线。

事项 官方已确认内容 口径说明
发布与状态 2026-10-05,研究预览 官方标注
规模与定位 19B,omni-reasoning,从零训练 官方
统一方式 文本 / 视觉 / 机器人动作统一为同一上下文里的 token 官方
架构 每个 transformer block 分两条专家流,共享注意力与状态 官方
训练算力 320 张 H100,约 3 个月,从零 官方
视频速度 基础版中位 0.79× 实时,首帧约 6 秒 官方
蒸馏 去噪 99 步压到 8 步 官方
原生视频上限 672×384 官方
机器人 仅 LIBERO 仿真验证,无真实机器人 官方
获取 研究预览,无公开定价 / 下载,联系合作 官方

表:Reka Rho-1 发布要点(依据 Reka 官方研究页整理)

二、“坍缩”掉的是什么

官方概括得很直接:今天多数系统是“agentic pipelines”——一个规划模型决定要做什么,再去调用视觉、视频、动作等专家。Rho-1 的做法是“collapses that stack”:把文本、视觉和机器人动作,都变成同一个上下文窗口里的 token。

具体怎么编码,官方分了两类:

token 类型 编码内容
离散 token 文本、符号推理、高层指令
连续 token 图像潜变量、视频帧、机器人动作、本体感知

表:Rho-1 的两种 token 口径(官方)

关键在于,机器人动作和未来视频帧,都是从“同一个潜状态”解码出来的。于是策略可以“在脑子里先模拟接下来几秒”,动作也像文本和像素一样,被当作原生连续 token 处理。这跟“模型吐一段指令、外部去执行”的管线,是两种哲学。

三、两条专家流,但共享一个 KV cache

架构上,Rho-1 在每个 transformer block 里把计算拆成两条专家权重流:

  • 理解流(understanding stream):负责语言和视觉解析。
  • 生成流(generation stream):把潜变量去噪成图像和视频。

两者不是各干各的。官方说,两条流的 token 互相注意,跑在同一个 KV cache 上;用户指令、思维链痕迹、之前的视频帧、发出的运动策略,全都累积在同一个上下文里。需要时,理解流发出一个离散的“切换 token”,生成流立刻从累积状态渲染——官方称之为“零延迟交接”(zero-latency handoffs)。

这个设计的卖点,正是消除管线里“等上一个专家返回、再交给下一个”的停顿。

四、320 张 H100、3 个月:这个量级本身值得看

Reka 在博文里专门强调:帖子里所有结果,都来自一个“仅用 320 张 H100、训练 3 个月、从零训出来”的 checkpoint,并直言这只是现代前沿语言与视频模型背后算力“的一小部分”。

这是个有意为之的对照。当行业习惯用万卡、数月甚至更久去堆前沿模型时,Rho-1 想证明的是:用相对克制的算力,也能把“统一多模态”这件事跑通一个可演示的版本。代价也很清楚——后面那些限制,官方自己归因到“训练算力与数据规模偏小”。

五、演示与速度:一次对话里的闭环

官方记录了一段连续 5 轮、单一网络、状态只增不减的对话:

  1. 画:用户让画一座红白条纹灯塔的低空俯视图,模型生成 image:0。
  2. 框:用户说“给灯塔画个框”,模型直接发坐标 token 框选。
  3. 动:用户让“无人机缓缓飞向灯塔”,模型基于原图潜表示生成 video:0。
  4. 改:用户让“改成暴风雪”,生成 video:1,保持相机运动和物体一致。
  5. 问:用户问“两段视频哪里变了”,模型读潜状态差异作答。

速度数据上,基础版视频生成中位 0.79× 实时、首帧约 6 秒;蒸馏版把去噪从 99 步压到 8 步,几乎不损质量,把一个 5.3 秒的片段在约 1 秒内返回,官方称比它测过的任何视频模型都快。

和“多智能体管线”比首片段延迟,官方给的对照是:

图:首片段延迟对照(数据来源:Reka 官方研究页;条形按真实数值线性映射,单位秒,越短越好)

多智能体管线   ████████████████  13.8
Rho-1         ████████           7.0

说明:条形长度按各方案首片段(first chunk)延迟真实数值线性缩放。Rho-1 的 7.0 秒约为多智能体管线 13.8 秒的一半,差距主要来自省去了管线里的模型间交接。该对照来自官方图示,实际数值会随任务与部署变动。

六、能力边界:哪些还不行

官方把限制摊开讲,这反而是最该被认真读的部分:

限制项 官方描述
原生视频分辨率 目前封顶 672×384
长程漂移 长 rollout 先发生结构性退化(如房间布局错乱),再发生视觉退化
跨时间定位 静态图上的检测与坐标定位可靠,跨视频帧尚不稳
编辑稳定性 定向视觉编辑仍早期,跨多样 prompt 的一致性脆弱
机器人 仅在 LIBERO 仿真任务验证,未上真实机器人

表:Rho-1 官方列出的能力边界(依据研究页 Limitations 章节)

尤其最后一条,机器人部分展示的是一个 LIBERO 仿真任务(7 个动作通道、腕部视角等),没有任何真实机器人部署。Reka 还提到用配对的逆动力学模型、拿网络视频做预训练来超越遥操作日志,但本次验证仍停留在仿真。

七、它不是产品,是研究预览

Rho-1 目前是 research preview,官方页面没有公开定价、没有下载链接、没有普遍开放接口。合作通道写得很明确:如果你在做具身机器人、交互仿真环境或闭环视觉—动作系统,想大规模部署优化的全模态架构,可以发邮件到 contact@reka.ai 谈合作。

换句话说,它面向的是“能接住这种架构的团队”,而不是普通开发者自助调用。看它的正确姿势,是把它当作“统一多模态”这条路线的早期路标,而不是一个今天就能替换管线的工具。

八、结语

Rho-1 是 Reka 在 2026 年 10 月 5 日放出的研究预览:一个从零训练的 19B 全模态推理模型,把文本、图像、视频生成和机器人动作统一成同一上下文里的 token,用两条共享注意力的专家流(理解 + 生成)替代“规划调用专家”的管线,训练仅用 320 张 H100、约 3 个月。演示里它能在一句对话里连续完成画灯塔、框选、动画、改雪景与问答;官方也坦白它的边界:原生视频仅 672×384、长视频会结构性漂移、跨帧定位与编辑仍脆弱、机器人只在 LIBERO 仿真验证。

值得冷静看待的有三处:一是“坍缩多模态栈”是架构方向而非成熟产品,所有亮眼演示都建立在相对克制的算力上,限制同样源于此;二是机器人能力距离真实部署还有仿真到现实的鸿沟;三是它不公开、不售卖,只找特定团队合作。对行业来说,Rho-1 真正有价值的,不是“又一个能画能动的模型”,而是它用很小的代价,把“一个模型管完看、想、做”这件事从概念往前推了一步——这一步能走多远,要看后续算力和数据能不能跟上。