清华大学 TSAIL(thu-ml)

RDT2-VQ

8.29B 可商用 8/8 已核实

基本事实

发布日期
2025-09 1 来源
参数量
8.29 B 1 来源
架构
单体自回归 0 来源
许可证
Apache-2.0(代码与模型卡) 2 来源
商用
可商用 0 来源
权重
huggingface.co ↗ 1 来源
代码
github.com ↗ 1 来源
论文
arxiv.org ↗ 0 来源
输入模态
rgb · language 0 来源
动作空间
24 步 × 20 维相对动作块(双臂末端) 0 来源
跨本体
10,000+ 小时、100+ 室内场景的 UMI 人类操作数据;双臂 UR5e / 双臂 Franka FR3 零样本 1 来源
预训练数据(小时)
10000 h 1 来源
目标形态
双臂 0 来源
架构 · Qwen2.5-VL-7B-Instruct 改造的自回归 VLA,Residual VQ 动作分词器;另有 flow-matching 版 RDT2-FM;以 UMI 手持夹爪采的人类操作数据预训练,零样本跨本体
来源 · 2 条来源
release_date,license,arch_notes,cross_embodiment,pretrain_hours,code_url https://github.com/thu-ml/RDT2 官方页面 · 抓取 2026-09-05 · 尚未存快照 README:2025-09 模型、2026-02 论文;Apache-2.0;Qwen2.5-VL-7B-Instruct;Residual VQ;10,000+ hours;Bimanual UR5e / FR3 / UMI gripper
params_b,weights_url,license https://huggingface.co/api/models/robotics-diffusion-transformer/RDT2-VQ 模型仓库页 · 抓取 2026-09-05 · 尚未存快照 safetensors 8,292,166,656;license: apache-2.0;createdAt 2025-09-22

教程

还没有教程。首篇计划:在租用的 RTX 4090 上跑通本模型,附实测延迟报告。

记录历史

2026-09-05
来源抓取
release_date,license,arch_notes,cross_embodiment,pretrain_hours,code_url · params_b,weights_url,license

延迟与成本

成本 = 延迟 p50 ÷ 1000 × 租价 ÷ 3600 × 1000
硬件p50 msp95 ms峰值显存每千次推理成本 ¥样本
NVIDIA RTX 4090
¥1.68/h · 共绩算力 (2026)
无延迟数据 无数据
NVIDIA RTX 5090
¥2.4/h · 润云 2.4 / 共绩 2.5 / 并行智算云 2.98 (2026)
无延迟数据 无数据
NVIDIA A100 80GB
无租价
无延迟数据 无数据
NVIDIA Jetson AGX Thor
无租价
无延迟数据 无数据
NVIDIA H100 80GB
无租价
无延迟数据 无数据
还没有这个模型的延迟测量 · 数据来自文献、维护者实测或众包 CLI 上传;三者都还没有。

适配本体

只有有证据的格子才上色。橙点表示厂商声明的目标形态,那是声明,不是核实过的适配。

Unitree G1Unitree H1智元 精灵 G1松灵 Piper 机械臂SO-101Franka FR3 / PandaFourier GR-2WidowX 250 SGoogle Robot(Everyday Robots)ALOHA 2 / Cobot Magic(双臂)Galaxea R1 ProFranka Emika Panda
RDT2-VQ
图例 官方声明支持社区复现成功理论可微调不支持未知 厂商声明的目标形态 1 / 12 格有明确状态
SinanLab · 司南实验室方向清晰,判断有据。