你是一名长期从事计算机视觉、机器人学习和强化学习研究的学术研究员。请系统调研“Vision-Lang...
Tạo vào: 7 tháng 9, 2026
Trả lời bằng GPT-5.6 Thinking bởi Chat01
Tạo vào: 7 tháng 9, 2026
Trả lời bằng GPT-5.6 Thinking bởi Chat01
你是一名长期从事计算机视觉、机器人学习和强化学习研究的学术研究员。请系统调研“Vision-Language-Action(VLA)模型中的强化学习研究现状”,重点分析强化学习如何用于提升VLA模型的决策、控制、泛化、长时程任务能力和真实机器人表现。
我的研究背景是计算机视觉和强化学习,因此请避免只做概念性介绍,重点给出清晰的技术分类、算法机制、数学形式、实验设置、优缺点和未来研究机会。
一、调研范围
请覆盖以下方向:
VLA模型基础
强化学习在VLA中的主要作用
请按照强化学习介入VLA训练流程的位置进行分类:
重点算法和技术问题
对每个方向说明:
代表性工作
请筛选截至【填写截止日期,例如:2026年9月】的代表性论文、预印本、开源项目和基准。
对每篇工作给出:
请优先关注以下类型的研究:
二、请建立清晰的研究分类体系
请给出一个二维或三维分类框架。例如可以从以下维度组织:
请用表格展示不同类别的代表性方法、适用场景、优点和主要问题。
三、比较不同方法
请重点回答以下问题:
四、实验与评测分析
请总结当前常用的数据集、仿真环境、机器人平台和评测基准,例如:
请分析当前评测存在的问题:
五、研究现状总结
请按照以下结构输出:
六、请特别提出研究机会
请基于已有论文提出至少10个具体、可执行的研究问题。每个问题说明:
研究机会应重点覆盖:
七、文献可靠性要求
严格遵守以下要求:
八、最终输出要求
请先给出一页以内的研究结论摘要,然后给出详细分析。
所有论文按照“年份—方法类别—代表工作—核心贡献—主要局限”的格式整理。
最后请给出:
检索截止:2026年9月7日。 我把文献严格分成三类:①真正利用环境/机器人交互优化策略的 RL;②基于价值、奖励模型、偏好或可验证奖励的 reinforcement fine-tuning / preference optimization;③仍然只是 BC/SFT 的 VLA 工作。后两类经常被论文和综述统称为“VLA-RL”,但从 RL 方法论上并不等价。
核心判断是:VLA 正在从“大规模模仿学习模型”进入“预训练 + RL 后训练”的第二阶段,但尚未进入“RL 取代示范学习”的阶段。 RT-1/RT-2、Open X-Embodiment、Octo、OpenVLA、π0/π0.5 奠定的仍然是大规模异构示范预训练范式;2025 年以后才密集出现 VLA-RL、RIPT-VLA、ConRFT、SimpleVLA-RL、RECAP/π*0.6、ARFM、Z-1、VLA-MBPO、VLA-Precision 等真正针对大 VLA 的 RL/post-training 方法。(Robotics Proceedings)
目前 RL 给 VLA 带来的最可信增益不是“获得新的通用世界知识”,而是四类策略层能力:** 恢复能力与失败修正、长时程信用分配、部署域适应、任务目标/安全/效率的再对齐**。例如 RIPT-VLA 用极少演示加二值成功奖励把一个 1-demo、4% 成功率的 SFT 策略提高到约 97%;SimpleVLA-RL 报告了示范中不存在的 “pushcut” 行为;ConRFT 在 8 个真实机器人任务上通过 offline+online RL 达到 96.3% 平均成功率;最新的 VLA-Precision 在 9 个高精度真实机器人任务、4 种 embodiment 上报告 98.3% 平均成功率。(arXiv)
RL 的最大结构性价值,是允许策略学习自己的 state distribution,而 BC 只能学习 demonstrator state distribution。 对长时程控制,这正好对应 covariate shift、compounding error 和 failure recovery 三个 BC 的根本缺陷。与此同时,RL 的成本也被 VLA 放大:一次 rollout 包括视觉编码、大语言模型推理和几十维 action chunk 生成;真实机器人的 reset、碰撞、安全和吞吐量使传统“百万步 RL”不可接受。因此,现在最成功的范式不是 from-scratch RL,而是强先验策略 + 小幅、受约束的 RL 更新。
算法上已经出现明显分化。离散 action-token VLA 可以较直接采用 PPO/GRPO,例如 VLA-RL、RIPT、SimpleVLA-RL;flow/diffusion VLA 因缺少廉价、精确的 ,成为当前最有研究价值的 RL 算法问题之一。RECAP 通过 advantage conditioning 绕过 policy gradient;ARFM 将 advantage 注入 flow-matching loss;VLA-MBPO 用 Flow-Noise 对去噪路径构造 PPO surrogate;Z-1 则把 GRPO 推向 π0.5 类 flow VLA。(arXiv)
奖励模型很可能是当前第一瓶颈。 RoboReward 证明专门用机器人轨迹训练的 4B/8B reward VLM 比许多更大的通用 VLM 更可靠,而且能实际用于真实机器人 RL;Large Reward Models 用 process/completion/temporal-contrastive reward 将真实 pick-and-place 的 SFT 成功率从 38.3% 提升到 51.7%。但最新 ROBORMBENCH 发现,仅改变语言指令的语义等价表述,就可能使 VLM reward 判断翻转。因此“VLM 能看懂任务”不能推出“VLM 是可靠的 reward function”。(arXiv)
对“真实机器人 RL 是否已优于大规模示范学习”,我的结论是:在部署后适应、精密操作、少数据新任务上已经出现明确优势证据;但没有证据证明 RL 在总体成本匹配条件下能够替代大规模多任务示范预训练。 几乎所有成功工作仍以强 BC/VLA prior 为起点。更准确的范式是:
未来两三年最值得做的方向,我会排为:可靠的视觉过程奖励 > action-chunk 信用分配 > offline-to-online RL > flow/diffusion policy RL > 世界模型 RL > cross-embodiment value/reward transfer > safe real-robot exploration。
给定语言任务 、视觉历史 、机器人 proprioception ,VLA 实际学习的是
而不仅是经典 RL 中的单步 。
更准确地说,大多数真实机器人问题应建模为 language-conditioned POMDP:
隐藏状态 包含完整场景几何、物体状态、接触状态等;机器人只能看到多视角 RGB/RGB-D、proprioception 和有限历史。
VLA 通常包含:
随后通过 cross-attention、token concatenation 或共享 Transformer 融合:
最后由 Action Head 输出机器人动作。
主要有三种 action head。
| 范式 | 动作 | 典型代表 | 对 RL 的意义 |
|---|---|---|---|
| autoregressive token | 每个动作维离散化成 token | RT-2、OpenVLA | 可直接求 ,PPO/GRPO 最自然 |
| continuous regression/chunk | 连续向量 | 部分 Octo/传统 Transformer | actor-critic 容易,但多模态动作分布难 |
| diffusion/flow chunk | 生成整个连续 action chunk | Diffusion Policy、π0/π0.5 | 表达能力最好之一,但 policy likelihood/RL 最困难 |
RT-2 的关键创新就是把机器人动作表示为 VLM 输出 token,使视觉—语言知识和机器人控制进入同一个生成模型;OpenVLA 延续 tokenized action 路线,而 π0/π0.5 转向 flow-matching action expert。大规模跨 embodiment 预训练则主要来自 Open X-Embodiment、Octo 等异构轨迹。(arXiv)
BC/SFT:
或对于 flow policy:
RL 则直接优化行为目标:
根本区别在于训练分布:
BC 只学习“专家到了这些状态后怎么做”;RL 可以学习:
“我自己犯错到了这个状态之后,怎样回来?”
这正是 VLA-RL 最重要的价值。
机器人基础模型范围最大,VLA 是其中直接产生动作的一类。
VLM:
而 VLA:
具身智能模型还可以是 planner、memory、critic、world model,不一定直接控制机器人。
世界模型学习:
作用是预测,而 VLA policy 的作用是选动作。VLA-MBPO 就明确把两者拆开:世界模型负责生成 imagined rollout,VLA policy 在其中做 RL。(arXiv)
我建议采用四维 taxonomy:
| 类别 | 学习信号 | 交互 | 优化对象 | 粒度 | 代表方法 | 主要优点 | 核心风险 |
|---|---|---|---|---|---|---|---|
| RL action pretraining | 环境 reward | sim/real | Action Expert | chunk | ActionX | 减少 demonstration 依赖 | reward/task 依赖 |
| Online VLA RL | terminal/process reward | sim online | policy/LoRA | action/trajectory | VLA-RL, RIPT, SimpleVLA-RL, Z-1 | 学失败恢复、探索 | rollout 成本 |
| Real-world online RL | reward + intervention | real | policy/value | action/chunk | ConRFT, VLAC, VLA-Precision | 强 deployment adaptation | 安全、reset、吞吐 |
| Offline RL | return/Q/failure | offline logs | policy/action expert | action/chunk | ARFM, RedFlow | 无在线风险 | OOD Q-error |
| Advantage-conditioned RL | learned value | offline+real rollout | conditional policy | trajectory/chunk | RECAP/π*0.6 | 适合 flow VLA | value bias |
| Preference alignment | pairwise success/failure | offline/interaction | LoRA/policy | trajectory | GRAPE, APO | 不需精确 reward | preference coverage |
| VLM-as-Reward | VLM/VLM-RM | sim/real | reward model + policy | frame/process/trajectory | RoboReward, LRM, VLAC | 免 reward engineering | reward hacking |
| RLVR/process RFT | verifier/process reward | mostly offline | policy/reasoning | token/chunk | RFTF, LifeLong-RFT | 信用更密 | 可能仍近似 imitation |
| World-model RL | learned | imagined | policy + value | chunk | VLA-RFT, VLA-MBPO | 降真实交互成本 | model exploitation |
| Test-time RL | online progress | deployment | temporary policy | action | TT-VLA | 现场适应 | stability/latency |
| Residual/hierarchical RL | task reward | sim→real | residual controller | low-level | VLAJS/residual VLA | 保留 VLA semantic prior | 上下层冲突 |
| Continual/multi-embodiment RL | mixed signals | offline/online | adapter/action expert | skill/chunk | LifeLong-RFT, VLA-Precision | 持续适应 | forgetting |
ActionX 是少数明确把 RL 前移到 Action Expert pretraining 的工作:冻结 VLM、通过 actor-critic RL 训练 flow action expert,再用少量 demonstration 做全参数 SFT;论文报告在 LIBERO/Meta-World/真实机器人上有效,并声称真实机器人只需不到 100 条专家 demonstration。(PubMed Central (PMC))
定义
则
对于 autoregressive action tokens:
因此 OpenVLA 类模型天然兼容 PPO/GRPO。VLA-RL 正是把 OpenVLA 的机器人决策写成 multimodal token MDP,并使用 PPO、GAE 和 process reward model。(arXiv)
对同一任务/状态采样 条 rollout:
好处是不必训练巨大 critic。
SimpleVLA-RL 使用 OpenVLA-OFT + GRPO,并加入:
RIPT 则采用 leave-one-out advantage + PPO/LOOP。(ICLR Proceedings)
问题在于:
机器人二值成功 reward 非常容易出现全失败组,因此探索设计甚至比 GRPO 公式本身更重要。
典型思路:
并通过 advantage:
对 BC 加权:
IQL、AWAC、CQL 都可以作为 VLA offline post-training 的理论基线:
但 2025–2026 的大 VLA 工作越来越少直接“照搬 CQL/IQL”,而是改造成适配 action chunk/flow 的目标,例如 ARFM、RedFlow。ARFM 的核心就是在 flow-matching gradient 和 RL advantage signal 之间自适应控制 bias–variance。(AAAI Publications)
这是当前特别值得 CV+RL 研究者关注的点。
flow policy 通常定义
问题是 PPO 想要
但 deterministic flow / diffusion 的最终 action density 不是一次 forward 就能得到。
因此出现了四条路线:
1. 路径 likelihood。 VLA-MBPO 的 Flow-Noise 把整个 denoising sequence
视为扩展动作路径,并近似:
(arXiv)
2. advantage-weighted flow matching。 ARFM 不强求标准 policy likelihood,而让 high-advantage action 对 flow loss 有更强影响。(AAAI Publications)
3. advantage-conditioned generation。 RECAP 学一个 value/advantage model,然后训练
部署时始终条件在 positive advantage。这本质接近 value-conditioned behavior extraction,避免直接对 flow action 使用 policy gradient。
4. preference-based flow optimization。 直接使用成功/失败 pair,而非单独建连续 reward/Q。
这意味着未来的核心问题可能不是“PPO 还是 SAC”,而是:
什么才是生成式 action policy 的正确 policy-improvement operator?
可以统一写成:
优点:hard to hack。
缺点:
RIPT、SimpleVLA-RL 大量采用这一模式。
例如 progress potential:
TT-VLA 明确采用这种 progress difference,并进一步用 value-free PPO:
(arXiv)
更适合现代 VLA:
学习
VLA-MBPO 的 GAE 也被改成 chunk discount:
(arXiv)
引入高层:
低层:
长期看,这比给 50 Hz 每个关节动作做 credit assignment 更合理。
| 年份 | 方法类别 | 代表工作 | 核心贡献 | 主要局限 |
|---|---|---|---|---|
| 2022–23 | VLA/数据基础 | RT-1/RT-2, CALVIN, BridgeData V2 | VLA/语言控制和大规模 robot data | 基本以 imitation 为主 |
| 2023 | reward precursor | RoboCLIP | VLM/video-language signal 作为 robot reward | 不是大 VLA policy |
| 2024 | VLA foundation | OpenVLA, Octo, π0 | open VLA、diffusion/flow action | 基本无 RL |
| 2024/26 | preference | GRAPE | trajectory preference + VLM-generated constraints | 不是真正 online RL |
| 2025 | online sim RL | VLA-RL | OpenVLA + PPO + process RM | 主要 LIBERO simulator |
| 2025 | real RL | ConRFT | BC+Q offline → HITL online consistency RL | 任务规模仍小 |
| 2025 | interactive RL | RIPT-VLA | sparse success + LOOP | 主要 simulator |
| 2025 | preference | APO | human intervention → action preference | 需要人工纠错 |
| 2025 | real/offline RL | π*0.6 / RECAP | value + advantage-conditioned VLA | proprietary scale;复杂系统 |
| 2026 | scalable RL | SimpleVLA-RL | GRPO + scalable parallel rollout | sim→real 范围仍有限 |
| 2026 | flow offline RL | ARFM | advantage-aware flow posttraining | 离线 extrapolation |
| 2026 | process RFT | LifeLong-RFT | chunk process reward + continual VLA | reward 很接近 reference action |
| 2026 | world-model RL | VLA-MBPO | chunk world model + Flow-Noise PPO | world-model exploitation |
| 2026 | flow GRPO | Z-1 | π0.5 + GRPO, 24 RoboCasa tasks | 暂为 arXiv |
| 2026 | reward VLM | RoboReward/LRM | robot-specific visual reward | reward robustness 未解决 |
| 2026 | offline failure RL | RedFlow | failed action → corrective supervision | 需要可匹配成功上下文 |
| 2026-09 | real online RL | VLA-Precision | intervention/value/preference co-bootstrap | 刚发布,尚待独立复现 |
Guanxing Lu, Wenkai Guo, Chubin Zhang, Yuheng Zhou, Haonan Jiang, Zifeng Gao, Yansong Tang, Ziwei Wang。
基础模型是 OpenVLA-7B,在 LIBERO 40 个任务上进行 simulator online RL。它把机器人决策重写成 multimodal token MDP,采用 PPO+GAE;奖励由 terminal success 和 Robot Process Reward Model 共同构成。论文报告相对最强 finetuned baseline 平均约 +4.5 个百分点。(arXiv)
意义: 第一批证明“大 VLA + 标准 policy-gradient machinery”可以真正 work 的工作。
局限: 真实机器人证据不足;action token 化使 PPO 容易,但不能自然代表 π0.5 之后的 flow-action 主流。
Shuhan Tan, Kairan Dou, Yue Zhao, Philipp Krähenbühl。
Sparse binary success reward,无 dense reward、无 value network;核心是 dynamic rollout sampling + leave-one-out advantage + LOOP/PPO。
结果包括:
代码已公开。(arXiv)
意义: 证明 strong pretrained VLA 下,即使 reward 极稀疏,也可能通过 group sampling 获得巨大收益。
局限: LIBERO reset 容易、reward 可自动判定,和真实机器人差距很大。
Yuhui Chen, Shuai Tian, Shugao Liu, Yingting Zhou, Haoran Li, Dongbin Zhao。
两阶段:
然后
基于 Octo/HIL-SERL 系统。在 8 个真实机器人 manipulation task 上,论文报告平均 96.3% 成功率,只需每任务约 45–90 分钟在线 fine-tuning;相对监督方法报告成功率提升 144%、episode length 缩短约 1.9×。(Robotics Proceedings)
意义: 目前“VLA + 真机 online RL”最直接的一批证据。
局限: 人工 intervention 是关键组成部分,所以不能把性能归因于纯 autonomous RL;任务数量仍远小于 foundation pretraining。
最终作者版本包括 Zijian Zhang, Kaiyuan Zheng, Zhaorun Chen, Joel Jang, Yi Li, Chaoqi Wang, Mingyu Ding, Dieter Fox, Huaxiu Yao。(GitHub)
这是trajectory preference optimization,不应归为传统 environment RL。
流程:
覆盖 LIBERO、SimplerEnv 和真实机器人。论文报告 in-domain/unseen success 分别提升 51.79%/58.20%,collision 降低 37.44%,rollout steps 降低 11.15%。由于这些数字来自不同实验设置,不应和 VLA-RL 的百分点直接横比。(arXiv)
意义: 把“成功率”扩展到 safety/efficiency 等多目标 alignment。
Wenke Xia, Yichu Yang, Hongtao Wu, Xiao Ma, Tao Kong, Di Hu。
通过人在 policy failure 时介入,形成 desirable/undesirable action pairs,再进行 Action Preference Optimization。(NeurIPS Proceedings)
它更接近:
的 preference policy improvement,而不是
意义下的 online RL。
重要性: 对真实机器人而言,人类 intervention 本身就是低成本、高信息密度的 negative data source。
这是我认为最有研究价值的路线之一。
RECAP 不强求对 flow policy 做 vanilla PPO,而是训练 value model:
计算
再把数据标成 positive/negative advantage:
policy 学:
部署时:
也就是:
critic 判断哪些经验比预期好,generator 模仿这些“好于预期”的 action。
这比对巨大 flow policy 做精确 on-policy policy gradient 更稳。
系统还采用 Knowledge Insulation / stop-gradient、web-data co-training,以及从基础 checkpoint 重新进行每轮训练来降低 policy drift 和知识遗忘。论文报告在 laundry、espresso、box assembly 等真实长任务上显著提高吞吐和降低失败。(arXiv)
我的判断: 这类“value learning + conditional policy extraction”可能比直接把 PPO 移植到 flow VLA 更接近未来主流。
OpenVLA-OFT + GRPO。
除了 RL 算法,贡献更偏系统:
论文在 LIBERO、RoboTwin 1.0/2.0 和真实机器人上报告超过 SFT,并发现名为 pushcut 的策略行为——并非示范中的动作模式。(ICLR Proceedings)
一个尤其有价值的实验是 low-data long horizon:论文报告某 LIBERO-Long 条件从约 17.1% 到 91.7%。
意义: 这是“RL 不只是拟合 demonstrations”的少数直接行为证据之一。
但必须谨慎:
emergent strategy transferable world knowledge。
它证明了策略搜索能找到新的行为,不证明模型学习了更广泛的物理世界模型。
这是目前非常少见的RL 介入 pretraining。
冻结 pretrained VLM:
RL 优化 flow action expert:
随后用少量 expert data jointly finetune:
作者在 LIBERO Spatial 上报告从直接 SFT 的 0% 到 RL-pretrained action expert 后约 95%,在 Long subset 上报告超过 50% 的成功率提升;真实机器人整体结果报告平均 +16%。(PubMed Central (PMC))
值得研究的观点:
VLM 的 semantic pretraining 和 motor pretraining 未必需要来自同一种数据、同一种损失。
VLA-MBPO 的三阶段:
世界模型预测 visual transition 和 reward。
关键创新是 chunk-level branched rollout:
不是
完整 hallucination,而从 real replay buffer 中多个状态出发,仅预测短段:
这样 model error 的累积 horizon 大幅缩短。论文明确分析了 world-model error 和 policy distribution shift 对 value gap 的影响。(arXiv)
基础策略为 π0.5,并在真实平台包括 Arx-X5、Galaxy-R1 等环境展示结果。官方代码目前已有 world-model/RL 训练脚本。(Rhx11111)
主要风险:
可能优化的是世界模型漏洞,而不是真实动力学。
Lang Cao, Renhong Chen, Luyi Li, Peng Wang, Mofan Peng, Yitong Li。
基础模型 π0.5,仅用公开 RoboCasa demos 做 SFT,然后在 24 个 RoboCasa task 上 task-wise GRPO。
引入:
报告平均成功率 80.6%,比 SFT initialization 高 13.2 个百分点。(arXiv)
这是一个重要趋势:
RL 正从 OpenVLA action-token 时代扩展到 π0.5 类 flow VLA。
ARFM 已发表于 AAAI 2026。它针对 flow-matching VLA 构造 adaptive reinforced flow matching,在 advantage preservation 与 flow-gradient variance 之间自适应调权,并报告 simulation + real-world 的 generalization、robustness、few-shot、continual-learning 改进。(AAAI Publications)
2026 年 7 月的 RedFlow 更进一步把 failure trajectory 分解到 action level:
论文在三个真实任务中报告成功率从 56.7% → 74.7%,并称样本量约低于 PPO/GRPO/DDPO 一个数量级。该工作目前是 arXiv 预印本,需要独立复现。(arXiv)
这非常值得关注,因为现实部署中:
而传统 BC 几乎只利用 。
或者:
可以是:
Tony Lee, Andrew Wagenmaker, Karl Pertsch, Percy Liang, Sergey Levine, Chelsea Finn,2026 arXiv。
利用 OXE + RoboArena,专门构造:
这很关键,因为 OXE 本身 success-heavy;reward model 如果只见成功视频,很容易学“物体出现了”而非“任务完成了”。
作者发现没有一个现有通用 VLM 在所有 reward task 上都可靠;其 RoboReward 4B/8B 优于更大的通用模型,8B reward model 用于真实机器人 RL 时明显优于 Gemini Robotics-ER 1.5 reward,并缩小与人工 reward 的差距。(arXiv)
2026 arXiv,Yanru Wu et al.
把奖励拆成:
开放代码支持 Pi0.5 + ManiSkill RL。
真实 pick-and-place:
(GitHub)
Vision-Language-Action-Critic 将:
统一到大型多模态 critic 中,并通过异步 real-world RL + graded human intervention 做策略改进。论文在四个真实 manipulation task 上报告约 30% → 90%,200 个 real interaction episodes 左右;加入 intervention 后样本效率进一步提升。该工作截至截止日仍以预印本为主。(arXiv)
结论:可用,但还不可信任。
典型 failure mode:
例如:
任务:“put cup in sink”。
模型可能学习:
而非严格判断 inside。
抓起物体看起来“更像成功”,reward 上升;policy 最后学会举着物体而不完成放置。
单帧不能区分:
最新 ROBORMBENCH 使用 2,390 条真实机器人轨迹和 21,673 个验证过的语义改写,发现 reward VLM 会对语义等价 instruction 给出不一致判断;模型规模和 reasoning 并不能稳定解决。(arXiv)
因此好的 reward model 应额外评价:
而不能只报告 reward classification accuracy。
DPO 类目标:
但需要严格区分:
RLHF-style preference optimization ≠ environment RL。
它可以看作 KL-regularized RL 的隐式解,但没有:
的主动策略探索。
VLA 中它特别适合:
GRAPE、APO 属于这一类。
IPO、DPO、RPO 等可以作为算法基线,但目前机器人 VLA paper 经常针对 trajectory/action representation 自定义 preference loss,而不是原封不动使用 LLM-DPO。
真正合理的结构很可能是:
负责选择:
open drawer → grasp cup → move → place
而
负责 0.1–1 秒 motor chunk。
其优势是信用分配 horizon 从:
缩短成:
π0.5/π0.6 已经具有高层 subtask token + 低层 flow action expert 的结构;GRAPE 也显式把任务切成 temporal stages;VLA-MBPO 从 step-level world model 转向 chunk-level planning。(GRAPE)
因此对问题:
VLA-RL 是否正从“端到端控制”转向“高层决策与低层控制解耦”?
我的答案是:
是,但不是完全 modularization,而是“representation/temporal scale 解耦 + joint training”。
2026 年 8 月的 NebulaVLA 甚至直接采用高低频异步架构,这进一步说明该趋势,不过它本身不是 RL 工作。(arXiv)
主要不是模型容量不足,而是 objective mismatch。
训练:
部署:
微小误差:
长任务 failure probability 近似:
即使单步正确率 ,500 个独立关键决策:
当然实际错误并非独立,但它说明长 horizon 对局部误差极敏感。
在 demonstrations 中:
模型不知道:
“这个动作为什么不好”。
Preference/RL 可以显式学习:
BC 最大化:
而真实目标可能是:
GRAPE 很好地展示了这个区别:同一个 VLA 可以针对 success、safety、efficiency 使用不同 preference objective。(arXiv)
| 传统机器人 RL | VLA-RL |
|---|---|
| state/proprio feature | image + language + proprio + history |
| 小 actor | 1B–10B multimodal model |
| 从随机/skill policy 开始 | 强 pretrained policy |
| single task | language-conditioned multitask |
| action token / action chunk / diffusion trajectory | |
| engineered reward | success + VLM/process/preference |
| millions simulator steps | expensive GPU + robot rollouts |
| exploration from scratch | exploration around pretrained prior |
| critic shares state encoder | semantic multimodal critic |
| main risk: instability | instability + forgetting + language degradation |
最关键的变化是:
所以 trust region、reference policy、adapter、frozen backbone 变得极为重要。
二者都有:
以及:
LLM token:
本身就是 environment-free sampling。
机器人:
涉及:
因此机器人一个 RL sample 的成本可能是 LLM token sampling 的多个数量级更高。
此外 reward verifier 没那么简单:
数学题可执行:
机器人则经常没有可靠:
这就是 RoboReward/ROBORMBENCH 为什么重要。
| 方法 | 最合适场景 | 优点 | 缺点 |
|---|---|---|---|
| offline RL | 有大量部署日志/失败轨迹 | 安全、便宜、可重复 | extrapolation/Q bias |
| sim online RL | 可构造 reliable simulator/reward | 强探索、并行 | sim2real |
| real online RL | precision/contact/deployment adaptation | 直接优化真实目标 | 贵、危险 |
| preference posttrain | 有 human/VLM pair ranking | reward-free/稳定 | 不主动探索 |
| world-model RL | 有 video/transition logs | imagined rollout | model hacking |
| test-time RL | 环境不断变化 | 快速现场适应 | drift/latency |
| residual RL | VLA 已能大体完成任务 | 样本效率高 | residual/generalist 冲突 |
不能做这个总体结论。
证据支持的是:
在一些 downstream domain。
并不支持:
ConRFT、RECAP、RoboReward、LRM、VLAC、VLA-Precision 都是 strong prior 后做 RL。(Robotics Proceedings)
特别是 VLA-Precision:最新预印本报告 4 embodiment、9 个高精度 chemistry task,平均 98.3%、每任务约 45.8 分钟 online adaptation,这是非常强的“deployment RL”证据;但它仍不足以证明大规模 demonstration pretraining 不必要。(arXiv)
因此目前最合理的结论是:
目前证据偏向 No / 未证明。
RL 明显可以提高:
但这更多说明:
在更广状态区域中变得更优。
要证明学习了 transferable world knowledge,至少需要:
然后:
且 B 在:
等轴上同时 hold out。
当前此类严格实验仍不充分。
这是一个明显空白。
OXE 本身提供跨 embodiment data,包含超过百万条真实机器人轨迹、多个机器人形态;Octo 等模型从这种数据获得 transfer。(arXiv)
但真正的 RL 阶段通常仍是:
VLA-Precision 的四 embodiment 是很有意义的新信号。(arXiv)
未来真正值得问:
中的 critic 是否能够跨 embodiment 共享?
这甚至可能比 shared policy 更容易,因为:
“任务进展/失败”通常比具体关节运动更 embodiment-invariant。
三种主要路线:
使用 domain randomization:
SimpleVLA-RL 在 RoboTwin→真实双臂上属于这种思路的一部分。(ICLR Proceedings)
冻结 VLA:
这样:
VLAJS 类工作用 VLA guidance jump-start PPO,并在 Franka 上验证 sim→real,报告部分任务减少超过 50% 环境交互。(arXiv)
VLA-MBPO:
理论上是最有扩展性的路线。
| 数据/环境 | 类型 | 适合研究 | 注意事项 |
|---|---|---|---|
| Open X-Embodiment | 大规模真实多机器人数据 | pretrain/cross embodiment | success-heavy;不是 RL benchmark |
| BridgeData V2 | 53,896 真实 trajectories、24 environments | real generalization/offline RL | embodiment diversity 较有限 |
| LIBERO | 130 task simulator | VLA SFT/RL、OOD、lifelong | sparse +1;目前 RL 最常见 |
| CALVIN | long-horizon language benchmark | sequential composition | 经典 avg chain length |
| RLBench | simulation manipulation | language/task diversity | 与真实 VLA 数据差距较大 |
| Meta-World | continuous-control benchmark | RL algorithm sanity check | 视觉语言复杂度较低 |
| ManiSkill | GPU robotics simulation | large-scale online RL | domain gap |
| RoboCasa | kitchen simulator | long horizon/multitask | reward/task design 影响较大 |
| RoboTwin 2.0 | 双臂 sim/data generation | bimanual/sim2real | benchmark 较新 |
| SimplerEnv | real-to-sim VLA evaluation | VLA generalization | sim ranking≠real ranking |
BridgeData V2 官方统计为 53,896 条轨迹、13 类技能、24 个环境。(BridgeData V2)
LIBERO 有 130 个任务,其中 Spatial/Object/Goal 控制不同 distribution shift;LIBERO-100 又分 LIBERO-90/10。非常有趣的一点是,官方本身明确指出它只有 sparse success reward,并称 sparse-reward RL 很难,因此原始 benchmark 主要聚焦 lifelong imitation learning;这恰好解释了为什么 RIPT/SimpleVLA-RL 的进展有意义。(GitHub)
CALVIN 则专门针对语言条件的 long-horizon composition,并评测 unseen language/environment。(IEEE Xplore)
RoboTwin 2.0 提供强 domain randomization 和可规模化双臂 manipulation data generation,适合 sim→real RL。(arXiv)
大量论文:
因此算法、基础策略和 simulator 强耦合。
99% vs 97% 的差异可能远小于真实机器人 domain shift。
“Long” 在 simulator 中仍常常只是几十到几百 policy steps。
与:
不是同一难度。
不同工作使用:
因此不要跨论文直接比较成功率。
至少应该报告:
“98% success” 和“用了多少 real robot hours”同等重要。
还应报告:
failure taxonomy。
改变桌布颜色不等于真正 OOD。
应分:
一个 reward model offline accuracy 好:
并不能保证:
高。
RL 会主动寻找 reward model 的漏洞。
截至 2026-09,我认为形成了以下较强共识。
第一,BC 是必要但不充分。 Long-horizon distribution shift 和 recovery 几乎天然要求 policy-dependent data。
第二,RL 更适合 posttraining 而不是 foundation learning from scratch。
第三,binary terminal reward 出人意料地有效,但建立在很强 pretrained prior 上。 RIPT、SimpleVLA-RL 是重要证据。(arXiv)
第四,flow action policy 正迫使 RL 算法重新设计。
第五,真实机器人 RL 最可能首先在 precision/contact/deployment refinement 上获得经济价值。 ConRFT 和 VLA-Precision 都支持这一方向。(Robotics Proceedings)
第六,reward quality 和 reward robustness 已变成 VLA-RL 的基础设施问题。
两类结果都有。
一些论文报告 unseen object/instruction/task gain;但从 RL theory 看,如果 reward 和 rollout 仍来自 training environment:
那么性能提升本身不能证明 semantic generalization。
两者都可能。
越 dense:
同时:
没有定论。
更新更多参数:
但:
ActionX、GRAPE、RECAP、Z-1 给出了不同折中。(PubMed Central (PMC))
如果按我认为未来论文价值排序:
动作表示确实是瓶颈,但不是唯一瓶颈。
即使完美解决 flow likelihood,如果 reward 错:
仍然只会更高效地 reward hack。
可以从优化约束理解:
工程策略包括:
其中 5–7 对大 VLA 特别值得进一步研究。
| # | 研究问题 | 假设 / 缺口 | 方法 | 数据/环境 | 主要指标 | MVP / 风险 / 投稿 |
|---|---|---|---|---|---|---|
| 1 | 语义不变视觉奖励 | reward 应对 paraphrase invariant;当前 VLM 不满足 | RoboReward + contrastive consistency + uncertainty | ROBORMBENCH/OXE/LIBERO | reward AUC、paraphrase flip rate、RL SR | 先冻结 policy 测 reward;CVPR/ICLR/CoRL |
| 2 | temporal reward model | video dynamics 比单帧 completion 更可靠 | video transformer + potential reward | OXE/RoboArena/Bridge | monotonicity、near-miss AUROC | 8–16 frame model;CVPR/CoRL |
| 3 | chunk-aware GAE | 每个 action token 平分 trajectory reward 不合理 | chunk critic + option-GAE | LIBERO-Long/RoboTwin | success、gradient variance、sample efficiency | OpenVLA-OFT;ICLR/CoRL |
| 4 | offline→online VLA RL | offline failures 可降低真机探索成本 | IQL/CQL warm-start → PPO/AWAC online | Bridge/OXE + Franka | robot episodes to 90% | 先 simulator mixed-quality dataset;RSS/CoRL |
| 5 | VLA epistemic exploration | 应探索“模型不知道但安全”的状态 | ensemble/latent uncertainty + intrinsic reward | ManiSkill/RoboCasa | success/interactions/safety violations | 只训练 action adapter;ICLR/CoRL |
| 6 | RL-friendly flow policy | flow policy 缺 tractable improvement operator | Q-guided flow / path-policy gradient | π0.5-style + LIBERO | stability、policy KL、success | 与 ARFM/Flow-Noise 对照;ICLR/NeurIPS |
| 7 | vision encoder 与 critic 协同更新 | reward-relevant features ≠ BC features | separate LoRA + orthogonal gradients | LIBERO corruption/RLBench | robustness、forgetting | DINO/SigLIP backbone;CVPR/ICLR |
| 8 | 语言条件 reward calibration | language paraphrase 是新 failure axis | instruction ensemble + semantic consistency regularization | ROBORMBENCH | flip rate、ECE、policy return | reward-only experiment 成本低;ACL/CVPR |
| 9 | uncertainty-aware VLA-MBPO | world model exploitation 是 MBRL 最大风险 | ensemble WM + pessimistic return + rollout truncation | RoboTwin/RoboCasa | model-error/return correlation | 先 image-latent WM;ICML/ICLR |
| 10 | cross-embodiment critic | value 比 action 更 embodiment invariant | morphology-conditioned universal Q/V | OXE + 2–3 robots | zero-shot value ranking、few-shot SR | WidowX/Franka/Piper sim;CoRL/RSS |
| 11 | safe real-VLA RL | pretrained VLA 不是 safety guarantee | constrained PPO/CPO + visual shield + HITL | Franka/contact tasks | success、collision/intervention rate | simulator + limited real validation;RSS/ICRA |
| 12 | failure trajectory decomposition | failure 中只有局部 segment 错 | temporal credit localization + counterfactual retrieval | LIBERO deployment logs | corrected-action precision、SR | RedFlow baseline;ICLR/CoRL |
| 13 | multi-robot collaborative VLA | semantic planner 可共享,control 不同 | centralized VLM critic + decentralized VLA policies | multi-arm ManiSkill/RoboTwin | cooperation success、communication cost | two-arm handoff;CoRL/RSS |
| 14 | automatic subtask RL | long horizon 应在 skill level credit | VLM subgoal proposal + option critic | CALVIN/RoboCasa | chain length、subgoal accuracy | CALVIN 5-step chains;ICLR/CoRL |
学习:
同时约束:
其中:
再加入 temporal ranking:
仅当轨迹真实向目标前进。
把 reward-model evaluation 从“classification accuracy”升级到:
这是我认为当前风险最低、论文价值最高的切入点。
当前:
没有尊重 action chunk 内的 temporal structure。
研究:
以及 chunk 内 credit:
例如:
LIBERO-Long → RoboCasa/RoboTwin。
建立真正针对 diffusion/flow action chunk 的 RL credit assignment。
这是最适合强化学习算法型论文的方向。
policy:
强 embodiment-specific。
而 task progress:
相对 embodiment invariant。
所以与其强行统一所有 action policy,不如先统一:
OXE:
再用少量新机器人 online experience。
如果成立,可能给出比“统一 action space”更可扩展的 multi-robot RL foundation。
读:
RT-2 → OXE → Octo → OpenVLA → π0/π0.5。
跑通:
记录:
重点:
实现统一 RL abstraction:
对比:
读:
RoboCLIP → GRAPE → RoboReward → LRM → ROBORMBENCH。
构造 benchmark:
复现/分析:
重点测:
和 policy drift。
使用:
收集 mixed-quality rollout:
跑:
IQL/AWAC/CQL-style baseline + specialized VLA algorithm。
优先级:
最后的实验矩阵至少包含:
并报告 interaction/sample cost,而不只是 success rate。
按“理解 VLA-RL 的边际价值”排序,而不是单纯按引用量:
如果专门研究 reward,再额外必读 ROBORMBENCH;它对当前 reward-VLM 的可靠性给出了非常重要的负面证据。(arXiv)
textVision-Language-Action │ ┌───────────┴───────────┐ │ │ Pretraining / BC RL / Post-training │ │ ┌────────────┼─────────┐ ┌───────┼────────────────────┐ │ │ │ │ │ │ OXE OpenVLA π0 Online Offline Preference/RM RL RL │ │ │ ├─ GRAPE/APO ┌────────┼──┐ ARFM/RedFlow ├─ RoboReward │ │ │ └─ LRM/VLAC PPO/GRPO real WM-RL │ │ │ VLA-RL/RIPT ConRFT VLA-MBPO Simple/Z-1 VLA-Precision │ action representation │ ┌──────────┼───────────┐ │ │ │ tokens continuous flow/diffusion │ │ PPO easy likelihood hard │ ┌───────────┼─────────────┐ │ │ │ ARFM Flow-Noise RECAP weighted FM path PPO adv-conditioning
这张图里真正空白最大的连接是:
如果目标是做一篇计算机视觉味更强的 VLA-RL 论文,我会优先做 视觉/视频 reward model 的可靠性、时间建模和 OOD calibration。RoboReward 与 ROBORMBENCH 之间已经形成一个很好的研究张力:一个证明“专门训练有效”,另一个证明“仍然非常脆弱”。(arxiv.org)
如果目标是做一篇强化学习算法味更强的论文,我会优先做 flow/diffusion action chunk 的 policy improvement + long-horizon credit assignment。当前 ARFM、RECAP、Flow-Noise、Z-1 分别给出了四种彼此并未统一的解法,这通常意味着底层问题远未解决。(AAAI Publications)
如果目标是做一篇机器人系统/RSS/CoRL 味更强的论文,我会做 offline failures → uncertainty-aware online refinement → 真机 deployment,并将真实 robot-hours、human intervention 次数、安全违规次数作为一等指标。ConRFT、RedFlow、VLA-Precision 已经证明这条路线有很强的实验价值,但尚没有一个公认、统一、跨机器人可复现的方法。(Robotics Proceedings)
三个最值得立即启动的项目,按我的优先级是:
这三个方向分别击中了当前 VLA-RL 的三个核心未解问题:“奖励什么”“怎样更新”“知识能否跨机器人迁移”。
我在用 MinerU 做 PDF/文档解析(版面分析、表格结构、公式识别、阅读顺序等)。请评估用强化学习(RL)优化它的可行性,若可行再给出一套可落地的实施方案。
请先判断:MinerU 流程中哪些环节具备可验证的奖励信号、适合 RL;哪些环节奖励模糊,更适合继续用 SFT 或规则后处理;在什么条件下 RL 才值得做,什么情况下投入产出比不划算。
若部分可行,请给出从实际出发的方案:
请同时给出成本、周期、风险与预期收益的现实估计,以及不做 RL 时的替代优化方案。
可以,而且不是“理论上可行”:MinerU2.5-Pro 已经实际使用 GRPO 做最后一阶段的 metric alignment。但更重要的结论是:** RL 只适合 MinerU 中少数“高结构性 + 可程序验证 + SFT loss 与最终指标存在明显错配”的子任务。把整条 PDF→Markdown 流程端到端 RL 化,我不建议。**
附件里梳理的 MinerU 路线本身已经很适合做这种拆分:早期 pipeline 把版面、公式、OCR 等拆成组件,MinerU2.5 又采用“低分辨率全局布局 → 原分辨率局部识别”的 coarse-to-fine VLM,而 MinerU-Popo 则进一步把标题层级、跨页结构等交给独立后处理。(MinerU团队调研.md) (MinerU团队调研.md)
外部核验还补充了附件中一个很关键的信息:MinerU2.5-Pro 的三阶段训练是 65.5M 大规模预训练/SFT → 192K 高质量 hard-sample SFT → GRPO;最后的 GRPO 直接用 Text Edit、Formula CDM、Table TEDS、Layout IoU 作为奖励,,并采用 dynamic sampling/clip-higher。(arXiv)
我的优先级是:
其中前四类“可做”,前两类“最值得做”。
| MinerU 环节 | 奖励可验证性 | RL 适配度 | 我的建议 |
|---|---|---|---|
| 表格结构识别 | 很高:TEDS/TEDS-S、cell F1、HTML validity | ★★★★★ | 首选 |
| 公式识别 | 很高:CDM、LaTeX canonical match、render consistency | ★★★★★ | 第二优先 |
| 阅读顺序 | 高,但依赖可靠 element matching | ★★★★☆ | 复杂多栏文档值得 |
| VLM 版面输出 | 高:class IoU/mAP | ★★★☆☆ | 能做,但 SFT/detection loss 通常更划算 |
| 普通文本 OCR | 很高:NED/CER/WER | ★★☆☆☆ | 通常不值得单独 RL |
| 跨页表格合并 | 中高:有 GT 可算 relation F1 | ★★★☆☆ | 先 SFT/规则 |
| 标题层级 | 中:tree-TEDS 可算,但存在语义歧义 | ★★☆☆☆ | MinerU-Popo/SFT 更合适 |
| 段落合并/截断恢复 | 中 | ★★☆☆☆ | SFT + heuristic |
| 图文关联 | 中 | ★★☆☆☆ | classification/ranking 比 RL 简单 |
| Markdown/JSON 合法性 | 极高 | ★☆☆☆☆ | 不要 RL,直接 constrained decoding |
| 图表语义理解 | 低~中 | ★★☆☆☆ | 奖励模型/SFT 优先 |
OmniDocBench 本身已经提供了非常合适的自动指标:纯文本使用 normalized edit distance,表格使用 TEDS 与 edit distance,公式有 CDM/NED/BLEU,阅读顺序也使用 normalized edit distance。(Open Access CVF)
MinerU2.5-Pro 自己的消融几乎已经回答这个问题。
同一 1.2B 架构:
| 阶段 | OmniDocBench v1.6 Full | 增益 |
|---|---|---|
| MinerU2.5 baseline | 92.98 | — |
| 大规模数据 SFT | 94.29 | +1.31 |
| Hard-sample SFT | 95.25 | +0.96 |
| GRPO | 95.69 | +0.45 |
其中 GRPO 后:
所以真实结论不是:
RL 比 SFT 更强。
而是:
MinerU2.5-Pro 论文自己也明确认为当前主要瓶颈首先是训练数据 coverage、informativeness 和 annotation quality,而不是架构本身。(arXiv)
我建议在开项目之前先做四个 gate。
设一个 hard sample 输入 ,采样 个输出:
如果所有输出都错:
GRPO 没有学习信号。
如果全部都对:
同样没有学习信号。
真正适合 RL 的数据满足:
实践上我会先取 2–5k hard samples,每个 temperature sampling 8 次。如果至少约 20–60% 样本存在明显 candidate quality variance,再考虑 RL。
MinerU2.5-Pro 正是过滤掉 reward 太高和太低的样本,只保留中间 reward 区间,并丢掉 zero-variance rollout group。(arXiv)
最低要求不是:
“可以自动计算 reward”。
而是:
在 500–1000 个 hard case 上人工双标,我希望看到:
达不到这些标准,不要 RL。
因为 RL 最擅长的事情之一就是找到 reward 的漏洞。
例如表格模型用 CE:
它认为:
<td> 错;本质上都是 token error。
但实际业务可能认为:
错一个 rowspan 导致整张表结构错位,比错一个标点严重几十倍。
TEDS:
能够直接体现树结构破坏。
这就是 RL 真正有价值的情况:
CVPR 2026 的 FD-RL 也发现 RL 增益主要集中在高熵 formatted content——公式和表格,而不是 plain text。(Open Access CVF)
如果线上失败主要来自:
那么第一选择应该是:
而不是 RL。
MinerU2.5-Pro 从不足 10M 扩到 65.5M 数据并针对长尾 hard cases 做数据工程,本身就是非常强的证据。(Hugging Face)
如果你只能做一个,我选:
Hard Table Structure Recognition
尤其是:
理由有四个。
第一,奖励非常可验证。
HTML/tree 本身就是程序化结构:
第二,CE 和结构指标错配明显,所以 RL 有真实优化空间。
第三,表格输出有丰富 candidate diversity:
第四,已有独立论文证据。CVPR 2026 FD-RL 在 OmniDocBench 上证明 format-specific GRPO 有效,而且消融中 RL 对 table TEDS/TEDS-S 的收益尤其明显。(Open Access CVF)
同时要看到 ceiling:MinerU2.5-Pro 当前已经达到较高 table performance,且 Hard 表格的巨大改善更多来自数据与 hard-SFT,而非 GRPO 本身。(arXiv)
所以如果你当前已经直接使用 MinerU2.5-Pro-2604/2605,RL 项目的收益预期应该保守;如果你有自己的 domain hard tables,机会会大很多。
不要直接只用:
我建议第一版:
其中所有正向项 normalization 到 。
使用 TEDS-S 或纯结构 tree edit similarity:
重点奖励:
这是核心 reward。
加入 cell content 后避免:
“结构完全正确,但里面全是空 cell”。
先通过结构匹配得到 cell correspondence:
然后:
把 predicted HTML 和 GT 渲染到统一 canonical style:
比较:
比用一个通用 VLM judge 安全得多。
例如:
但这里其实最好直接用 constrained decoding,而不是靠 reward 学。
至少加入以下硬约束。
如果:
直接施加 penalty。
检测 abnormal repetition:
超过阈值:
GRPO 可能通过堆结构提高部分 matching score。
加入:
建议 。
一定要在另外一套指标验收:
但 holdout 还测:
否则非常容易得到:
如果你们线上痛点其实是公式,方案同样成立。
我会使用:
其中:
直接和现有 benchmark 对齐。
把:
latex{a \over b}
和
latex\frac{a}{b}
先 canonicalize,再算 edit similarity。
和 GT render 比较。
这可以减少“字符串不一样、视觉和数学结构却等价”的错误奖励。
MinerU2.5-Pro 的 Stage 3 中,GRPO 对公式的增量实际上比表格更明显:CDM 从 96.48 升到 97.29。(arXiv)
阅读顺序可以定义为 permutation:
我不建议单独用 edit distance,而是:
其中 pairwise precedence:
最大的问题反而不是 RL,而是:
element matching。
OmniDocBench v1.5 就出现过一个严重问题:预测和 GT 只是 segmentation granularity 不一样,却得到很低分;v1.6 因此专门设计了 Multi-Granularity Adaptive Matching。(arXiv)
所以做 reading-order RL 前,要先解决:
否则 reward 本身就是错的。
理论上可以:
但一般不值得。
因为 CE:
和 CER/NED 已经高度一致。
而且普通 text token entropy 较低。FD-RL 的研究正是发现 formatted text 的输出 entropy 比 plain text 高很多,因此专门筛选公式/表格做 RL。(Open Access CVF)
这里通常:
例如判断:
“2.3.1”是不是三级标题?
有时可以规则验证。
但:
“Experimental Results”究竟是二级还是三级?
高度依赖整个 document semantics。
同样,跨页两个段落是否应合并,经常没有唯一形式。
这种情况下 reward:
并不客观。
MinerU-Popo 就选择了更传统的路线:用约 30K task-oriented 数据 fine-tune Qwen3-VL-4B,处理 text/table truncation recovery、title hierarchy 和 image-text association,而不是把这些任务 RL 化。(arXiv)
我认为这个选择是合理的。
推荐:
而不是直接 RL。
先做 1,000–2,000 个高质量 hard table crops。
不要用于训练。
按业务分层:
要求双人 review。
这是整个项目最重要的资产。
MVP:
2–5 万张 table crops 足够。
来源推荐:
MinerU2.5-Pro 使用的思想值得直接复制:多模型 consistency 筛标注,再对 hard case 做 render-then-verify。(arXiv)
不需要把所有 SFT 数据重新 RL。
我建议从 20–50k SFT data 中筛:
个真正 high-information samples。
用 SFT checkpoint 对每个输入采样 8 个 response:
计算:
保留:
且:
具体阈值要根据 reward distribution 定。
这个思想和 MinerU2.5-Pro 的 mid-reward filtering 完全一致。(arXiv)
不是 PPO。
原因:
GRPO:
然后:
MinerU2.5-Pro 本身采用 ,并结合 DAPO 的 clip-higher 和 dynamic sampling。(arXiv)
PPO + learned critic: 没必要增加一个价值模型。
DPO: 可以做 preference pair,但你已经有精确 scalar reward,信息利用率不如 GRPO。
RLHF/RLAIF: 文档解析能程序验证的地方就不要用 VLM judge。
SAC/TD3: 这是单次序列生成,不是连续控制 MDP,不合适。
直接以:
MinerU2.5-2509-1.2B
或你们自己的 pre-RL SFT checkpoint 为基座。
MinerU2.5 官方架构是:
不要直接拿 MinerU2.5-Pro final checkpoint 来证明 RL 有用。
因为它已经做过 GRPO,容易出现 ceiling。
只训:
冻结:
好处是便宜、稳定。
第二轮尝试:
官方 MinerU2.5-Pro Stage 3 实际全部参数可训练,但:
而:
说明实际上也是在强烈限制视觉表征漂移。(arXiv)
我会分两个档位。
Hugging Face TRL + PEFT + vLLM
TRL 现在已经原生支持 VLM GRPO,并支持 image input、LoRA 和 vLLM rollout;Qwen2/2.5-VL 是官方测试模型之一。MinerU 自定义模型可能需要写 processor/model adapter。(Hugging Face)
verl + FSDP + vLLM/SGLang
verl 已有 multimodal GRPO、FSDP、vLLM/SGLang 支持,更适合:
附件也记录了 MinerU 2.5 之后已有 vLLM/SGLang 推理支持,因此工程栈并不冲突。(MinerU团队调研.md)
这是我最推荐你实际去做的版本。
验证:
在相同训练数据和近似额外算力下,GRPO 是否优于继续做一轮 hard-table SFT?
这个对照比“RL vs 原始 MinerU”重要得多。
训练:
验证:
测试:
MinerU2.5-1.2B。
先做:
然后复制两份:
继续相同训练 token 数量的 SFT。
GRPO。
这样控制 compute/data confound。
第一轮无需复刻官方 。
建议:
先跑。
如果 reward variance 不足,再:
LoRA rank 16/32 足够 MVP。
Temperature:
目标是制造有意义的 candidate diversity,而不是追求 deterministic OCR。
初始保持简单:
先不要加入 VLM reward。
先证明:
后续再加 render-based reward。
必须同时比较:
| 方法 | 用途 |
|---|---|
| 原始 MinerU2.5 | 基础参考 |
| Hard-SFT | 证明数据本身的收益 |
| Hard-SFT + additional SFT | 最关键 compute-matched baseline |
| Hard-SFT + GRPO | 实验组 |
额外强烈建议再加:
Best-of-4 + reward reranking
即不训练:
它非常重要。
因为如果 Best-of-4 已经解决问题,那么你可能根本不需要 RL。
我不会以:
“TEDS +0.2”
作为成功。
建议 Go/No-Go 标准:
Hard table:
或:
同时至少一个结构错误指标:
普通文本退化:
公式退化:
正常简单表格:
HTML validity:
在自己的 production holdout 上:
或 business metric 有明确改善。
如果只在 OmniDocBench 涨、真实业务不涨:
停止扩大投入。
这是另一个低成本选择。
把 VLA 问题降维成:
输入所有 detected blocks + page image → 输出 block ID permutation。
这比整页 Markdown RL 便宜很多。
例如:
text<block_7> <block_2> <block_3> ...
奖励:
这样 response 很短,rollout 成本可能降低一个数量级。
如果你真正的线上痛点是:
我反而建议这个作为成本最低的 RL research prototype。
以下是工程估算,不是论文报告数字;假设 1.2B 模型、80GB GPU、PEFT、已有 MinerU 数据/推理基础设施。
| 规模 | 数据 | GPU | 预计周期 | 计算量级 |
|---|---|---|---|---|
| Reward feasibility | 2–5k | 1–2 GPU | 3–5 天 | 10–30 GPUh |
| MVP | 10k RL | 4×A100/H100 | 2–3 周 | 50–200 GPUh |
| Pilot | 20–50k | 8 GPU | 4–6 周 | 300–1,500 GPUh |
| Full | 100–200k | 16–64 GPU | 2–3 月 | 数千到上万 GPUh |
为什么 full 会迅速变贵?
普通 SFT 每个输入生成一次 teacher-forced sequence。
GRPO:
MinerU2.5-Pro 官方:
candidate rollouts。(arXiv)
所以“模型只有 1.2B”不代表完整 RL stage 很便宜。
对这个项目,GPU 通常不是最大的未知成本,GT quality 才是。
复杂表格人工修一张可能远比 OCR text 贵。
我会预算:
如果已有可靠 HTML GT 和内部解析日志,成本会显著下降。
如果你当前还是 MinerU2.5 或自有 SFT 模型:
合理目标:
在 targeted domain 上并非不现实。
合理目标:
更现实。
不要预期很大。
MinerU2.5-Pro 自己的 RL 阶段也只有整体:
(arXiv)
如果你已经直接在用 MinerU2.5-Pro:
我会把预期再砍一半。
这时最值得做的不是复制它的 generic GRPO,而是:
例如:
但人类认为没有更好。
解决: multi-metric reward + hidden metrics + human review。
OmniDocBench 已经相当成熟,而且头部模型越来越接近饱和。你的附件也特别指出了这一点。(MinerU团队调研.md)
解决: 至少保留一个 internal OOD benchmark。
SFT 太强时:
解决:
这既是 MinerU2.5-Pro 的做法,也与 FD-RL 的 entropy filtering 相符。(arXiv)
Hard RL 可能造成:
解决:
MinerU2.5-Pro 在 hard SFT 阶段就用不同 replay ratios 来防止 catastrophic forgetting。(arXiv)
这是项目决策中非常重要的一部分。
第一优先级。
用:
entropy、模型不一致度、当前 evaluator score 找 hard case。
然后人工/伪标签修正。
这是 MinerU2.5-Pro 最大的收益来源。(arXiv)
让:
共同解析。
高一致:
低一致:
这是比盲目扩数据更好的数据工程。
如果已有可靠 reward:
然后:
优点:
缺点是 inference ×N。
但它是决定要不要做 RL 的最佳前置实验。
生成多个答案。
留下:
的高 reward 输出。
再 SFT:
这是 RL 与 SFT 之间非常好的中间点。
往往成本只有 GRPO 的一小部分。
HTML、JSON、LaTeX syntax validity:
不要浪费 RL 学它。
直接:
如果一个 specific component 一直是瓶颈:
附件也说明 MinerU 原始系统本来就是这种组件化思路。(MinerU团队调研.md)
对于 production,这经常比重新训练大模型可靠。
如果问题是:
用专门 postprocessor 会比把 parser 全参数 RL 更干净。MinerU-Popo 就是现成证据。(arXiv)
text线上 MinerU 有明显错误 │ ├── 是“没见过这种文档”? │ │ │ └── YES → 数据工程 + Hard SFT │ ├── 是语法/格式非法? │ │ │ └── YES → constrained decoding / rules │ ├── 是跨页/标题/段落语义问题? │ │ │ └── YES → Popo / SFT / reranker │ └── 是表格/公式/阅读顺序的 sequence-level structural error? │ YES │ 有没有可靠自动 evaluator? │ ┌────────┴────────┐ NO YES │ │ SFT/标注 Best-of-N 是否明显提升? │ ┌────────┴─────────┐ NO YES │ │ 模型没有探索空间 GRPO MVP →继续 SFT │ 是否超过 compute- matched SFT ≥1点? │ ┌────────┴───────┐ NO YES │ │ 停止 扩大 RL
如果现在由我负责这个项目,我会这么安排:
第一周不训练 RL。 从真实 MinerU 日志中抽 2,000 个最困难 table/formula case,建立 clean evaluator。每个输入从现有模型采样 8 次,画出:
同时测试 Best-of-8 oracle:
最关键的一个数字是:
如果:
不要做 RL。
因为模型的输出分布里根本没有更好的答案。
如果:
明显,例如 hard-table TEDS 存在 +3~10 的 oracle gap,那么说明模型“知道怎么做,只是 greedy policy 没选对”,这是 GRPO 最适合的区域。
第二周做 Hard-SFT vs Best-of-N vs GRPO 三方 MVP。
第三周只看 internal OOD 和 failure taxonomy 决定是否扩大。
MinerU 做 RL:部分非常可行,但应该非常克制。
如果目标是改进当前实际系统,我会把资源分成:
而不是倒过来。
复杂表格结构的 GRPO metric alignment。
推荐路线:
奖励第一版:
MVP:
只有当 RL 在 hard/OOD set 上相对 additional SFT 达到 约 +1 absolute TEDS/TEDS-S,且 easy/general OCR 无明显退化,我才会扩大项目。
这是一个比“直接复刻 MinerU2.5-Pro 的 192K×16 GRPO”风险和成本低得多、同时足以验证核心假设的方案。