你是一名长期从事计算机视觉、机器人学习和强化学习研究的学术研究员。请系统调研“Vision-Lang...

Creato il: 7 settembre 2026

Risposto usando GPT-5.6 Thinking da Chat01

Domanda

你是一名长期从事计算机视觉、机器人学习和强化学习研究的学术研究员。请系统调研“Vision-Language-Action(VLA)模型中的强化学习研究现状”,重点分析强化学习如何用于提升VLA模型的决策、控制、泛化、长时程任务能力和真实机器人表现。

我的研究背景是计算机视觉和强化学习,因此请避免只做概念性介绍,重点给出清晰的技术分类、算法机制、数学形式、实验设置、优缺点和未来研究机会。

一、调研范围

请覆盖以下方向:

  1. VLA模型基础

    • VLA的定义、基本架构和典型范式
    • Vision Encoder、Language Model、Action Head/Policy之间的连接方式
    • 离线示范学习、行为克隆、预训练和强化学习在VLA中的关系
    • VLA与机器人基础模型、具身智能模型、视觉语言模型、世界模型的区别
  2. 强化学习在VLA中的主要作用
    请按照强化学习介入VLA训练流程的位置进行分类:

    • 预训练阶段的强化学习
    • VLA后训练阶段的强化学习
    • 基于在线交互的强化学习
    • 基于离线数据的强化学习
    • 视觉语言奖励模型或VLM-as-a-Reward
    • 人类偏好优化、RLHF、RLAIF和偏好学习
    • 轨迹级、动作级、子任务级奖励
    • 层次强化学习、技能发现和长时程任务规划
    • 多任务、多机器人和跨 embodiment 强化学习
    • 仿真到现实(Sim-to-Real)中的强化学习
    • 世界模型、模型强化学习和基于预测的控制
    • 多模态反馈、语言反馈和视觉反馈驱动的强化学习
  3. 重点算法和技术问题
    对每个方向说明:

    • 状态、动作、奖励和策略分别如何定义
    • 使用了何种MDP、POMDP或层次MDP建模
    • 策略是离散动作、连续动作、动作chunk还是扩散动作策略
    • 使用了哪些算法,例如 PPO、SAC、TD3、IQL、CQL、AWAC、Decision Transformer、Diffusion Policy、DPO、IPO、GRPO 或其他方法
    • 强化学习是在训练整个VLA、仅训练Action Head、LoRA/Adapter,还是训练奖励模型
    • 如何处理稀疏奖励、奖励误差、视觉观测高维性、长时程信用分配和探索问题
    • 如何避免灾难性遗忘、语言能力退化和预训练知识损失
    • 如何解决真实机器人数据昂贵、样本效率低和安全约束问题
  4. 代表性工作
    请筛选截至【填写截止日期,例如:2026年9月】的代表性论文、预印本、开源项目和基准。

    对每篇工作给出:

    • 标题
    • 作者
    • 发表年份
    • 论文链接、DOI或arXiv链接
    • 是否有代码、模型或数据集
    • 使用的VLA基础模型
    • 机器人平台和任务
    • 数据来源
    • 强化学习算法或优化目标
    • 奖励来源
    • 是否使用真实机器人交互
    • 主要实验结果
    • 相比行为克隆或监督微调的改进
    • 局限性
    • 对后续研究的影响

    请优先关注以下类型的研究:

    • 在大规模VLA模型上进行RL后训练的工作
    • 利用VLM/LLM生成奖励或评价轨迹的工作
    • 面向真实机器人的在线强化学习
    • 能够处理长时程、多阶段任务的工作
    • 多任务、多场景和跨机器人泛化工作
    • 开源且具有可复现实验的工作

二、请建立清晰的研究分类体系

请给出一个二维或三维分类框架。例如可以从以下维度组织:

  • 学习信号:示范、环境奖励、人类偏好、VLM评价、语言反馈
  • 交互方式:离线、仿真在线、真实机器人在线
  • 优化对象:完整VLA、策略头、动作解码器、奖励模型、世界模型
  • 行为粒度:低层动作、动作块、技能、任务规划
  • 泛化目标:新物体、新场景、新指令、新任务、新机器人

请用表格展示不同类别的代表性方法、适用场景、优点和主要问题。

三、比较不同方法

请重点回答以下问题:

  1. 为什么行为克隆或监督微调不足以解决VLA的长时程任务和分布外泛化问题?
  2. 强化学习究竟给VLA带来了哪些行为能力上的增益?
  3. VLA中的强化学习与传统机器人RL相比,核心变化是什么?
  4. VLA中的强化学习与LLM/VLM后训练中的RL有什么相似点和区别?
  5. VLM作为奖励模型时,奖励是否可靠?常见的奖励黑客和偏差是什么?
  6. 离线RL、在线RL和RL后训练各自适合哪些场景?
  7. 目前最主要的瓶颈是奖励、探索、数据、模型架构、动作表示还是评测?
  8. 真实机器人强化学习是否已经比大规模示范学习更有优势?请基于论文证据回答。
  9. 当前方法是否真正学到了可迁移的世界知识,还是只是在特定任务上进行策略优化?
  10. VLA强化学习是否正在从“端到端控制”转向“高层决策与低层控制解耦”?

四、实验与评测分析

请总结当前常用的数据集、仿真环境、机器人平台和评测基准,例如:

  • Open X-Embodiment及其衍生数据
  • RT-1、RT-2、Octo、OpenVLA等相关基础模型
  • LIBERO、BridgeData、CALVIN、RLBench、ManiSkill、Meta-World等环境
  • Franka、ALOHA、人形机器人和移动操作平台
  • 长时程任务、组合泛化、跨 embodiment、语言泛化和真实世界成功率评测

请分析当前评测存在的问题:

  • 是否过度依赖短任务和单一机器人
  • 是否缺少统一奖励和统一基线
  • 是否报告真实成功率、样本效率和交互成本
  • 是否存在数据泄漏或训练测试分布重叠
  • 是否只报告平均成功率而忽略失败类型
  • 是否缺少安全性、鲁棒性和长期部署评测

五、研究现状总结

请按照以下结构输出:

  1. 研究问题定义
  2. VLA与强化学习的结合方式
  3. 技术分类体系
  4. 代表性论文时间线
  5. 方法对比表
  6. 数据集、环境和评测基准
  7. 当前共识
  8. 存在争议的问题
  9. 关键瓶颈
  10. 值得关注的研究方向
  11. 对计算机视觉和强化学习研究者最有价值的切入点
  12. 可复现的研究路线建议
  13. 参考文献

六、请特别提出研究机会

请基于已有论文提出至少10个具体、可执行的研究问题。每个问题说明:

  • 研究假设
  • 为什么重要
  • 当前方法的不足
  • 可采用的模型和强化学习算法
  • 所需数据或环境
  • 评价指标
  • 可能的技术风险
  • 最小可行实验
  • 可能投稿的研究方向或会议

研究机会应重点覆盖:

  • 视觉奖励建模
  • 长时程信用分配
  • 离线到在线RL
  • VLA的探索策略
  • 动作chunk与RL的结合
  • 视觉表征与策略优化的协同
  • 语言条件奖励
  • 世界模型与VLA-RL
  • 跨机器人泛化
  • 安全强化学习
  • 失败轨迹学习
  • 多智能体或多机器人协作

七、文献可靠性要求

严格遵守以下要求:

  • 不要编造论文、作者、实验结果、代码仓库或链接。
  • 对每篇论文提供可验证链接。
  • 区分正式发表论文、arXiv预印本、技术报告和博客文章。
  • 对无法确认的信息明确标注“未确认”。
  • 不要把普通机器人模仿学习论文误归类为强化学习论文。
  • 不要把LLM/VLM中的RL工作直接等同于机器人VLA中的RL。
  • 区分真正使用环境交互优化策略的RL、基于偏好或奖励模型的后训练,以及仅使用监督损失的工作。
  • 如果不同论文的实验设置不可直接比较,请明确说明。
  • 结论尽可能引用具体论文或实验,而不是泛泛而谈。
  • 对关键结论至少提供两篇独立来源进行交叉验证。

八、最终输出要求

请先给出一页以内的研究结论摘要,然后给出详细分析。

所有论文按照“年份—方法类别—代表工作—核心贡献—主要局限”的格式整理。

最后请给出:

  1. 一张完整的研究地图
  2. 一份推荐优先阅读的20篇论文清单
  3. 一份适合计算机视觉+强化学习研究者的三个月调研计划
  4. 三个最值得立即开展的研究课题
  5. 每个课题的baseline、数据集、实验指标和预期贡献

Pensiero

Searched 8 websites

Worked for 3m 30s

Risposta

研究结论摘要

检索截止:2026年9月7日。 我把文献严格分成三类:①真正利用环境/机器人交互优化策略的 RL;②基于价值、奖励模型、偏好或可验证奖励的 reinforcement fine-tuning / preference optimization;③仍然只是 BC/SFT 的 VLA 工作。后两类经常被论文和综述统称为“VLA-RL”,但从 RL 方法论上并不等价。

核心判断是:VLA 正在从“大规模模仿学习模型”进入“预训练 + RL 后训练”的第二阶段,但尚未进入“RL 取代示范学习”的阶段。 RT-1/RT-2、Open X-Embodiment、Octo、OpenVLA、π0/π0.5 奠定的仍然是大规模异构示范预训练范式;2025 年以后才密集出现 VLA-RL、RIPT-VLA、ConRFT、SimpleVLA-RL、RECAP/π*0.6、ARFM、Z-1、VLA-MBPO、VLA-Precision 等真正针对大 VLA 的 RL/post-training 方法。(Robotics Proceedings)

目前 RL 给 VLA 带来的最可信增益不是“获得新的通用世界知识”,而是四类策略层能力:** 恢复能力与失败修正、长时程信用分配、部署域适应、任务目标/安全/效率的再对齐**。例如 RIPT-VLA 用极少演示加二值成功奖励把一个 1-demo、4% 成功率的 SFT 策略提高到约 97%;SimpleVLA-RL 报告了示范中不存在的 “pushcut” 行为;ConRFT 在 8 个真实机器人任务上通过 offline+online RL 达到 96.3% 平均成功率;最新的 VLA-Precision 在 9 个高精度真实机器人任务、4 种 embodiment 上报告 98.3% 平均成功率。(arXiv)

RL 的最大结构性价值,是允许策略学习自己的 state distribution,而 BC 只能学习 demonstrator state distribution。 对长时程控制,这正好对应 covariate shift、compounding error 和 failure recovery 三个 BC 的根本缺陷。与此同时,RL 的成本也被 VLA 放大:一次 rollout 包括视觉编码、大语言模型推理和几十维 action chunk 生成;真实机器人的 reset、碰撞、安全和吞吐量使传统“百万步 RL”不可接受。因此,现在最成功的范式不是 from-scratch RL,而是强先验策略 + 小幅、受约束的 RL 更新。

算法上已经出现明显分化。离散 action-token VLA 可以较直接采用 PPO/GRPO,例如 VLA-RL、RIPT、SimpleVLA-RL;flow/diffusion VLA 因缺少廉价、精确的 logπ(as)\log\pi(a|s),成为当前最有研究价值的 RL 算法问题之一。RECAP 通过 advantage conditioning 绕过 policy gradient;ARFM 将 advantage 注入 flow-matching loss;VLA-MBPO 用 Flow-Noise 对去噪路径构造 PPO surrogate;Z-1 则把 GRPO 推向 π0.5 类 flow VLA。(arXiv)

奖励模型很可能是当前第一瓶颈。 RoboReward 证明专门用机器人轨迹训练的 4B/8B reward VLM 比许多更大的通用 VLM 更可靠,而且能实际用于真实机器人 RL;Large Reward Models 用 process/completion/temporal-contrastive reward 将真实 pick-and-place 的 SFT 成功率从 38.3% 提升到 51.7%。但最新 ROBORMBENCH 发现,仅改变语言指令的语义等价表述,就可能使 VLM reward 判断翻转。因此“VLM 能看懂任务”不能推出“VLM 是可靠的 reward function”。(arXiv)

对“真实机器人 RL 是否已优于大规模示范学习”,我的结论是:在部署后适应、精密操作、少数据新任务上已经出现明确优势证据;但没有证据证明 RL 在总体成本匹配条件下能够替代大规模多任务示范预训练。 几乎所有成功工作仍以强 BC/VLA prior 为起点。更准确的范式是:

Web/VLM pretrainingmulti-robot demonstrationstask SFTRL / preference / reward post-training\boxed{\text{Web/VLM pretraining} \rightarrow\text{multi-robot demonstrations} \rightarrow\text{task SFT} \rightarrow\text{RL / preference / reward post-training}}

未来两三年最值得做的方向,我会排为:可靠的视觉过程奖励 > action-chunk 信用分配 > offline-to-online RL > flow/diffusion policy RL > 世界模型 RL > cross-embodiment value/reward transfer > safe real-robot exploration。


1. 研究问题定义与 VLA 基础

1.1 VLA 应怎样形式化

给定语言任务 ll、视觉历史 o0:to_{0:t}、机器人 proprioception qtq_t,VLA 实际学习的是

πθ(Atot,qt,l),At=(at,,at+H1)\pi_\theta(A_t\mid o_{\le t},q_t,l),\qquad A_t=(a_t,\ldots,a_{t+H-1})

而不仅是经典 RL 中的单步 π(atst)\pi(a_t|s_t)

更准确地说,大多数真实机器人问题应建模为 language-conditioned POMDP:

Ml=(S,O,A,T,Ω,Rl,γ).\mathcal M_l= (\mathcal S,\mathcal O,\mathcal A, T,\Omega,R_l,\gamma).

隐藏状态 sts_t 包含完整场景几何、物体状态、接触状态等;机器人只能看到多视角 RGB/RGB-D、proprioception 和有限历史。

VLA 通常包含:

Itfvisztv,lfLMzl,I_t\xrightarrow{f_{\rm vis}}z_t^{v}, \qquad l\xrightarrow{f_{\rm LM}}z^l,

随后通过 cross-attention、token concatenation 或共享 Transformer 融合:

ht=Fθ(ztv,zl,qt,h<t),h_t=F_\theta(z_t^v,z^l,q_t,h_{<t}),

最后由 Action Head 输出机器人动作。

主要有三种 action head。

范式动作典型代表对 RL 的意义
autoregressive token每个动作维离散化成 tokenRT-2、OpenVLA可直接求 logπ\log\pi,PPO/GRPO 最自然
continuous regression/chunkH×daH\times d_a 连续向量部分 Octo/传统 Transformeractor-critic 容易,但多模态动作分布难
diffusion/flow chunk生成整个连续 action chunkDiffusion Policy、π0/π0.5表达能力最好之一,但 policy likelihood/RL 最困难

RT-2 的关键创新就是把机器人动作表示为 VLM 输出 token,使视觉—语言知识和机器人控制进入同一个生成模型;OpenVLA 延续 tokenized action 路线,而 π0/π0.5 转向 flow-matching action expert。大规模跨 embodiment 预训练则主要来自 Open X-Embodiment、Octo 等异构轨迹。(arXiv)


1.2 BC、预训练与 RL 的关系

BC/SFT:

LBC=E(o,l,a)DElogπθ(ao,l)\mathcal L_{\rm BC} = -\mathbb E_{(o,l,a^*)\sim D_E} \log \pi_\theta(a^*|o,l)

或对于 flow policy:

LFM=Eτ,a,ϵvθ(aτ,τ,c)uτ22.\mathcal L_{\rm FM} = \mathbb E_{\tau,a,\epsilon} \|v_\theta(a^\tau,\tau,c)-u^\tau\|_2^2.

RL 则直接优化行为目标:

J(θ)=Eτπθ[t=0Tγtrt].J(\theta) = \mathbb E_{\tau\sim\pi_\theta} \left[ \sum_{t=0}^{T}\gamma^tr_t \right].

根本区别在于训练分布:

dπE(s)vs.dπθ(s).d^{\pi_E}(s) \quad\text{vs.}\quad d^{\pi_\theta}(s).

BC 只学习“专家到了这些状态后怎么做”;RL 可以学习:

“我自己犯错到了这个状态之后,怎样回来?”

这正是 VLA-RL 最重要的价值。


1.3 VLA 与相邻概念的区别

机器人基础模型范围最大,VLA 是其中直接产生动作的一类。

VLM

(I,l)text/representation(I,l)\rightarrow \text{text/representation}

而 VLA:

(I,l,q)robot action.(I,l,q)\rightarrow \text{robot action}.

具身智能模型还可以是 planner、memory、critic、world model,不一定直接控制机器人。

世界模型学习:

p(ot+1,rtot,At,l),p(o_{t+1},r_t|o_{\le t},A_t,l),

作用是预测,而 VLA policy 的作用是选动作。VLA-MBPO 就明确把两者拆开:世界模型负责生成 imagined rollout,VLA policy 在其中做 RL。(arXiv)


2. 强化学习介入 VLA 的技术分类

我建议采用四维 taxonomy:

Signal×Interaction×Optimization Target×Temporal Granularity\boxed{ \text{Signal}\times \text{Interaction}\times \text{Optimization Target}\times \text{Temporal Granularity} }

2.1 完整研究地图

类别学习信号交互优化对象粒度代表方法主要优点核心风险
RL action pretraining环境 rewardsim/realAction ExpertchunkActionX减少 demonstration 依赖reward/task 依赖
Online VLA RLterminal/process rewardsim onlinepolicy/LoRAaction/trajectoryVLA-RL, RIPT, SimpleVLA-RL, Z-1学失败恢复、探索rollout 成本
Real-world online RLreward + interventionrealpolicy/valueaction/chunkConRFT, VLAC, VLA-Precision强 deployment adaptation安全、reset、吞吐
Offline RLreturn/Q/failureoffline logspolicy/action expertaction/chunkARFM, RedFlow无在线风险OOD Q-error
Advantage-conditioned RLlearned valueoffline+real rolloutconditional policytrajectory/chunkRECAP/π*0.6适合 flow VLAvalue bias
Preference alignmentpairwise success/failureoffline/interactionLoRA/policytrajectoryGRAPE, APO不需精确 rewardpreference coverage
VLM-as-RewardVLM/VLM-RMsim/realreward model + policyframe/process/trajectoryRoboReward, LRM, VLAC免 reward engineeringreward hacking
RLVR/process RFTverifier/process rewardmostly offlinepolicy/reasoningtoken/chunkRFTF, LifeLong-RFT信用更密可能仍近似 imitation
World-model RLlearned T,RT,Rimaginedpolicy + valuechunkVLA-RFT, VLA-MBPO降真实交互成本model exploitation
Test-time RLonline progressdeploymenttemporary policyactionTT-VLA现场适应stability/latency
Residual/hierarchical RLtask rewardsim→realresidual controllerlow-levelVLAJS/residual VLA保留 VLA semantic prior上下层冲突
Continual/multi-embodiment RLmixed signalsoffline/onlineadapter/action expertskill/chunkLifeLong-RFT, VLA-Precision持续适应forgetting

ActionX 是少数明确把 RL 前移到 Action Expert pretraining 的工作:冻结 VLM、通过 actor-critic RL 训练 flow action expert,再用少量 demonstration 做全参数 SFT;论文报告在 LIBERO/Meta-World/真实机器人上有效,并声称真实机器人只需不到 100 条专家 demonstration。(PubMed Central (PMC))


3. 主要 RL 数学机制

3.1 PPO:tokenized VLA 最直接

定义

rt(θ)=πθ(Atht)πθold(Atht),r_t(\theta)= \frac{ \pi_\theta(A_t|h_t) }{ \pi_{\theta_{\rm old}}(A_t|h_t) },

LPPO=Et[min(rtA^t,clip(rt,1ϵ,1+ϵ)A^t)].L^{\rm PPO} = \mathbb E_t[ \min( r_t\hat A_t, \operatorname{clip}(r_t,1-\epsilon,1+\epsilon)\hat A_t )].

对于 autoregressive action tokens:

logπ(Atht)=j=1NAlogp(at,jht,at,<j).\log\pi(A_t|h_t) = \sum_{j=1}^{N_A} \log p(a_{t,j}|h_t,a_{t,<j}).

因此 OpenVLA 类模型天然兼容 PPO/GRPO。VLA-RL 正是把 OpenVLA 的机器人决策写成 multimodal token MDP,并使用 PPO、GAE 和 process reward model。(arXiv)


3.2 GRPO

对同一任务/状态采样 GG 条 rollout:

A^i=Rimean(R1:G)std(R1:G)+ϵ.\hat A_i= \frac{R_i-\operatorname{mean}(R_{1:G})} {\operatorname{std}(R_{1:G})+\epsilon}.

好处是不必训练巨大 critic。

SimpleVLA-RL 使用 OpenVLA-OFT + GRPO,并加入:

  • dynamic sampling;
  • asymmetric clipping;
  • exploration temperature;
  • 并行机器人环境。

RIPT 则采用 leave-one-out advantage + PPO/LOOP。(ICLR Proceedings)

问题在于:

R1==RGA^i0.R_1=\cdots=R_G \Rightarrow \hat A_i\approx0.

机器人二值成功 reward 非常容易出现全失败组,因此探索设计甚至比 GRPO 公式本身更重要。


3.3 Offline RL

典型思路:

Q(s,a)=r+γEV(s)Q(s,a) = r+\gamma \mathbb E V(s')

并通过 advantage:

A(s,a)=Q(s,a)V(s)A(s,a)=Q(s,a)-V(s)

对 BC 加权:

LAWR=ED[exp(A/β)logπ(as)].L_{\rm AWR} = -\mathbb E_D [ \exp(A/\beta) \log\pi(a|s) ].

IQL、AWAC、CQL 都可以作为 VLA offline post-training 的理论基线:

  • IQL:避免显式查询 OOD actions;
  • CQL:保守压低数据外动作的 Q;
  • AWAC/AWR:特别适合用 advantage 对 imitation loss 加权。

但 2025–2026 的大 VLA 工作越来越少直接“照搬 CQL/IQL”,而是改造成适配 action chunk/flow 的目标,例如 ARFM、RedFlow。ARFM 的核心就是在 flow-matching gradient 和 RL advantage signal 之间自适应控制 bias–variance。(AAAI Publications)


4. Flow/Diffusion VLA 为什么改变了 RL

这是当前特别值得 CV+RL 研究者关注的点。

flow policy 通常定义

dAτdτ=vθ(Aτ,τ,c),τ[0,1].\frac{dA^\tau}{d\tau} = v_\theta(A^\tau,\tau,c), \qquad \tau\in[0,1].

问题是 PPO 想要

πθ(As)πθold(As),\frac{\pi_\theta(A|s)} {\pi_{\theta_{\rm old}}(A|s)},

但 deterministic flow / diffusion 的最终 action density 不是一次 forward 就能得到。

因此出现了四条路线:

1. 路径 likelihood。 VLA-MBPO 的 Flow-Noise 把整个 denoising sequence

A=(A0,,A1)\mathcal A=(A^0,\ldots,A^1)

视为扩展动作路径,并近似:

logπθ(As)=logπ(A0s)+ilogp(Aτi+1Aτi,s).\log \pi_\theta(\mathcal A|s) = \log \pi(A^0|s) + \sum_i \log p(A^{\tau_{i+1}}|A^{\tau_i},s).

(arXiv)

2. advantage-weighted flow matching。 ARFM 不强求标准 policy likelihood,而让 high-advantage action 对 flow loss 有更强影响。(AAAI Publications)

3. advantage-conditioned generation。 RECAP 学一个 value/advantage model,然后训练

π(Ao,l,Advantage: positive),\pi(A|o,l,\text{Advantage: positive}),

部署时始终条件在 positive advantage。这本质接近 value-conditioned behavior extraction,避免直接对 flow action 使用 policy gradient。

4. preference-based flow optimization。 直接使用成功/失败 pair,而非单独建连续 reward/Q。

这意味着未来的核心问题可能不是“PPO 还是 SAC”,而是:

什么才是生成式 action policy 的正确 policy-improvement operator?


5. 奖励的粒度

可以统一写成:

R(τ)=Rterminal+trtprocess+krkchunk+mrmsubtask.R(\tau) = R_{\rm terminal} +\sum_t r_t^{\rm process} +\sum_k r_k^{\rm chunk} +\sum_m r_m^{\rm subtask}.

trajectory-level

R(τ){0,1}R(\tau)\in\{0,1\}

优点:hard to hack。

缺点:

Var[A^t],T.\operatorname{Var}[\hat A_t]\uparrow,\quad T\uparrow.

RIPT、SimpleVLA-RL 大量采用这一模式。

action/process-level

例如 progress potential:

rt=Φ(o0:t+1,l)Φ(o0:t,l).r_t= \Phi(o_{0:t+1},l) -\Phi(o_{0:t},l).

TT-VLA 明确采用这种 progress difference,并进一步用 value-free PPO:

A^t=rt.\hat A_t=r_t.

(arXiv)

chunk-level

更适合现代 VLA:

Ak=(akH,...,akH+H1)A_k=(a_{kH},...,a_{kH+H-1})

学习

Q(ok,Ak,l).Q(o_k,A_k,l).

VLA-MBPO 的 GAE 也被改成 chunk discount:

A^t=i(γHλ)iδt+iH.\hat A_t= \sum_i (\gamma^H\lambda)^i\delta_{t+iH}.

(arXiv)

subtask / option level

引入高层:

zkπH(zo,l),z_k\sim\pi_H(z|o,l),

低层:

AkπL(Ao,zk).A_k\sim\pi_L(A|o,z_k).

长期看,这比给 50 Hz 每个关节动作做 credit assignment 更合理。


6. 代表性论文时间线

年份方法类别代表工作核心贡献主要局限
2022–23VLA/数据基础RT-1/RT-2, CALVIN, BridgeData V2VLA/语言控制和大规模 robot data基本以 imitation 为主
2023reward precursorRoboCLIPVLM/video-language signal 作为 robot reward不是大 VLA policy
2024VLA foundationOpenVLA, Octo, π0open VLA、diffusion/flow action基本无 RL
2024/26preferenceGRAPEtrajectory preference + VLM-generated constraints不是真正 online RL
2025online sim RLVLA-RLOpenVLA + PPO + process RM主要 LIBERO simulator
2025real RLConRFTBC+Q offline → HITL online consistency RL任务规模仍小
2025interactive RLRIPT-VLAsparse success + LOOP主要 simulator
2025preferenceAPOhuman intervention → action preference需要人工纠错
2025real/offline RLπ*0.6 / RECAPvalue + advantage-conditioned VLAproprietary scale;复杂系统
2026scalable RLSimpleVLA-RLGRPO + scalable parallel rolloutsim→real 范围仍有限
2026flow offline RLARFMadvantage-aware flow posttraining离线 extrapolation
2026process RFTLifeLong-RFTchunk process reward + continual VLAreward 很接近 reference action
2026world-model RLVLA-MBPOchunk world model + Flow-Noise PPOworld-model exploitation
2026flow GRPOZ-1π0.5 + GRPO, 24 RoboCasa tasks暂为 arXiv
2026reward VLMRoboReward/LRMrobot-specific visual rewardreward robustness 未解决
2026offline failure RLRedFlowfailed action → corrective supervision需要可匹配成功上下文
2026-09real online RLVLA-Precisionintervention/value/preference co-bootstrap刚发布,尚待独立复现

7. 重点代表工作详细分析

7.1 VLA-RL — 2025,arXiv

Guanxing Lu, Wenkai Guo, Chubin Zhang, Yuheng Zhou, Haonan Jiang, Zifeng Gao, Yansong Tang, Ziwei Wang。

基础模型是 OpenVLA-7B,在 LIBERO 40 个任务上进行 simulator online RL。它把机器人决策重写成 multimodal token MDP,采用 PPO+GAE;奖励由 terminal success 和 Robot Process Reward Model 共同构成。论文报告相对最强 finetuned baseline 平均约 +4.5 个百分点。(arXiv)

意义: 第一批证明“大 VLA + 标准 policy-gradient machinery”可以真正 work 的工作。

局限: 真实机器人证据不足;action token 化使 PPO 容易,但不能自然代表 π0.5 之后的 flow-action 主流。


7.2 RIPT-VLA — 2025,arXiv,代码开放

Shuhan Tan, Kairan Dou, Yue Zhao, Philipp Krähenbühl。

Sparse binary success reward,无 dense reward、无 value network;核心是 dynamic rollout sampling + leave-one-out advantage + LOOP/PPO。

结果包括:

  • QueST 提升约 21.2%;
  • OpenVLA-OFT 达约 97.5% LIBERO success;
  • 1 demo 条件下,SFT 约 4% → 15 轮 RL 后约 97%。

代码已公开。(arXiv)

意义: 证明 strong pretrained VLA 下,即使 reward 极稀疏,也可能通过 group sampling 获得巨大收益。

局限: LIBERO reset 容易、reward 可自动判定,和真实机器人差距很大。


7.3 ConRFT — RSS 2025,正式发表,代码开放

Yuhui Chen, Shuai Tian, Shugao Liu, Yingting Zhou, Haoran Li, Dongbin Zhao。

两阶段:

offline: BC + Q-learning\text{offline: BC + Q-learning}

然后

online: consistency policy + human intervention.\text{online: consistency policy + human intervention}.

基于 Octo/HIL-SERL 系统。在 8 个真实机器人 manipulation task 上,论文报告平均 96.3% 成功率,只需每任务约 45–90 分钟在线 fine-tuning;相对监督方法报告成功率提升 144%、episode length 缩短约 1.9×。(Robotics Proceedings)

意义: 目前“VLA + 真机 online RL”最直接的一批证据。

局限: 人工 intervention 是关键组成部分,所以不能把性能归因于纯 autonomous RL;任务数量仍远小于 foundation pretraining。


7.4 GRAPE — ICRA 2026,代码/模型/数据开放

最终作者版本包括 Zijian Zhang, Kaiyuan Zheng, Zhaorun Chen, Joel Jang, Yi Li, Chaoqi Wang, Mingyu Ding, Dieter Fox, Huaxiu Yao。(GitHub)

这是trajectory preference optimization,不应归为传统 environment RL

流程:

τVLM{stages,keypoints,constraints}RpreferenceTPO-LoRA.\tau \xrightarrow{\rm VLM} \{\text{stages,keypoints,constraints}\} \rightarrow R_{\rm preference} \rightarrow \text{TPO-LoRA}.

覆盖 LIBERO、SimplerEnv 和真实机器人。论文报告 in-domain/unseen success 分别提升 51.79%/58.20%,collision 降低 37.44%,rollout steps 降低 11.15%。由于这些数字来自不同实验设置,不应和 VLA-RL 的百分点直接横比。(arXiv)

意义: 把“成功率”扩展到 safety/efficiency 等多目标 alignment。


7.5 APO — NeurIPS 2025,正式发表

Wenke Xia, Yichu Yang, Hongtao Wu, Xiao Ma, Tao Kong, Di Hu。

通过人在 policy failure 时介入,形成 desirable/undesirable action pairs,再进行 Action Preference Optimization。(NeurIPS Proceedings)

它更接近:

a+aa^+\succ a^-

的 preference policy improvement,而不是

maxπEπrt\max_\pi \mathbb E_{\pi}\sum r_t

意义下的 online RL。

重要性: 对真实机器人而言,人类 intervention 本身就是低成本、高信息密度的 negative data source。


8. π*0.6 / RECAP:为什么值得特别关注

这是我认为最有研究价值的路线之一。

RECAP 不强求对 flow policy 做 vanilla PPO,而是训练 value model:

Vψ(o,l)p(Greturn bins),V_\psi(o,l)\rightarrow p(G\in\text{return bins}),

计算

AtGtVψ(ot,l),A_t \approx G_t-V_\psi(o_t,l),

再把数据标成 positive/negative advantage:

cA=1[At>ϵ].c_A=\mathbf 1[A_t>\epsilon].

policy 学:

πθ(Ao,l,cA),\pi_\theta(A|o,l,c_A),

部署时:

cA=positive.c_A=\text{positive}.

也就是:

critic 判断哪些经验比预期好,generator 模仿这些“好于预期”的 action。

这比对巨大 flow policy 做精确 on-policy policy gradient 更稳。

系统还采用 Knowledge Insulation / stop-gradient、web-data co-training,以及从基础 checkpoint 重新进行每轮训练来降低 policy drift 和知识遗忘。论文报告在 laundry、espresso、box assembly 等真实长任务上显著提高吞吐和降低失败。(arXiv)

我的判断: 这类“value learning + conditional policy extraction”可能比直接把 PPO 移植到 flow VLA 更接近未来主流。


9. SimpleVLA-RL — ICLR 2026

OpenVLA-OFT + GRPO。

除了 RL 算法,贡献更偏系统:

  • 大规模并行 rollout;
  • multi-environment rendering;
  • dynamic group filtering;
  • asymmetric PPO clipping;
  • exploration temperature。

论文在 LIBERO、RoboTwin 1.0/2.0 和真实机器人上报告超过 SFT,并发现名为 pushcut 的策略行为——并非示范中的动作模式。(ICLR Proceedings)

一个尤其有价值的实验是 low-data long horizon:论文报告某 LIBERO-Long 条件从约 17.1% 到 91.7%。

意义: 这是“RL 不只是拟合 demonstrations”的少数直接行为证据之一。

但必须谨慎:

emergent strategy \neq transferable world knowledge。

它证明了策略搜索能找到新的行为,不证明模型学习了更广泛的物理世界模型。


10. ActionX — Frontiers in Neurorobotics 2026

这是目前非常少见的RL 介入 pretraining

冻结 pretrained VLM:

θVLM=const,\theta_{\rm VLM}=\text{const},

RL 优化 flow action expert:

maxθAEπθAtγtrt,\max_{\theta_A} \mathbb E_{\pi_{\theta_A}} \sum_t\gamma^tr_t,

随后用少量 expert data jointly finetune:

(θVLM,θA).(\theta_{\rm VLM},\theta_A).

作者在 LIBERO Spatial 上报告从直接 SFT 的 0% 到 RL-pretrained action expert 后约 95%,在 Long subset 上报告超过 50% 的成功率提升;真实机器人整体结果报告平均 +16%。(PubMed Central (PMC))

值得研究的观点:

VLM 的 semantic pretraining 和 motor pretraining 未必需要来自同一种数据、同一种损失。


11. VLA-MBPO:世界模型 RL

VLA-MBPO 的三阶段:

Drealtrain world modelimagined chunk rolloutsFlow-Noise PPO.D_{\rm real} \rightarrow \text{train world model} \rightarrow \text{imagined chunk rollouts} \rightarrow \text{Flow-Noise PPO}.

世界模型预测 visual transition 和 reward。

关键创新是 chunk-level branched rollout

不是

s0s1sTs_0\to s_1\to\dots\to s_T

完整 hallucination,而从 real replay buffer 中多个状态出发,仅预测短段:

stAt:t+Hs^t+H.s_t \xrightarrow{A_{t:t+H}} \hat s_{t+H}.

这样 model error 的累积 horizon 大幅缩短。论文明确分析了 world-model error 和 policy distribution shift 对 value gap 的影响。(arXiv)

基础策略为 π0.5,并在真实平台包括 Arx-X5、Galaxy-R1 等环境展示结果。官方代码目前已有 world-model/RL 训练脚本。(Rhx11111)

主要风险:

argmaxπET^[R]\arg\max_\pi \mathbb E_{\hat T}[R]

可能优化的是世界模型漏洞,而不是真实动力学。


12. Z-1 — 2026 arXiv

Lang Cao, Renhong Chen, Luyi Li, Peng Wang, Mofan Peng, Yitong Li。

基础模型 π0.5,仅用公开 RoboCasa demos 做 SFT,然后在 24 个 RoboCasa task 上 task-wise GRPO。

引入:

  • shared-prefix rollout;
  • tree trajectory branching;
  • completion-aware reward;
  • selective VLM + Action Expert joint training。

报告平均成功率 80.6%,比 SFT initialization 高 13.2 个百分点。(arXiv)

这是一个重要趋势:

RL 正从 OpenVLA action-token 时代扩展到 π0.5 类 flow VLA。


13. Offline RL:ARFM 与 RedFlow

ARFM 已发表于 AAAI 2026。它针对 flow-matching VLA 构造 adaptive reinforced flow matching,在 advantage preservation 与 flow-gradient variance 之间自适应调权,并报告 simulation + real-world 的 generalization、robustness、few-shot、continual-learning 改进。(AAAI Publications)

2026 年 7 月的 RedFlow 更进一步把 failure trajectory 分解到 action level:

failure actionretrieve successful action under similar contextcorrective target.\text{failure action} \rightarrow \text{retrieve successful action under similar context} \rightarrow \text{corrective target}.

论文在三个真实任务中报告成功率从 56.7% → 74.7%,并称样本量约低于 PPO/GRPO/DDPO 一个数量级。该工作目前是 arXiv 预印本,需要独立复现。(arXiv)

这非常值得关注,因为现实部署中:

Ddeployment=D+DD_{\rm deployment} = D^+\cup D^-

而传统 BC 几乎只利用 D+D^+


14. VLM-as-a-Reward

14.1 通用形式

rt=fϕ(otk:t,l)r_t = f_\phi(o_{t-k:t},l)

或者:

R(τ,l)=fϕ(o0:T,l).R(\tau,l)=f_\phi(o_{0:T},l).

可以是:

  • binary completion;
  • progress 010\sim1
  • temporal difference;
  • pairwise preference;
  • natural-language critique → scalar;
  • multi-objective reward。

14.2 RoboReward

Tony Lee, Andrew Wagenmaker, Karl Pertsch, Percy Liang, Sergey Levine, Chelsea Finn,2026 arXiv。

利用 OXE + RoboArena,专门构造:

  • counterfactual negative;
  • near miss;
  • temporally clipped partial completion。

这很关键,因为 OXE 本身 success-heavy;reward model 如果只见成功视频,很容易学“物体出现了”而非“任务完成了”。

作者发现没有一个现有通用 VLM 在所有 reward task 上都可靠;其 RoboReward 4B/8B 优于更大的通用模型,8B reward model 用于真实机器人 RL 时明显优于 Gemini Robotics-ER 1.5 reward,并缩小与人工 reward 的差距。(arXiv)


14.3 Large Reward Models

2026 arXiv,Yanru Wu et al.

把奖励拆成:

rt=αrprocess+βrcompletion+ηrtemporal.r_t = \alpha r_{\rm process} + \beta r_{\rm completion} + \eta r_{\rm temporal}.

开放代码支持 Pi0.5 + ManiSkill RL。

真实 pick-and-place:

38.3%SFT51.7%LRM+RL.38.3\%_{\rm SFT} \rightarrow51.7\%_{\rm LRM+RL}.

(GitHub)


14.4 VLAC

Vision-Language-Action-Critic 将:

(ot1,ot,l)(Δprogress,  done)(o_{t-1},o_t,l) \rightarrow (\Delta progress,\;done)

统一到大型多模态 critic 中,并通过异步 real-world RL + graded human intervention 做策略改进。论文在四个真实 manipulation task 上报告约 30% → 90%,200 个 real interaction episodes 左右;加入 intervention 后样本效率进一步提升。该工作截至截止日仍以预印本为主。(arXiv)


15. VLM reward 到底可靠吗?

结论:可用,但还不可信任。

典型 failure mode:

semantic shortcut+temporal blindness+goal ambiguity+OOD calibration+reward hacking\boxed{ \text{semantic shortcut} + \text{temporal blindness} + \text{goal ambiguity} + \text{OOD calibration} + \text{reward hacking} }

例如:

视觉 shortcut

任务:“put cup in sink”。

模型可能学习:

R1[cup near sink]R\approx \mathbf 1[\text{cup near sink}]

而非严格判断 inside。

terminal/progress 混淆

抓起物体看起来“更像成功”,reward 上升;policy 最后学会举着物体而不完成放置。

temporal blindness

单帧不能区分:

  • 正在关门;
  • 刚把关好的门重新打开。

linguistic brittleness

最新 ROBORMBENCH 使用 2,390 条真实机器人轨迹和 21,673 个验证过的语义改写,发现 reward VLM 会对语义等价 instruction 给出不一致判断;模型规模和 reasoning 并不能稳定解决。(arXiv)

因此好的 reward model 应额外评价:

Paraphrase Consistency,Temporal Monotonicity,Near-miss Calibration,OOD Abstention.\text{Paraphrase Consistency}, \quad \text{Temporal Monotonicity}, \quad \text{Near-miss Calibration}, \quad \text{OOD Abstention}.

而不能只报告 reward classification accuracy。


16. Preference learning / RLHF / RLAIF 在 VLA 中的位置

DPO 类目标:

LDPO=Elogσ(β[logπθ(τ+)πref(τ+)logπθ(τ)πref(τ)]).L_{\rm DPO} = -\mathbb E \log\sigma \left( \beta \left[ \log\frac{\pi_\theta(\tau^+)}{\pi_{\rm ref}(\tau^+)} - \log\frac{\pi_\theta(\tau^-)}{\pi_{\rm ref}(\tau^-)} \right] \right).

但需要严格区分:

RLHF-style preference optimization ≠ environment RL。

它可以看作 KL-regularized RL 的隐式解,但没有:

st+1T(st,at)s_{t+1}\sim T(s_t,a_t)

的主动策略探索。

VLA 中它特别适合:

  • 人为 intervention;
  • 成功/失败 rollout;
  • collision preference;
  • efficiency preference;
  • language/VLM critique。

GRAPE、APO 属于这一类。

IPO、DPO、RPO 等可以作为算法基线,但目前机器人 VLA paper 经常针对 trajectory/action representation 自定义 preference loss,而不是原封不动使用 LLM-DPO。


17. 层次 RL 和长时程 VLA

真正合理的结构很可能是:

πH(zkot,l)\pi_H(z_k|o_{\le t},l)

负责选择:

open drawer → grasp cup → move → place

πL(Akot,zk)\pi_L(A_k|o_t,z_k)

负责 0.1–1 秒 motor chunk。

其优势是信用分配 horizon 从:

T=5005000 motor stepsT=500\sim5000 \text{ motor steps}

缩短成:

K=520subtasks.K=5\sim20 \text{subtasks}.

π0.5/π0.6 已经具有高层 subtask token + 低层 flow action expert 的结构;GRAPE 也显式把任务切成 temporal stages;VLA-MBPO 从 step-level world model 转向 chunk-level planning。(GRAPE)

因此对问题:

VLA-RL 是否正从“端到端控制”转向“高层决策与低层控制解耦”?

我的答案是:

是,但不是完全 modularization,而是“representation/temporal scale 解耦 + joint training”。

2026 年 8 月的 NebulaVLA 甚至直接采用高低频异步架构,这进一步说明该趋势,不过它本身不是 RL 工作。(arXiv)


18. 为什么 BC/SFT 不足以解决长时程和 OOD?

主要不是模型容量不足,而是 objective mismatch。

18.1 Covariate shift

训练:

sdπE.s\sim d^{\pi_E}.

部署:

sdπθ.s\sim d^{\pi_\theta}.

微小误差:

ϵ1s2OODϵ2\epsilon_1 \rightarrow s_2^{OOD} \rightarrow \epsilon_2 \rightarrow \cdots

长任务 failure probability 近似:

P(success)(1ϵ)T.P(\text{success}) \approx (1-\epsilon)^T.

即使单步正确率 99.5%99.5\%,500 个独立关键决策:

0.9955008.2%.0.995^{500}\approx 8.2\%.

当然实际错误并非独立,但它说明长 horizon 对局部误差极敏感。


18.2 BC 没有 negative information

在 demonstrations 中:

P(abads)0,P(a_{\rm bad}|s)\approx0,

模型不知道:

“这个动作为什么不好”。

Preference/RL 可以显式学习:

Q(s,a+)>Q(s,a).Q(s,a^+)>Q(s,a^-).

18.3 likelihood 不等于 return

BC 最大化:

logP(aEs)\log P(a_E|s)

而真实目标可能是:

successλ1collisionλ2timeλ3energy.\text{success} -\lambda_1\text{collision} -\lambda_2\text{time} -\lambda_3\text{energy}.

GRAPE 很好地展示了这个区别:同一个 VLA 可以针对 success、safety、efficiency 使用不同 preference objective。(arXiv)


19. VLA-RL 相对传统机器人 RL 的核心变化

传统机器人 RLVLA-RL
state/proprio featureimage + language + proprio + history
小 actor1B–10B multimodal model
从随机/skill policy 开始强 pretrained policy
single tasklanguage-conditioned multitask
ata_taction token / action chunk / diffusion trajectory
engineered rewardsuccess + VLM/process/preference
millions simulator stepsexpensive GPU + robot rollouts
exploration from scratchexploration around pretrained prior
critic shares state encodersemantic multimodal critic
main risk: instabilityinstability + forgetting + language degradation

最关键的变化是:

RL no longer creates behavior from scratch; it edits a pretrained behavioral prior.\boxed{ \text{RL no longer creates behavior from scratch; it edits a pretrained behavioral prior.} }

所以 trust region、reference policy、adapter、frozen backbone 变得极为重要。


20. 与 LLM/VLM RL 后训练的异同

相似

二者都有:

pretrainSFTreward/preferenceRL.\text{pretrain} \rightarrow\text{SFT} \rightarrow\text{reward/preference} \rightarrow\text{RL}.

以及:

  • PPO/GRPO;
  • KL/reference constraint;
  • verifier/process reward;
  • DPO/preferences;
  • catastrophic forgetting。

VLA 特有问题

LLM token:

xt+1π(xxt)x_{t+1}\sim\pi(x|x_{\le t})

本身就是 environment-free sampling。

机器人:

st+1T(st,at)s_{t+1}\sim T(s_t,a_t)

涉及:

  • 未知动力学;
  • 不可逆状态;
  • 碰撞;
  • reset;
  • partial observability;
  • real-time latency;
  • sim-to-real;
  • 连续接触动力学。

因此机器人一个 RL sample 的成本可能是 LLM token sampling 的多个数量级更高。

此外 reward verifier 没那么简单:

数学题可执行:

verify(answer).\text{verify(answer)}.

机器人则经常没有可靠:

verify(video, instruction).\text{verify(video, instruction)}.

这就是 RoboReward/ROBORMBENCH 为什么重要。


21. Offline RL、Online RL、RL 后训练分别适合什么

方法最合适场景优点缺点
offline RL有大量部署日志/失败轨迹安全、便宜、可重复extrapolation/Q bias
sim online RL可构造 reliable simulator/reward强探索、并行sim2real
real online RLprecision/contact/deployment adaptation直接优化真实目标贵、危险
preference posttrain有 human/VLM pair rankingreward-free/稳定不主动探索
world-model RL有 video/transition logsimagined rolloutmodel hacking
test-time RL环境不断变化快速现场适应drift/latency
residual RLVLA 已能大体完成任务样本效率高residual/generalist 冲突

22. 真实机器人 RL 是否已经比大规模示范更有优势?

不能做这个总体结论。

证据支持的是:

BC pretraining + RL>BC pretraining only\text{BC pretraining + RL} > \text{BC pretraining only}

在一些 downstream domain。

并不支持:

RL from scratch>large-scale demonstrations.\text{RL from scratch} > \text{large-scale demonstrations}.

ConRFT、RECAP、RoboReward、LRM、VLAC、VLA-Precision 都是 strong prior 后做 RL。(Robotics Proceedings)

特别是 VLA-Precision:最新预印本报告 4 embodiment、9 个高精度 chemistry task,平均 98.3%、每任务约 45.8 分钟 online adaptation,这是非常强的“deployment RL”证据;但它仍不足以证明大规模 demonstration pretraining 不必要。(arXiv)

因此目前最合理的结论是:

demonstration provides breadth; RL provides depth and correction.\boxed{ \text{demonstration provides breadth; RL provides depth and correction.} }

23. RL 是否真正提高世界知识?

目前证据偏向 No / 未证明

RL 明显可以提高:

  • task success;
  • robustness;
  • recovery;
  • precision;
  • efficiency;
  • local generalization。

但这更多说明:

πθ\pi_{\theta'}

在更广状态区域中变得更优。

要证明学习了 transferable world knowledge,至少需要:

train RL on embodiments/tasks A\text{train RL on embodiments/tasks A}

然后:

zero-shot evaluate on B\text{zero-shot evaluate on B}

且 B 在:

  • object;
  • dynamics;
  • instruction;
  • embodiment;
  • scene

等轴上同时 hold out。

当前此类严格实验仍不充分。


24. 多机器人和跨 embodiment RL

这是一个明显空白。

OXE 本身提供跨 embodiment data,包含超过百万条真实机器人轨迹、多个机器人形态;Octo 等模型从这种数据获得 transfer。(arXiv)

但真正的 RL 阶段通常仍是:

one/small number of embodiments×task-specific RL.\text{one/small number of embodiments} \times \text{task-specific RL}.

VLA-Precision 的四 embodiment 是很有意义的新信号。(arXiv)

未来真正值得问:

Q(o,l,A,e)Q(o,l,A,e)

中的 critic 是否能够跨 embodiment ee 共享?

这甚至可能比 shared policy 更容易,因为:

“任务进展/失败”通常比具体关节运动更 embodiment-invariant。


25. Sim-to-Real 中 RL 的作用

三种主要路线:

A. sim RL → real zero-shot

使用 domain randomization:

θdynamics,θcamera,θtexture,θobjectp(θ).\theta_{\rm dynamics}, \theta_{\rm camera}, \theta_{\rm texture}, \theta_{\rm object} \sim p(\theta).

SimpleVLA-RL 在 RoboTwin→真实双臂上属于这种思路的一部分。(ICLR Proceedings)

B. sim residual RL

冻结 VLA:

at=atVLA+ΔatRL.a_t=a_t^{VLA} + \Delta a_t^{RL}.

这样:

  • semantic/generalization 由 VLA 保留;
  • precision/contact 交给 RL。

VLAJS 类工作用 VLA guidance jump-start PPO,并在 Franka 上验证 sim→real,报告部分任务减少超过 50% 环境交互。(arXiv)

C. world model → real

VLA-MBPO:

DrealT^RL in T^.D_{\rm real} \rightarrow \hat T \rightarrow\text{RL in }\hat T.

理论上是最有扩展性的路线。


26. 数据集、环境与评测基准

数据/环境类型适合研究注意事项
Open X-Embodiment大规模真实多机器人数据pretrain/cross embodimentsuccess-heavy;不是 RL benchmark
BridgeData V253,896 真实 trajectories、24 environmentsreal generalization/offline RLembodiment diversity 较有限
LIBERO130 task simulatorVLA SFT/RL、OOD、lifelongsparse +1;目前 RL 最常见
CALVINlong-horizon language benchmarksequential composition经典 avg chain length
RLBenchsimulation manipulationlanguage/task diversity与真实 VLA 数据差距较大
Meta-Worldcontinuous-control benchmarkRL algorithm sanity check视觉语言复杂度较低
ManiSkillGPU robotics simulationlarge-scale online RLdomain gap
RoboCasakitchen simulatorlong horizon/multitaskreward/task design 影响较大
RoboTwin 2.0双臂 sim/data generationbimanual/sim2realbenchmark 较新
SimplerEnvreal-to-sim VLA evaluationVLA generalizationsim ranking≠real ranking

BridgeData V2 官方统计为 53,896 条轨迹、13 类技能、24 个环境。(BridgeData V2)

LIBERO 有 130 个任务,其中 Spatial/Object/Goal 控制不同 distribution shift;LIBERO-100 又分 LIBERO-90/10。非常有趣的一点是,官方本身明确指出它只有 sparse success reward,并称 sparse-reward RL 很难,因此原始 benchmark 主要聚焦 lifelong imitation learning;这恰好解释了为什么 RIPT/SimpleVLA-RL 的进展有意义。(GitHub)

CALVIN 则专门针对语言条件的 long-horizon composition,并评测 unseen language/environment。(IEEE Xplore)

RoboTwin 2.0 提供强 domain randomization 和可规模化双臂 manipulation data generation,适合 sim→real RL。(arXiv)


27. 当前评测体系存在的主要问题

1. 过度依赖 LIBERO

大量论文:

OpenVLA-OFT+LIBERO\text{OpenVLA-OFT} + \text{LIBERO}

因此算法、基础策略和 simulator 强耦合。

99% vs 97% 的差异可能远小于真实机器人 domain shift。

2. 任务太短

“Long” 在 simulator 中仍常常只是几十到几百 policy steps。

与:

  • 10 分钟整理房间;
  • 一小时流水线;
  • 数月持续 deployment

不是同一难度。

3. baseline 不统一

不同工作使用:

  • 不同 demonstrations;
  • 不同 image resolution;
  • action chunk;
  • reward;
  • reset;
  • backbone checkpoint;
  • evaluation seeds。

因此不要跨论文直接比较成功率

4. 缺少交互成本

至少应该报告:

Nenv steps,Nresets,robot-hours,GPU-hours.N_{\rm env\ steps}, \quad N_{\rm resets}, \quad \text{robot-hours}, \quad \text{GPU-hours}.

“98% success” 和“用了多少 real robot hours”同等重要。

5. 只报告平均成功率

还应报告:

{perception,planning,grasp,contact,recovery,safety}\{\text{perception}, \text{planning}, \text{grasp}, \text{contact}, \text{recovery}, \text{safety}\}

failure taxonomy。

6. OOD 定义过弱

改变桌布颜色不等于真正 OOD。

应分:

OODobject,OODscene,OODlanguage,OODdynamics,OODembodiment.OOD_{\rm object}, OOD_{\rm scene}, OOD_{\rm language}, OOD_{\rm dynamics}, OOD_{\rm embodiment}.

7. reward benchmark 与 policy benchmark 分离

一个 reward model offline accuracy 好:

Acc(Rϕ)Acc(R_\phi)

并不能保证:

J(πRL(Rϕ))J(\pi_{RL(R_\phi)})

高。

RL 会主动寻找 reward model 的漏洞。


28. 当前共识

截至 2026-09,我认为形成了以下较强共识。

第一,BC 是必要但不充分。 Long-horizon distribution shift 和 recovery 几乎天然要求 policy-dependent data。

第二,RL 更适合 posttraining 而不是 foundation learning from scratch。

第三,binary terminal reward 出人意料地有效,但建立在很强 pretrained prior 上。 RIPT、SimpleVLA-RL 是重要证据。(arXiv)

第四,flow action policy 正迫使 RL 算法重新设计。

第五,真实机器人 RL 最可能首先在 precision/contact/deployment refinement 上获得经济价值。 ConRFT 和 VLA-Precision 都支持这一方向。(Robotics Proceedings)

第六,reward quality 和 reward robustness 已变成 VLA-RL 的基础设施问题。


29. 仍有争议的问题

RL 是否提升 generalization,还是只对训练 task 做 policy fitting?

两类结果都有。

一些论文报告 unseen object/instruction/task gain;但从 RL theory 看,如果 reward 和 rollout 仍来自 training environment:

dRLdtrain,d_{\rm RL} \approx d_{\rm train},

那么性能提升本身不能证明 semantic generalization。

process reward 是帮助还是 shortcut?

两者都可能。

越 dense:

credit assignment\text{credit assignment}\uparrow

同时:

reward misspecification risk.\text{reward misspecification risk}\uparrow.

end-to-end RL 还是冻结 backbone?

没有定论。

更新更多参数:

adaptability\text{adaptability}\uparrow

但:

forgetting/drift.\text{forgetting/drift}\uparrow.

ActionX、GRAPE、RECAP、Z-1 给出了不同折中。(PubMed Central (PMC))


30. 关键瓶颈排序

如果按我认为未来论文价值排序:

1. Reward>2. Realinteraction/exploration>3. Longhorizoncredit>4. Flowpolicyoptimization>5. Evaluation>6. Worldmodelbias>7. Crossembodimenttransfer\boxed{ 1.\ Reward > 2.\ Real interaction/exploration > 3.\ Long-horizon credit > 4.\ Flow-policy optimization > 5.\ Evaluation > 6.\ World-model bias > 7.\ Cross-embodiment transfer }

动作表示确实是瓶颈,但不是唯一瓶颈。

即使完美解决 flow likelihood,如果 reward 错:

π=argmaxπJwrong(π)\pi^* = \arg\max_\pi J_{\rm wrong}(\pi)

仍然只会更高效地 reward hack。


31. 防止灾难性遗忘和语言能力退化

可以从优化约束理解:

maxθJRL(θ)βDKL(πθπref).\max_\theta J_{RL}(\theta) - \beta D_{\rm KL} ( \pi_\theta\|\pi_{\rm ref} ).

工程策略包括:

  1. 冻结视觉/VLM,只训练 Action Expert——ActionX;
  2. LoRA/Adapter——GRAPE 等;
  3. reference policy / PPO clipping;
  4. replay robot+web pretraining data;
  5. stop-gradient/knowledge insulation——RECAP;
  6. selective joint training——Z-1;
  7. 定期从原始 pretrained checkpoint 重启后训练;
  8. 分离 critic 与 policy representation。

其中 5–7 对大 VLA 特别值得进一步研究。


32. 至少 12 个具体研究机会

#研究问题假设 / 缺口方法数据/环境主要指标MVP / 风险 / 投稿
1语义不变视觉奖励reward 应对 paraphrase invariant;当前 VLM 不满足RoboReward + contrastive consistency + uncertaintyROBORMBENCH/OXE/LIBEROreward AUC、paraphrase flip rate、RL SR先冻结 policy 测 reward;CVPR/ICLR/CoRL
2temporal reward modelvideo dynamics 比单帧 completion 更可靠video transformer + potential rewardOXE/RoboArena/Bridgemonotonicity、near-miss AUROC8–16 frame model;CVPR/CoRL
3chunk-aware GAE每个 action token 平分 trajectory reward 不合理chunk critic + option-GAELIBERO-Long/RoboTwinsuccess、gradient variance、sample efficiencyOpenVLA-OFT;ICLR/CoRL
4offline→online VLA RLoffline failures 可降低真机探索成本IQL/CQL warm-start → PPO/AWAC onlineBridge/OXE + Frankarobot episodes to 90%先 simulator mixed-quality dataset;RSS/CoRL
5VLA epistemic exploration应探索“模型不知道但安全”的状态ensemble/latent uncertainty + intrinsic rewardManiSkill/RoboCasasuccess/interactions/safety violations只训练 action adapter;ICLR/CoRL
6RL-friendly flow policyflow policy 缺 tractable improvement operatorQ-guided flow / path-policy gradientπ0.5-style + LIBEROstability、policy KL、success与 ARFM/Flow-Noise 对照;ICLR/NeurIPS
7vision encoder 与 critic 协同更新reward-relevant features ≠ BC featuresseparate LoRA + orthogonal gradientsLIBERO corruption/RLBenchrobustness、forgettingDINO/SigLIP backbone;CVPR/ICLR
8语言条件 reward calibrationlanguage paraphrase 是新 failure axisinstruction ensemble + semantic consistency regularizationROBORMBENCHflip rate、ECE、policy returnreward-only experiment 成本低;ACL/CVPR
9uncertainty-aware VLA-MBPOworld model exploitation 是 MBRL 最大风险ensemble WM + pessimistic return + rollout truncationRoboTwin/RoboCasamodel-error/return correlation先 image-latent WM;ICML/ICLR
10cross-embodiment criticvalue 比 action 更 embodiment invariantmorphology-conditioned universal Q/VOXE + 2–3 robotszero-shot value ranking、few-shot SRWidowX/Franka/Piper sim;CoRL/RSS
11safe real-VLA RLpretrained VLA 不是 safety guaranteeconstrained PPO/CPO + visual shield + HITLFranka/contact taskssuccess、collision/intervention ratesimulator + limited real validation;RSS/ICRA
12failure trajectory decompositionfailure 中只有局部 segment 错temporal credit localization + counterfactual retrievalLIBERO deployment logscorrected-action precision、SRRedFlow baseline;ICLR/CoRL
13multi-robot collaborative VLAsemantic planner 可共享,control 不同centralized VLM critic + decentralized VLA policiesmulti-arm ManiSkill/RoboTwincooperation success、communication costtwo-arm handoff;CoRL/RSS
14automatic subtask RLlong horizon 应在 skill level creditVLM subgoal proposal + option criticCALVIN/RoboCasachain length、subgoal accuracyCALVIN 5-step chains;ICLR/CoRL

33. 我最建议 CV+RL 研究者切入的三个课题

课题 A:Paraphrase-Consistent Temporal Robot Reward Model

Baselines

  • CLIP/VLM zero-shot reward;
  • RoboReward;
  • Large Reward Models;
  • frame-only progress model。

方法

学习:

Rϕ(o0:t,l)R_\phi(o_{0:t},l)

同时约束:

Rϕ(τ,l)Rϕ(τ,l~)R_\phi(\tau,l) \approx R_\phi(\tau,\tilde l)

其中:

ll~.l\simeq \tilde l.

再加入 temporal ranking:

R(o0:t+1)>R(o0:t)R(o_{0:t+1})>R(o_{0:t})

仅当轨迹真实向目标前进。

数据

  • ROBORMBENCH;
  • OXE;
  • BridgeData V2;
  • LIBERO/RoboCasa negative rollout。

指标

  • reward AUROC;
  • paraphrase flip rate;
  • expected calibration error;
  • near-miss recall;
  • downstream RL success;
  • reward-hacking rate。

预期贡献

把 reward-model evaluation 从“classification accuracy”升级到:

closed-loop policy robustness\boxed{\text{closed-loop policy robustness}}

这是我认为当前风险最低、论文价值最高的切入点。


34. 课题 B:Chunk-Aware RL for Flow-VLA

Baselines

  • SFT;
  • RIPT/GRPO;
  • SimpleVLA-RL;
  • ARFM;
  • VLA-MBPO Flow-Noise;
  • advantage-conditioned RECAP-style objective。

核心假设

当前:

R(τ)A^tR(\tau) \rightarrow \hat A_t

没有尊重 action chunk 内的 temporal structure。

研究:

Q(ot,At)Q(o_t,A_t)

以及 chunk 内 credit:

At=(at1,...,atH).A_t=(a_t^1,...,a_t^H).

例如:

At,j=Q(ot,at1:j)Q(ot,at1:j1).A_{t,j} = Q(o_t,a_t^{1:j})- Q(o_t,a_t^{1:j-1}).

数据

LIBERO-Long → RoboCasa/RoboTwin。

指标

  • long-horizon success;
  • rollout-to-success;
  • gradient variance;
  • recovery rate;
  • action smoothness;
  • KL to pretrained policy。

预期贡献

建立真正针对 diffusion/flow action chunk 的 RL credit assignment。

这是最适合强化学习算法型论文的方向。


35. 课题 C:Cross-Embodiment Offline-to-Online Critic

假设

policy:

aRdea\in\mathbb R^{d_e}

强 embodiment-specific。

而 task progress:

V(o,l)V(o,l)

相对 embodiment invariant。

所以与其强行统一所有 action policy,不如先统一:

reward/value representation\boxed{\text{reward/value representation}}

Baselines

  • embodiment-specific IQL;
  • shared IQL;
  • Octo/OpenVLA SFT;
  • ConRFT;
  • RoboReward/VLAC critic。

数据

OXE:

WidowX/Franka/Piper\rightarrow \text{WidowX/Franka/Piper}

再用少量新机器人 online experience。

指标

  • zero-shot value ranking;
  • adaptation episodes;
  • final success;
  • old-robot retention;
  • critic calibration;
  • cross-embodiment transfer ratio。

预期贡献

如果成立,可能给出比“统一 action space”更可扩展的 multi-robot RL foundation。


36. 三个月可复现调研计划

第 1–2 周:建立 imitation/VLA 基线

读:

RT-2 → OXE → Octo → OpenVLA → π0/π0.5。

跑通:

OpenVLA-OFT + LIBERO\text{OpenVLA-OFT + LIBERO}

记录:

  • task success;
  • rollout latency;
  • action chunk;
  • failure taxonomy。

第 3–4 周:重现 token-VLA RL

重点:

  • VLA-RL;
  • RIPT-VLA;
  • SimpleVLA-RL。

实现统一 RL abstraction:

rolloutrewardadvantageupdate.\texttt{rollout} \rightarrow \texttt{reward} \rightarrow \texttt{advantage} \rightarrow \texttt{update}.

对比:

PPO vs GRPO vs LOOP.\text{PPO vs GRPO vs LOOP}.

第 5–6 周:奖励模型

读:

RoboCLIP → GRAPE → RoboReward → LRM → ROBORMBENCH。

构造 benchmark:

success+near-miss+reverse+paraphrase.\text{success} + \text{near-miss} + \text{reverse} + \text{paraphrase}.

第 7–8 周:flow-policy RL

复现/分析:

  • ARFM;
  • Z-1;
  • VLA-MBPO;
  • RECAP。

重点测:

Var[θLRL]\operatorname{Var} [ \nabla_\theta L_{RL} ]

和 policy drift。


第 9–10 周:长时程与 offline→online

使用:

  • LIBERO-Long;
  • CALVIN;
  • RoboCasa/RoboTwin。

收集 mixed-quality rollout:

D=DE+Dπ+Dfail.D=D_E+D_{\pi}+D_{\rm fail}.

跑:

IQL/AWAC/CQL-style baseline + specialized VLA algorithm。


第 11–12 周:做一条自己的研究线

优先级:

  1. reward robustness;
  2. chunk credit;
  3. cross-embodiment critic。

最后的实验矩阵至少包含:

3 seeds×3 distribution shifts×3 algorithms.3\text{ seeds} \times 3\text{ distribution shifts} \times 3\text{ algorithms}.

并报告 interaction/sample cost,而不只是 success rate。


37. 推荐优先阅读的 20 篇论文

按“理解 VLA-RL 的边际价值”排序,而不是单纯按引用量:

  1. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control — VLA 范式起点。(arXiv)
  2. Open X-Embodiment — 多 embodiment 数据基础。(arXiv)
  3. Octo — 开源 generalist robot policy。(arXiv)
  4. OpenVLA — 当前 RL 研究最常见开源 backbone 之一。(DOI)
  5. π0 — flow-based VLA action generation。(Robotics Proceedings)
  6. π0.5 — open-world/hierarchical VLA。(OpenReview)
  7. VLA-RL — PPO + process reward 的早期大 VLA RL。(arXiv)
  8. RIPT-VLA — sparse reward interactive posttraining。(arXiv)
  9. ConRFT — RSS 2025,真实机器人 offline+online RL。(Robotics Proceedings)
  10. GRAPE — trajectory preference + VLM reward constraints。(arXiv)
  11. Action Preference Optimization — NeurIPS 2025。(NeurIPS Proceedings)
  12. SimpleVLA-RL — ICLR 2026 scalable GRPO。(ICLR Proceedings)
  13. π*0.6 / RECAP — advantage-conditioned real-robot learning。(arXiv)
  14. ARFM — AAAI 2026 flow offline RL。(AAAI Publications)
  15. RoboReward — reward model 的核心文献。(arXiv)
  16. Large Reward Models — online VLM reward。(arXiv)
  17. VLA-MBPO — world-model RL。(alphaXiv)
  18. Z-1 — π0.5 + GRPO。(arXiv)
  19. RedFlow — failure-driven offline flow RL。(arXiv)
  20. VLA-Precision — 截至截止日期最新的重要真实 online VLA-RL 工作之一。(arXiv)

如果专门研究 reward,再额外必读 ROBORMBENCH;它对当前 reward-VLM 的可靠性给出了非常重要的负面证据。(arXiv)


38. 最后给出一张简化“研究地图”

text
Vision-Language-Action ┌───────────┴───────────┐ │ │ Pretraining / BC RL / Post-training │ │ ┌────────────┼─────────┐ ┌───────┼────────────────────┐ │ │ │ │ │ │ OXE OpenVLA π0 Online Offline Preference/RM RL RL │ │ │ ├─ GRAPE/APO ┌────────┼──┐ ARFM/RedFlow ├─ RoboReward │ │ │ └─ LRM/VLAC PPO/GRPO real WM-RL │ │ │ VLA-RL/RIPT ConRFT VLA-MBPO Simple/Z-1 VLA-Precision action representation ┌──────────┼───────────┐ │ │ │ tokens continuous flow/diffusion │ │ PPO easy likelihood hard ┌───────────┼─────────────┐ │ │ │ ARFM Flow-Noise RECAP weighted FM path PPO adv-conditioning

这张图里真正空白最大的连接是:

robust rewardflow policy improvementlong-horizon creditcross-embodiment transfer\boxed{ \text{robust reward} \leftrightarrow \text{flow policy improvement} \leftrightarrow \text{long-horizon credit} \leftrightarrow \text{cross-embodiment transfer} }

39. 对研究方向的最终判断

如果目标是做一篇计算机视觉味更强的 VLA-RL 论文,我会优先做 视觉/视频 reward model 的可靠性、时间建模和 OOD calibration。RoboReward 与 ROBORMBENCH 之间已经形成一个很好的研究张力:一个证明“专门训练有效”,另一个证明“仍然非常脆弱”。(arxiv.org)

如果目标是做一篇强化学习算法味更强的论文,我会优先做 flow/diffusion action chunk 的 policy improvement + long-horizon credit assignment。当前 ARFM、RECAP、Flow-Noise、Z-1 分别给出了四种彼此并未统一的解法,这通常意味着底层问题远未解决。(AAAI Publications)

如果目标是做一篇机器人系统/RSS/CoRL 味更强的论文,我会做 offline failures → uncertainty-aware online refinement → 真机 deployment,并将真实 robot-hours、human intervention 次数、安全违规次数作为一等指标。ConRFT、RedFlow、VLA-Precision 已经证明这条路线有很强的实验价值,但尚没有一个公认、统一、跨机器人可复现的方法。(Robotics Proceedings)

三个最值得立即启动的项目,按我的优先级是:

  1. Paraphrase-Consistent Temporal VLM Reward——成功概率最高,算力/机器人门槛最低,同时连接 CV、VLM 与 RL;
  2. Chunk-Aware RL for Flow VLA——算法创新空间最大,最有机会形成长期研究线;
  3. Cross-Embodiment Critic + Offline-to-Online RL——风险最高,但一旦证明 value/reward transfer 明显优于 action-space unification,潜在影响最大。

这三个方向分别击中了当前 VLA-RL 的三个核心未解问题:“奖励什么”“怎样更新”“知识能否跨机器人迁移”。

Domanda

MinerU团队调研.md

我在用 MinerU 做 PDF/文档解析(版面分析、表格结构、公式识别、阅读顺序等)。请评估用强化学习(RL)优化它的可行性,若可行再给出一套可落地的实施方案。

请先判断:MinerU 流程中哪些环节具备可验证的奖励信号、适合 RL;哪些环节奖励模糊,更适合继续用 SFT 或规则后处理;在什么条件下 RL 才值得做,什么情况下投入产出比不划算。

若部分可行,请给出从实际出发的方案:

  1. 优先优化哪个子任务及理由;
  2. 奖励函数设计(指标、权重、防作弊约束);
  3. 数据与冷启动:所需标注/伪标注规模、构造方式,是否先 SFT 再 RL;
  4. 算法与工程:推荐算法、基座模型、算力规模、训练与推理框架;
  5. 评测与迭代:评测集、基线对比、上线验收标准;
  6. 一个最小验证实验(MVP),先小规模验证收益再决定是否扩大投入。

请同时给出成本、周期、风险与预期收益的现实估计,以及不做 RL 时的替代优化方案。

Pensiero

从现有证据看,RL 的收益并不会平均分布在所有解析环节。MinerU2.5-Pro 的消融很说明问题:大规模数据 SFT 带来 +1.31,hard-sample SFT 再带来 +0.96,而 GRPO 只再带来 +0.45;RL 的主要增益集中在公式 CDM(96.48→97.29)和表格 TEDS(92.87→93.42),而文本 Edit 基本不再变化。
这意味着对你们实际工程,先把 RL 预算打在“结构化、高熵、可程序验证”的输出上,而不是整条 MinerU 流程端到端重训,投入产出比会明显更好。

Worked for 1m 14s

Risposta

可以,而且不是“理论上可行”:MinerU2.5-Pro 已经实际使用 GRPO 做最后一阶段的 metric alignment。但更重要的结论是:** RL 只适合 MinerU 中少数“高结构性 + 可程序验证 + SFT loss 与最终指标存在明显错配”的子任务。把整条 PDF→Markdown 流程端到端 RL 化,我不建议。**

附件里梳理的 MinerU 路线本身已经很适合做这种拆分:早期 pipeline 把版面、公式、OCR 等拆成组件,MinerU2.5 又采用“低分辨率全局布局 → 原分辨率局部识别”的 coarse-to-fine VLM,而 MinerU-Popo 则进一步把标题层级、跨页结构等交给独立后处理。(MinerU团队调研.md) (MinerU团队调研.md)

外部核验还补充了附件中一个很关键的信息:MinerU2.5-Pro 的三阶段训练是 65.5M 大规模预训练/SFT → 192K 高质量 hard-sample SFT → GRPO;最后的 GRPO 直接用 Text Edit、Formula CDM、Table TEDS、Layout IoU 作为奖励,G=16G=16,并采用 dynamic sampling/clip-higher。(arXiv)


一、先给结论:哪些环节值得 RL?

我的优先级是:

复杂表格>复杂公式>阅读顺序>生成式版面输出普通OCR>文档级语义结构\boxed{ \text{复杂表格} > \text{复杂公式} > \text{阅读顺序} > \text{生成式版面输出} \gg \text{普通OCR} > \text{文档级语义结构} }

其中前四类“可做”,前两类“最值得做”。

MinerU 环节奖励可验证性RL 适配度我的建议
表格结构识别很高:TEDS/TEDS-S、cell F1、HTML validity★★★★★首选
公式识别很高:CDM、LaTeX canonical match、render consistency★★★★★第二优先
阅读顺序高,但依赖可靠 element matching★★★★☆复杂多栏文档值得
VLM 版面输出高:class IoU/mAP★★★☆☆能做,但 SFT/detection loss 通常更划算
普通文本 OCR很高:NED/CER/WER★★☆☆☆通常不值得单独 RL
跨页表格合并中高:有 GT 可算 relation F1★★★☆☆先 SFT/规则
标题层级中:tree-TEDS 可算,但存在语义歧义★★☆☆☆MinerU-Popo/SFT 更合适
段落合并/截断恢复★★☆☆☆SFT + heuristic
图文关联★★☆☆☆classification/ranking 比 RL 简单
Markdown/JSON 合法性极高★☆☆☆☆不要 RL,直接 constrained decoding
图表语义理解低~中★★☆☆☆奖励模型/SFT 优先

OmniDocBench 本身已经提供了非常合适的自动指标:纯文本使用 normalized edit distance,表格使用 TEDS 与 edit distance,公式有 CDM/NED/BLEU,阅读顺序也使用 normalized edit distance。(Open Access CVF)


二、为什么我不建议“整条 MinerU 做 RL”

MinerU2.5-Pro 自己的消融几乎已经回答这个问题。

同一 1.2B 架构:

阶段OmniDocBench v1.6 Full增益
MinerU2.5 baseline92.98
大规模数据 SFT94.29+1.31
Hard-sample SFT95.25+0.96
GRPO95.69+0.45

其中 GRPO 后:

  • Text Edit:0.036 → 0.036,基本不变
  • Formula CDM:96.48 → 97.29,+0.81
  • Table TEDS:92.87 → 93.42,+0.55。(arXiv)

所以真实结论不是:

RL 比 SFT 更强。

而是:

Data/SFT 建能力,RL 对齐 sequence-level metric。\boxed{ \text{Data/SFT 建能力,RL 对齐 sequence-level metric。} }

MinerU2.5-Pro 论文自己也明确认为当前主要瓶颈首先是训练数据 coverage、informativeness 和 annotation quality,而不是架构本身。(arXiv)


三、什么时候 RL 才真的值得做?

我建议在开项目之前先做四个 gate。

Gate 1:SFT 已经够强

设一个 hard sample 输入 xx,采样 GG 个输出:

y1,,yGπθ(yx).y_1,\dots,y_G\sim\pi_\theta(y|x).

如果所有输出都错:

R1R20,R_1\simeq R_2\simeq\dots\simeq0,

GRPO 没有学习信号。

如果全部都对:

R11,R_1\simeq\dots\simeq1,

同样没有学习信号。

真正适合 RL 的数据满足:

Var(R1:G)>0.\operatorname{Var}(R_{1:G})>0.

实践上我会先取 2–5k hard samples,每个 temperature sampling 8 次。如果至少约 20–60% 样本存在明显 candidate quality variance,再考虑 RL。

MinerU2.5-Pro 正是过滤掉 reward 太高和太低的样本,只保留中间 reward 区间,并丢掉 zero-variance rollout group。(arXiv)


Gate 2:reward 和人类判断真的一致

最低要求不是:

“可以自动计算 reward”。

而是:

RautoRhuman.R_{\rm auto}\approx R_{\rm human}.

在 500–1000 个 hard case 上人工双标,我希望看到:

  • Spearman >0.8>0.8,最好 >0.85>0.85
  • catastrophic error 排序 recall >90%>90\%
  • reward top-1 候选被人类选为最好结果 >80%>80\%

达不到这些标准,不要 RL

因为 RL 最擅长的事情之一就是找到 reward 的漏洞。


Gate 3:SFT loss 和最终指标确实错配

例如表格模型用 CE:

LSFT=tlogpθ(yty<t,x).L_{\rm SFT} = -\sum_t\log p_\theta(y_t^*|y_{<t},x).

它认为:

  • 一个 <td> 错;
  • 一个数字错;

本质上都是 token error。

但实际业务可能认为:

错一个 rowspan 导致整张表结构错位,比错一个标点严重几十倍。

TEDS:

RTEDS(y,y)R_{\rm TEDS}(y,y^*)

能够直接体现树结构破坏。

这就是 RL 真正有价值的情况:

Ltoken∝̸Lbusiness/structure.\boxed{ L_{\rm token} \not\propto L_{\rm business/structure}. }

CVPR 2026 的 FD-RL 也发现 RL 增益主要集中在高熵 formatted content——公式和表格,而不是 plain text。(Open Access CVF)


Gate 4:错误主要不是“没见过”

如果线上失败主要来自:

  • 新语言;
  • 新文档模板;
  • 手写体;
  • 极低分辨率;
  • 特殊科学符号;
  • 新式财报表格;

那么第一选择应该是:

补数据 > RL\boxed{\text{补数据 > RL}}

而不是 RL。

MinerU2.5-Pro 从不足 10M 扩到 65.5M 数据并针对长尾 hard cases 做数据工程,本身就是非常强的证据。(Hugging Face)


四、我最建议优化的子任务:复杂表格结构识别

如果你只能做一个,我选:

Hard Table Structure Recognition

尤其是:

  • merged cells;
  • rowspan/colspan;
  • 无线表;
  • 多级表头;
  • 表内图片;
  • rotated table;
  • 密集财务表;
  • 跨页表格中的单页结构段。

理由有四个。

第一,奖励非常可验证

HTML/tree 本身就是程序化结构:

predicted HTMLGT HTML.\text{predicted HTML} \leftrightarrow \text{GT HTML}.

第二,CE 和结构指标错配明显,所以 RL 有真实优化空间。

第三,表格输出有丰富 candidate diversity:

同一图像多个貌似合理但结构不同的 HTML.\text{同一图像} \rightarrow \text{多个貌似合理但结构不同的 HTML}.

第四,已有独立论文证据。CVPR 2026 FD-RL 在 OmniDocBench 上证明 format-specific GRPO 有效,而且消融中 RL 对 table TEDS/TEDS-S 的收益尤其明显。(Open Access CVF)

同时要看到 ceiling:MinerU2.5-Pro 当前已经达到较高 table performance,且 Hard 表格的巨大改善更多来自数据与 hard-SFT,而非 GRPO 本身。(arXiv)

所以如果你当前已经直接使用 MinerU2.5-Pro-2604/2605,RL 项目的收益预期应该保守;如果你有自己的 domain hard tables,机会会大很多。


五、推荐奖励函数

不要直接只用:

R=TEDS.R=\text{TEDS}.

我建议第一版:

Rtable=0.40Rstruct+0.25RTEDS+0.20Rtext+0.10Rrender+0.05RvalidP\boxed{ R_{\rm table} = 0.40R_{\rm struct} + 0.25R_{\rm TEDS} + 0.20R_{\rm text} + 0.10R_{\rm render} + 0.05R_{\rm valid} -P }

其中所有正向项 normalization 到 [0,1][0,1]

5.1 Structure reward:40%

使用 TEDS-S 或纯结构 tree edit similarity:

Rstruct=TEDS-S(T^,T).R_{\rm struct} = \operatorname{TEDS\text{-}S} (\hat T,T^*).

重点奖励:

  • 行列数;
  • rowspan;
  • colspan;
  • cell hierarchy。

这是核心 reward。


5.2 完整 TEDS:25%

RTEDS=TEDS(T^,T).R_{\rm TEDS} = \operatorname{TEDS}(\hat T,T^*).

加入 cell content 后避免:

“结构完全正确,但里面全是空 cell”。


5.3 Cell text:20%

先通过结构匹配得到 cell correspondence:

M={(c^i,cj)}.M=\{(\hat c_i,c_j^*)\}.

然后:

Rtext=1M(i,j)M(1NED(t^i,tj)).R_{\rm text} = \frac{1}{|M|} \sum_{(i,j)\in M} (1-\operatorname{NED}(\hat t_i,t_j^*)).

5.4 Render consistency:10%

把 predicted HTML 和 GT 渲染到统一 canonical style:

Iy^=Render(y^).I_{\hat y} = \operatorname{Render}(\hat y).

比较:

  • grid/line IoU;
  • cell occupancy map;
  • row/column geometry。

比用一个通用 VLM judge 安全得多。


5.5 Validity:5%

例如:

Rvalid=1[HTML parse successno invalid spans].R_{\rm valid} = \mathbb 1[ \text{HTML parse success} \land \text{no invalid spans} ].

但这里其实最好直接用 constrained decoding,而不是靠 reward 学。


六、防 reward hacking

至少加入以下硬约束。

1. 空表作弊

如果:

Ncellpred<0.5NcellgtN_{\rm cell}^{pred} < 0.5N_{\rm cell}^{gt}

直接施加 penalty。


2. 重复内容作弊

检测 abnormal repetition:

ρrepeat=repeated tokensall tokens.\rho_{\rm repeat} = \frac{\text{repeated tokens}} {\text{all tokens}}.

超过阈值:

Prepeat>0.P_{\rm repeat}>0.

3. 超长 HTML

GRPO 可能通过堆结构提高部分 matching score。

加入:

Plen=λmax(0,LpredLrefc).P_{\rm len} = \lambda \max \left( 0, \frac{L_{\rm pred}} {L_{\rm ref}} -c \right).

建议 c=1.31.5c=1.3\sim1.5


4. TEDS metric hacking

一定要在另外一套指标验收:

training reward=TEDS/TEDS-S\text{training reward}=TEDS/TEDS\text{-}S

但 holdout 还测:

  • row/column F1;
  • cell adjacency F1;
  • render metric;
  • human error severity。

否则非常容易得到:

TEDS,实际可用性不变.TEDS\uparrow,\quad \text{实际可用性不变}.

七、公式任务怎么做

如果你们线上痛点其实是公式,方案同样成立。

我会使用:

Rformula=0.45RCDM+0.20Rcanonical Latex+0.20Rrender+0.10Rsymbol+0.05Rvalid.R_{\rm formula} = 0.45R_{\rm CDM} + 0.20R_{\rm canonical\ Latex} + 0.20R_{\rm render} + 0.10R_{\rm symbol} + 0.05R_{\rm valid}.

其中:

CDM

直接和现有 benchmark 对齐。

Canonical LaTeX

把:

latex
{a \over b}

latex
\frac{a}{b}

先 canonicalize,再算 edit similarity。

Render reward

If^=MathJax(f^)I_{\hat f} = \operatorname{MathJax}(\hat f)

和 GT render 比较。

这可以减少“字符串不一样、视觉和数学结构却等价”的错误奖励。

MinerU2.5-Pro 的 Stage 3 中,GRPO 对公式的增量实际上比表格更明显:CDM 从 96.48 升到 97.29。(arXiv)


八、阅读顺序:可做,但排第三

阅读顺序可以定义为 permutation:

π=(e1,e2,,en).\pi=(e_1,e_2,\dots,e_n).

我不建议单独用 edit distance,而是:

Rorder=0.50(1NED)+0.30RKendall+0.20Rprecedence.R_{\rm order} = 0.50(1-\operatorname{NED}) + 0.30R_{\rm Kendall} + 0.20R_{\rm precedence}.

其中 pairwise precedence:

Rprecedence={(i,j):i<j in GT and pred}{(i,j):i<j in GT}.R_{\rm precedence} = \frac{ |\{(i,j):i<j \text{ in GT and pred}\}| }{ |\{(i,j):i<j\text{ in GT}\}| }.

最大的问题反而不是 RL,而是:

element matching。

OmniDocBench v1.5 就出现过一个严重问题:预测和 GT 只是 segmentation granularity 不一样,却得到很低分;v1.6 因此专门设计了 Multi-Granularity Adaptive Matching。(arXiv)

所以做 reading-order RL 前,要先解决:

匹配问题 > 排序问题.\boxed{\text{匹配问题 > 排序问题}.}

否则 reward 本身就是错的。


九、为什么普通 OCR 不建议做

理论上可以:

ROCR=1CER.R_{\rm OCR}=1-\operatorname{CER}.

但一般不值得。

因为 CE:

logp(yt)-\log p(y_t^*)

和 CER/NED 已经高度一致。

而且普通 text token entropy 较低。FD-RL 的研究正是发现 formatted text 的输出 entropy 比 plain text 高很多,因此专门筛选公式/表格做 RL。(Open Access CVF)

这里通常:

hard-sample mining + SFT>GRPO.\boxed{ \text{hard-sample mining + SFT} > \text{GRPO}. }

十、标题层级、跨页段落等为什么更适合 SFT/Popo

例如判断:

“2.3.1”是不是三级标题?

有时可以规则验证。

但:

“Experimental Results”究竟是二级还是三级?

高度依赖整个 document semantics。

同样,跨页两个段落是否应合并,经常没有唯一形式。

这种情况下 reward:

R(y)R(y)

并不客观。

MinerU-Popo 就选择了更传统的路线:用约 30K task-oriented 数据 fine-tune Qwen3-VL-4B,处理 text/table truncation recovery、title hierarchy 和 image-text association,而不是把这些任务 RL 化。(arXiv)

我认为这个选择是合理的。


十一、数据与冷启动方案

推荐:

SFThard miningGRPO\boxed{ \text{SFT} \rightarrow \text{hard mining} \rightarrow \text{GRPO} }

而不是直接 RL。


阶段 A:建立 golden evaluation set

先做 1,000–2,000 个高质量 hard table crops

不要用于训练。

按业务分层:

  • financial reports;
  • academic papers;
  • textbooks;
  • invoices;
  • forms;
  • scanned;
  • borderless;
  • merged-cell;
  • multilingual。

要求双人 review。

这是整个项目最重要的资产。


阶段 B:SFT 数据

MVP:

2–5 万张 table crops 足够。

来源推荐:

  1. 现有 MinerU 解析日志;
  2. 当前模型低置信/high entropy case;
  3. PubTabNet/FinTabNet 等公开数据;
  4. HTML → screenshot synthetic;
  5. 多模型一致性 pseudo-label;
  6. 人工修正最难的 2k–5k。

MinerU2.5-Pro 使用的思想值得直接复制:多模型 consistency 筛标注,再对 hard case 做 render-then-verify。(arXiv)


阶段 C:RL 数据

不需要把所有 SFT 数据重新 RL。

我建议从 20–50k SFT data 中筛:

5k20k5k\sim20k

个真正 high-information samples。

用 SFT checkpoint 对每个输入采样 8 个 response:

y1,,y8.y_1,\dots,y_8.

计算:

Rˉ,σR.\bar R,\quad\sigma_R.

保留:

0.3<Rˉ<0.950.3<\bar R<0.95

且:

σR>ϵ.\sigma_R>\epsilon.

具体阈值要根据 reward distribution 定。

这个思想和 MinerU2.5-Pro 的 mid-reward filtering 完全一致。(arXiv)


十二、推荐算法

首选:GRPO / DAPO-style GRPO

不是 PPO。

原因:

  1. deterministic verifier,不需要 reward model;
  2. 不需要 critic;
  3. document OCR 是单轮 response generation;
  4. candidate group comparison 自然;
  5. 已被 MinerU2.5-Pro、FD-RL、Infinity Parser 验证。

GRPO:

Ai=RiμRσR+ϵA_i = \frac{ R_i-\mu_R }{ \sigma_R+\epsilon }

然后:

L=1Gimin[riAi,clip(ri,1ϵc,1+ϵc)Ai].L = -\frac1G \sum_i \min \left[ r_iA_i, \operatorname{clip} (r_i,1-\epsilon_c,1+\epsilon_c)A_i \right].

MinerU2.5-Pro 本身采用 G=16G=16,并结合 DAPO 的 clip-higher 和 dynamic sampling。(arXiv)


十三、哪些算法我不推荐第一版用

PPO + learned critic: 没必要增加一个价值模型。

DPO: 可以做 preference pair,但你已经有精确 scalar reward,信息利用率不如 GRPO。

RLHF/RLAIF: 文档解析能程序验证的地方就不要用 VLM judge。

SAC/TD3: 这是单次序列生成,不是连续控制 MDP,不合适。


十四、基座模型选择

如果目标是“改 MinerU”

直接以:

MinerU2.5-2509-1.2B

或你们自己的 pre-RL SFT checkpoint 为基座。

MinerU2.5 官方架构是:

  • NaViT 约 675M;
  • Qwen2 约 0.5B;
  • 总计约 1.2B;
  • coarse-to-fine two-stage parsing。(arXiv)

不要直接拿 MinerU2.5-Pro final checkpoint 来证明 RL 有用。

因为它已经做过 GRPO,容易出现 ceiling。


十五、参数怎么更新

MVP

只训:

  • LLM LoRA;
  • 或 action/output decoder 部分。

冻结:

  • vision encoder。

好处是便宜、稳定。

如果 MVP 成功

第二轮尝试:

  • LLM full;
  • projector;
  • ViT 使用非常小 LR。

官方 MinerU2.5-Pro Stage 3 实际全部参数可训练,但:

ηViT=107\eta_{\rm ViT}=10^{-7}

而:

ηLLM=105.\eta_{\rm LLM}=10^{-5}.

说明实际上也是在强烈限制视觉表征漂移。(arXiv)


十六、训练框架

我会分两个档位。

快速 MVP

Hugging Face TRL + PEFT + vLLM

TRL 现在已经原生支持 VLM GRPO,并支持 image input、LoRA 和 vLLM rollout;Qwen2/2.5-VL 是官方测试模型之一。MinerU 自定义模型可能需要写 processor/model adapter。(Hugging Face)

正式规模

verl + FSDP + vLLM/SGLang

verl 已有 multimodal GRPO、FSDP、vLLM/SGLang 支持,更适合:

  • 多 GPU;
  • rollout/training 解耦;
  • dynamic sampling;
  • 自定义 reward;
  • 大量并行 generation。(Verl)

附件也记录了 MinerU 2.5 之后已有 vLLM/SGLang 推理支持,因此工程栈并不冲突。(MinerU团队调研.md)


十七、最小验证实验 MVP

这是我最推荐你实际去做的版本。

目标

验证:

在相同训练数据和近似额外算力下,GRPO 是否优于继续做一轮 hard-table SFT?

这个对照比“RL vs 原始 MinerU”重要得多。


数据

训练:

  • 10,000 hard tables;
  • 其中 70% real;
  • 30% synthetic;
  • 保证 GT HTML 经过 render verification。

验证:

  • 500。

测试:

  • 1,000,完全不参与 hard mining;
  • 至少 30% 来自不同 document source/domain。

模型

MinerU2.5-1.2B。

先做:

Hard-SFT checkpoint\text{Hard-SFT checkpoint}

然后复制两份:

Baseline A

继续相同训练 token 数量的 SFT。

Experiment B

GRPO。

这样控制 compute/data confound。


GRPO 参数

第一轮无需复刻官方 G=16G=16

建议:

G=4G=4

先跑。

如果 reward variance 不足,再:

G=8.G=8.

LoRA rank 16/32 足够 MVP。

Temperature:

0.60.90.6\sim0.9

目标是制造有意义的 candidate diversity,而不是追求 deterministic OCR。


十八、MVP reward

初始保持简单:

R=0.50TEDS-S+0.30TEDS+0.20(1NEDcell)P.R = 0.50\,TEDS\text{-}S + 0.30\,TEDS + 0.20(1-NED_{\rm cell}) -P.

不要加入 VLM reward

先证明:

纯可验证奖励也能提升。\boxed{\text{纯可验证奖励也能提升。}}

后续再加 render-based reward。


十九、MVP 必须做的四个 baseline

必须同时比较:

方法用途
原始 MinerU2.5基础参考
Hard-SFT证明数据本身的收益
Hard-SFT + additional SFT最关键 compute-matched baseline
Hard-SFT + GRPO实验组

额外强烈建议再加:

Best-of-4 + reward reranking

即不训练:

y=argmaxi4R(yi).y^* = \arg\max_{i\le4}R(y_i).

它非常重要。

因为如果 Best-of-4 已经解决问题,那么你可能根本不需要 RL。


二十、MVP 什么结果才算成功?

我不会以:

“TEDS +0.2”

作为成功。

建议 Go/No-Go 标准:

必须满足

Hard table:

ΔTEDS-S+1.0\Delta TEDS\text{-}S\ge +1.0

或:

ΔTEDS+1.0.\Delta TEDS\ge +1.0.

同时至少一个结构错误指标:

row/col adjacency F1+1.5pp.\text{row/col adjacency F1}\ge+1.5pp.

不允许

普通文本退化:

ΔCER<0.2pp.\Delta CER<0.2pp.

公式退化:

ΔCDM>0.2pp.\Delta CDM>-0.2pp.

正常简单表格:

ΔTEDS>0.3.\Delta TEDS>-0.3.

HTML validity:

99.5%.\ge99.5\%.

最重要

在自己的 production holdout 上:

ΔTEDS0.5\Delta TEDS\ge0.5

或 business metric 有明确改善。

如果只在 OmniDocBench 涨、真实业务不涨:

停止扩大投入。


二十一、如果做 reading-order MVP

这是另一个低成本选择。

把 VLA 问题降维成:

输入所有 detected blocks + page image → 输出 block ID permutation。

这比整页 Markdown RL 便宜很多。

例如:

text
<block_7> <block_2> <block_3> ...

奖励:

R=0.5(1NED)+0.3Kendall+0.2PairwiseF1.R = 0.5(1-NED) + 0.3Kendall + 0.2PairwiseF1.

这样 response 很短,rollout 成本可能降低一个数量级。

如果你真正的线上痛点是:

  • 双栏论文;
  • 研报;
  • 报纸;
  • sidebar;
  • footnote;

我反而建议这个作为成本最低的 RL research prototype


二十二、成本估算

以下是工程估算,不是论文报告数字;假设 1.2B 模型、80GB GPU、PEFT、已有 MinerU 数据/推理基础设施。

规模数据GPU预计周期计算量级
Reward feasibility2–5k1–2 GPU3–5 天10–30 GPUh
MVP10k RL4×A100/H1002–3 周50–200 GPUh
Pilot20–50k8 GPU4–6 周300–1,500 GPUh
Full100–200k16–64 GPU2–3 月数千到上万 GPUh

为什么 full 会迅速变贵?

普通 SFT 每个输入生成一次 teacher-forced sequence。

GRPO:

Nrollout=Nsample×G.N_{\rm rollout} = N_{\rm sample}\times G.

MinerU2.5-Pro 官方:

192K×163.07M192K\times16 \approx3.07M

candidate rollouts。(arXiv)

所以“模型只有 1.2B”不代表完整 RL stage 很便宜。


二十三、人力和标注成本

对这个项目,GPU 通常不是最大的未知成本,GT quality 才是。

复杂表格人工修一张可能远比 OCR text 贵。

我会预算:

MVP

  • 1 名研究/算法工程师;
  • 1 名数据工程师兼职;
  • 1–2 名 annotator/专家 part-time;
  • 2–3 周。

Production pilot

  • 2 名算法;
  • 1 名数据;
  • 2–4 名 QA/标注;
  • 4–6 周。

如果已有可靠 HTML GT 和内部解析日志,成本会显著下降。


二十四、现实的收益预期

如果你当前还是 MinerU2.5 或自有 SFT 模型

Hard tables

合理目标:

+13  TEDS+1\sim3\;TEDS

在 targeted domain 上并非不现实。

Formulas

合理目标:

+0.51.5  CDM+0.5\sim1.5\;CDM

更现实。

Overall benchmark

不要预期很大。

MinerU2.5-Pro 自己的 RL 阶段也只有整体:

+0.45.+0.45.

(arXiv)

如果你已经直接在用 MinerU2.5-Pro

我会把预期再砍一半。

这时最值得做的不是复制它的 generic GRPO,而是:

domain-specific RL alignment\boxed{\text{domain-specific RL alignment}}

例如:

  • 财报复杂表格;
  • 中文科技公式;
  • 化学论文;
  • 专利;
  • 扫描档案;
  • 特殊双栏/多栏材料。

二十五、最大技术风险

风险 1:Reward overfitting

TEDSTEDS\uparrow

但人类认为没有更好。

解决: multi-metric reward + hidden metrics + human review。


风险 2:Benchmark overfitting

OmniDocBench 已经相当成熟,而且头部模型越来越接近饱和。你的附件也特别指出了这一点。(MinerU团队调研.md)

解决: 至少保留一个 internal OOD benchmark。


风险 3:GRPO zero variance

SFT 太强时:

R1==RG.R_1=\dots=R_G.

解决:

  • entropy/hardness screening;
  • dynamic sampling;
  • 增大 temperature;
  • 只训 hard subset。

这既是 MinerU2.5-Pro 的做法,也与 FD-RL 的 entropy filtering 相符。(arXiv)


风险 4:忘掉普通样本

Hard RL 可能造成:

Phard,Peasy.P_{\rm hard}\uparrow,\quad P_{\rm easy}\downarrow.

解决:

  • reference KL;
  • replay;
  • LoRA;
  • low LR;
  • mixed evaluation。

MinerU2.5-Pro 在 hard SFT 阶段就用不同 replay ratios 来防止 catastrophic forgetting。(arXiv)


二十六、如果不做 RL,我反而会优先尝试什么?

这是项目决策中非常重要的一部分。

方案 A:Hard-sample mining + SFT

第一优先级。

用:

H(x)H(x)

entropy、模型不一致度、当前 evaluator score 找 hard case。

然后人工/伪标签修正。

这是 MinerU2.5-Pro 最大的收益来源。(arXiv)


方案 B:Cross-model consistency

让:

  • MinerU;
  • PaddleOCR-VL;
  • 另一个专业 parser;

共同解析。

高一致:

pseudo GT\rightarrow pseudo\ GT

低一致:

human/JudgeandRefine.\rightarrow human/Judge-and-Refine.

这是比盲目扩数据更好的数据工程。


方案 C:Best-of-N + verifier

如果已有可靠 reward:

y1,,yNy_1,\dots,y_N

然后:

y=argmaxR(yi).y^*=\arg\max R(y_i).

优点:

  • 不训练;
  • 没有 forgetting;
  • 两三天即可验证 reward 的实际价值。

缺点是 inference ×N。

但它是决定要不要做 RL 的最佳前置实验


方案 D:RFT / rejection sampling SFT

生成多个答案。

留下:

R(y)>tR(y)>t

的高 reward 输出。

再 SFT:

D=DGTDhighreward.D'=D_{GT}\cup D_{\rm highreward}.

这是 RL 与 SFT 之间非常好的中间点。

往往成本只有 GRPO 的一小部分。


方案 E:Constrained decoding

HTML、JSON、LaTeX syntax validity:

不要浪费 RL 学它。

直接:

  • CFG;
  • finite-state constraints;
  • HTML grammar;
  • XML parser constraints。

方案 F:Hybrid pipeline

如果一个 specific component 一直是瓶颈:

  • formula → UniMERNet;
  • layout → DocLayout-YOLO;
  • generic VLM → fallback/recognition。

附件也说明 MinerU 原始系统本来就是这种组件化思路。(MinerU团队调研.md)

对于 production,这经常比重新训练大模型可靠。


方案 G:Popo 类 document postprocessing

如果问题是:

  • 标题层级;
  • 跨页段落;
  • 跨页表格;
  • 图文关联;

用专门 postprocessor 会比把 parser 全参数 RL 更干净。MinerU-Popo 就是现成证据。(arXiv)


二十七、我建议的真实决策树

text
线上 MinerU 有明显错误 ├── 是“没见过这种文档”? │ │ │ └── YES → 数据工程 + Hard SFT ├── 是语法/格式非法? │ │ │ └── YES → constrained decoding / rules ├── 是跨页/标题/段落语义问题? │ │ │ └── YES → Popo / SFT / reranker └── 是表格/公式/阅读顺序的 sequence-level structural error? YES 有没有可靠自动 evaluator? ┌────────┴────────┐ NO YES │ │ SFT/标注 Best-of-N 是否明显提升? ┌────────┴─────────┐ NO YES │ │ 模型没有探索空间 GRPO MVP →继续 SFT │ 是否超过 compute- matched SFT ≥1点? ┌────────┴───────┐ NO YES │ │ 停止 扩大 RL

二十八、我的具体执行建议

如果现在由我负责这个项目,我会这么安排:

第一周不训练 RL。 从真实 MinerU 日志中抽 2,000 个最困难 table/formula case,建立 clean evaluator。每个输入从现有模型采样 8 次,画出:

Rˉvs.σR.\bar R \quad vs.\quad \sigma_R.

同时测试 Best-of-8 oracle:

Roracle=maxiRi.R_{\rm oracle} = \max_iR_i.

最关键的一个数字是:

Δsearch=RoracleRgreedy.\Delta_{\rm search} = R_{\rm oracle} - R_{\rm greedy}.

如果:

Δsearch0,\Delta_{\rm search}\approx0,

不要做 RL。

因为模型的输出分布里根本没有更好的答案。

如果:

Δsearch\Delta_{\rm search}

明显,例如 hard-table TEDS 存在 +3~10 的 oracle gap,那么说明模型“知道怎么做,只是 greedy policy 没选对”,这是 GRPO 最适合的区域。

第二周做 Hard-SFT vs Best-of-N vs GRPO 三方 MVP。

第三周只看 internal OOD 和 failure taxonomy 决定是否扩大。


最终建议

结论

MinerU 做 RL:部分非常可行,但应该非常克制。

如果目标是改进当前实际系统,我会把资源分成:

70%  数据/Hard-SFT+20%  结构化 RL+10%  规则/后处理\boxed{ 70\%\;\text{数据/Hard-SFT} + 20\%\;\text{结构化 RL} + 10\%\;\text{规则/后处理} }

而不是倒过来。

最值得立即启动

复杂表格结构的 GRPO metric alignment。

推荐路线:

MinerU2.5domain hard-table SFTentropy/reward-variance filteringGRPO\boxed{ \text{MinerU2.5} \rightarrow \text{domain hard-table SFT} \rightarrow \text{entropy/reward-variance filtering} \rightarrow \text{GRPO} }

奖励第一版:

0.5TEDS-S+0.3TEDS+0.2(1NEDcell)P\boxed{ 0.5\,TEDS\text{-}S + 0.3\,TEDS + 0.2(1-NED_{\rm cell}) -P }

MVP:

  • 10k hard samples;
  • 1k clean OOD test;
  • G=4G=4
  • LoRA;
  • 4×80GB GPU;
  • 2–3 周;
  • 必须与相同额外训练量的 SFT 做 compute-matched comparison

只有当 RL 在 hard/OOD set 上相对 additional SFT 达到 约 +1 absolute TEDS/TEDS-S,且 easy/general OCR 无明显退化,我才会扩大项目。

这是一个比“直接复刻 MinerU2.5-Pro 的 192K×16 GRPO”风险和成本低得多、同时足以验证核心假设的方案。

Condividi questa Q&A