VLA
除了语言模型的后训练,我们现在更关注的是 VLA(Vision-Language-Action)在真实机器人项目中的工程化落地。相比 LLM 的“语言—工具”闭环,VLA 本质上是“视觉—语言—动作—环境反馈”的物理闭环,其复杂度不再停留在 token 生成,而是进入真实世界的状态控制与反馈学习。
如果从项目视角重新设计 VLA,我们不会从“选一个模型开始”,而是从“任务系统”反推整个训练体系。目标也不再是做一个通用 benchmark 模型,而是做一个在特定机器人本体、特定工作空间、特定相机布局、特定业务流程中长期稳定运行的专项系统。
典型任务包括:双臂装配、抓取与重排、包装分拣、插接操作、移动抓取、清洁整理等连续操作任务。核心问题不再是“用哪个 VLA”,而是如何把:
基础 VLA + LeRobot 数据体系 + 真实机器人本体 + 云端训练 + 自动评测 + 自动部署 + 真机回流
整合成一个持续进化的闭环系统。
⸻
- Foundation VLA + 项目数据的分工
以蚂蚁 Robbyant 的 LingBot-VLA 为例,其公开信息显示模型基于约 2 万小时真实机器人数据、覆盖多机器人本体,并在后续版本扩展到约 6 万小时数据与更多自由度控制(头部、腰部、灵巧手等)。这类 Foundation VLA 的核心作用是提供跨本体的通用操作先验。
因此在工程上可以明确分层:
- Foundation VLA:学习通用视觉-语言-动作先验
- Project Dataset:对齐具体业务分布
- Post-training:完成 domain adaptation
- Deployment:进入真实机器人
- Telemetry:回流新数据
最终形成 Physical Data Flywheel。
⸻
- LeRobot 作为数据基础设施
LeRobot 在这里更像“机器人数据操作系统”,而不是单纯 dataset format。它覆盖:
- 数据采集
- Episode 结构化
- 训练接口
- policy 评估
- 多机器人适配
因此可以作为中间层统一所有机器人数据标准。
⸻
- 系统分层架构
3.1 Robot Hardware Layer
包括机械臂、夹爪、灵巧手、移动底盘、相机、深度传感器、力觉/触觉、IMU 等。
3.2 Robot Runtime Layer
负责确定性控制与安全:
- motor control / servo
- IK / joint limit
- collision detection
- emergency stop
- sensor sync
- action execution
关键原则:
VLA 只“建议动作”,Runtime 决定“是否允许执行”。
必须强制约束:
- 关节/速度/力矩限制
- workspace boundary
- self-collision
- human safety detection
⸻
- 数据层:Episode 是核心资产
每条 Episode 必须包含:
- language instruction
- RGB / depth
- robot state(joint / velocity / pose)
- gripper state
- action sequence
- timestamp(关键)
- task / scene / robot ID
- success / failure
- intervention / safety stop
关键点:时间轴比视频更重要
很多失败来自:
- 图像 t
- state t+80ms
- action t+150ms
未对齐导致模型学习错误动力学。
⸻
- Task Taxonomy 与数据设计
不再只收“成功轨迹”,而是拆解任务:
- pick / place / grasp / release
- insert / align / rotate
- push / pull / press
- open / close / navigate
以“插接任务”为例,需要覆盖:
- 不同起始位姿
- 不同旋转角度
- 遮挡情况
- 错误插入
- 半成功状态
- 接触失败
- recovery trajectory
⸻
- 数据分布:五类关键数据
高质量 VLA 数据必须包含:
- Nominal:标准成功轨迹
- Variation:环境变化
- Failure:失败状态
- Recovery:失败修复
- Hard Negative:防 shortcut
其中 Recovery 数据最关键,因为真实机器人能力上限取决于:
是否能从错误中恢复,而不是是否不犯错。
⸻
- 人类接管数据(最有价值信号)
所有 human intervention 都应被记录:
- 即将碰撞
- 抓错物体
- 动作振荡
- 卡死状态
- 失败但仍执行
结构化为:
Observation → Model Action → Intervention → Human Fix → Recovery → Outcome
这类数据往往比成功数据更有价值。
⸻
- Embodiment Adapter(跨机器人核心问题)
不同机器人差异包括:
- DOF 不同
- action space 不同
- camera layout 不同
- control frequency 不同
因此必须建立统一抽象:
- observation space
- action space
- coordinate system
- normalization
- robot embedding
- action chunking
否则“数据格式正确 ≠ 可训练”。
⸻
- 数据验证体系(必须自动化)
进入训练前必须验证:
- timestamp 是否乱序
- camera 是否丢帧
- action 是否越界
- state 是否异常
- episode 是否完整
- distribution 是否异常
- calibration drift
核心原则:
robot dataset 的错误往往“看起来完全正常”。
⸻
- 训练策略:小步验证优先
不直接 full fine-tune,而是:
- 1 robot
- 3~5 tasks
- 小规模 episode
验证:
- action mapping
- loss 是否合理
- offline replay 是否正确
- 真机是否能动
否则优先查数据,而不是加算力。
⸻
- Foundation + Project 混合策略
训练数据分层:
- general manipulation
- embodiment similar data
- project-specific data
- failure / recovery replay
训练阶段动态调整:
- early:foundation dominant
- mid:project dominant
- late:hard case dominant
避免 catastrophic forgetting。
⸻
- 三阶段训练体系
- Foundation Adaptation(本体对齐)
- Task Specialization(任务学习)
- Failure Mining(长尾修复)
其中 Failure Mining 是长期价值核心。
⸻
- 云端训练与自动化系统
完整 pipeline:
Raw Data
→ Validation
→ Alignment
→ Dataset Versioning
→ Training
→ Evaluation
→ Registry
→ Deployment
→ Robot Fleet
→ Telemetry
→ New Data
所有训练必须:
- containerized
- versioned
- reproducible
避免“手动 SSH 训练”。
⸻
- Evaluation Gate(上线标准)
不仅看 success rate,还要看:
- intervention rate
- recovery rate
- safety events
- latency
- action smoothness
- object drop rate
关键原则:
安全优先于成功率
⸻
- Deployment 架构
标准流程:
Train → Evaluate → Register → Stage → Canary → Rollout
机器人只认:
model version,不认模型文件
支持 A/B test:
- robot group A / B 跑不同 policy
⸻
- Runtime 解耦
推荐架构:
Camera/State
→ Robot Runtime
→ Observation Gateway
→ VLA Server
→ Action Chunk
→ Safety Filter
→ Controller
模型可替换,机器人系统不变。
⸻
- 异步推理与动作 chunk
避免:
“拍图 → 等模型 → 执行”
改为:
- asynchronous inference
- action chunk buffer
- receding horizon
- latest observation re-grounding
解决延迟问题。
⸻
- Agent + VLA 分层
复杂任务建议拆分:
- Agent:负责规划(long horizon)
- VLA:负责执行(short horizon)
例如:
“拿水 → 放箱 → 关箱”
Agent 负责拆任务,VLA 负责动作执行。
⸻
- World Model 增强
VLA 不仅预测 action,还预测:
- future state
- contact outcome
- scene evolution
从 reactive policy → predictive control。
⸻
- 核心闭环:Physical AI System
最终系统不是模型,而是:
- Robot Fleet(数据生成器)
- LeRobot(数据基础设施)
- VLA(策略模型)
- Cloud Training(学习系统)
- Evaluation(质量控制)
- Deployment(交付系统)
- Telemetry(反馈系统)
- Human Intervention(高价值监督)
形成持续循环:
Failure → Data → Training → Deployment → New Failure
⸻
- 最终本质
VLA 项目的核心资产不是模型,而是:
- 真实轨迹数据
- failure distribution
- recovery behavior
- human correction
- evaluation system
- deployment feedback loop
模型只是可替换组件。
真正不可复制的是:
长期积累的 physical experience system。
⸻
- 结论
VLA 工程的本质不是“训练一个机器人模型”,而是构建一个:
能从真实世界持续学习的物理智能系统。
当闭环跑通后:
- 60% → 收集失败
- 失败 → 人类修正
- 修正 → 新数据
- 新数据 → 新模型
- 新模型 → 再部署
系统会自动进化,而不是一次性训练完成。