智采·万果通
在团队 v1.0 草莓采摘样机基础上,v4.4 正式锁定 Qwen3-VL + YOLO11s / NanoSAM / RGB-D + Diffusion Policy + RTC + LeRobot 0.6.1 + ROS 2 / MoveIt 2 + Jetson Orin / RK3588 技术栈,构建从任务理解、感知定位、柔性动作到实时控制和独立安全的五层具身智能系统。
主栈锁定,指标验收
参赛版本明确区分“技术路线是否确定”和“性能指标是否达成”:当前主技术栈已经锁定,不再以候选矩阵对外表达;成功率、破损率、周期、延迟、功耗与跨作物迁移效果继续通过实验 Gate 验收。
参赛与当前研发主线已确定的架构、模型和工程底座;备选技术不得削弱主叙事。
团队原始记录或可复现实测,必须同时说明场景、样本量和统计口径。
论文、官方仓库或厂商资料,只在其公开验证边界内成立。
尚未达到的目标,必须附验收方法、失败条件和时间 Gate。
方向合理但缺少本机本任务证据,不进入产品确定性承诺。
可替换的模型、板卡与框架,由统一基准决定是否进入生产。
D 表示路线已锁定,E 表示结果已验证,两者不能混淆。 Qwen3-VL、Diffusion Policy、RTC、LeRobot 0.6.1 与五层具身架构属于 D;v1.0 的 91.3% 成功率、6.3% 破损率和 15.1 秒周期属于 E;v2.0 的 ≥95% / ≤5% / ≤8 秒属于 T。我们确定的是实现路径,正在攻克的是更高性能指标。
技术挑战
采摘机器人不是单一难题,而是感知、规划、控制、跨作物迁移四块叠在一起的工程系统。市场背景:中国草莓产量 2021 年 368.2 万吨、2011-2020 CAGR 6.2%,自 2007 年起世界第一——市场体量与机械化采摘空白都已就绪。本章把每块拆开——告诉你它具体卡在哪里、为什么 2024-2026 的论文还没完全解决、我们采取什么策略。
01五大 AI 核心问题
采摘机器人面对的世界比工厂机械臂复杂十倍。果实长在不规则的枝条上,会被叶子遮挡,颜色和背景相近,风一吹位置就变。下面五个问题是 2024 至今所有发表的采摘机器人论文都在回答的——每个问题对应一种独立的技术栈。
① 果实检测与成熟度判断
表面上是个目标检测问题,YOLO 类模型在 COCO 上做了多年。但农业场景有三个非标准条件:成熟度需要 4 分类(绿/粉/红/过熟,单一阈值不够),红色果实在带红反光的绿叶背景下对比度极低(枸杞最典型),同一簇果可能有 70% 被叶子遮挡。 直接用预训练 YOLO 准确率会从 95% 掉到 60% 以下。
生产感知主链锁定为 YOLO11s + NanoSAM + RGB-D + BoT-SORT:YOLO11s 完成果实检测与成熟度初判,NanoSAM 对 top-K 目标精细分割,RealSense D405/D435 提供近距离与场景深度,BoT-SORT 保持跨帧目标身份。Qwen3-VL-4B 负责低置信度复核、遮挡解释和长尾目标理解,不替代高频专用感知,也不单独决定最终成熟度和抓取位姿。所有感知指标按温室、日期、品种和光照隔离测试。[58]
② 3D 空间定位
视觉知道果在哪里还不够,机械臂需要毫米级的 6D 位姿 (x, y, z, roll, pitch, yaw)。RGB-D 相机(如 RealSense D405)能给立体硬件深度,但在叶子翻动、阴影斑驳、果实表面反光的情况下会出现“幽灵深度”——某些像素的深度估错几厘米,导致机械臂去够空气或撞枝。
3D 定位链路锁定为硬件立体深度 + 实例分割 + 多帧跟踪 + 手眼标定。系统输出抓取候选帧集合、置信度/协方差、接近方向和容许区间,经时间同步、尺度对齐和机器人坐标变换后交给 MoveIt 2 与末端视觉伺服;最终精度由标定与真机抓取实验验收,不把尚未实测的毫米数字写成既成结果。
③ 可达性与路径规划
枝条柔软,会跟机械臂之间发生“双向影响”——你伸过去枝条被撞偏,果就跟着移动。这意味着规划阶段算出来的关节轨迹在执行 100 ms 后可能就过时了。传统做法是用 MoveIt2 + FCL 做静态规划,离接近目标 10 cm 时再切到伺服控制。
系统采用全局规划、局部技能和实时控制分层:MoveIt2/Nav2 负责可解释的运动与导航基线,视觉伺服、力控和动作策略负责动态接近段。高层推理、策略推理、视觉伺服和电机内环分别设置频率与超时,具体数值通过实测确定。Real-Time Chunking 只可能用于兼容 diffusion/flow 策略自身的 action chunk 异步执行,不承担 VLM 指令与控制器之间的通用桥接。
④ 末端柔顺控制
水果损伤的本征参数是应变 + 模量而不是单点法向力。以蓝莓为例:果肉杨氏模量 0.339 MPa、屈服应力 σ_y ≈ 0.063 MPa、瘀伤判据 PEEQ ≥ 0.1(FEA 离线损伤判据,Zheng et al. 2024)[18];按 ø3 mm 硬指端估算接触面 A ≈ 7 mm²,均匀应力近似 F_crit ≈ σ_y × A ≈ 0.44 N(一阶量级估算;Hertz 球-平面接触应力在次表面 z ≈ 0.48a 处先达屈服,含 0.62 因子的完整 von Mises 推导仍回到 ~0.4-0.5 N 量级;A 随接触力变化、E* 不确定,综合精确值有 ±50% 区间),与 Gunderman 2022 黑莓软抓手实测工作点 0.5-0.78 N 同量级[24]。冲击破皮以 BIRD 跌落计算:硬质 120 cm / 软质 60 cm 是分级线(Yu et al. 2014 BIRD 法)[25]。这意味着夹爪不仅要软,抓取动作本身的速度、扭转角度、力的渐变都要被精确控制。传统 PID 控制器无法处理这种多维约束。
团队 v1.0 草莓力学锚点:成熟期红色草莓表层弹性模量 0.356 MPa、生物屈服应力 σ_y = 0.0045 MPa、草莓-硅胶静摩擦系数 μ = 0.76(团队 2025 实测,详 Refs [52])。自研 4 指气动柔性软爪在 16 kPa 工作气压下,末端 10 mm 处对果实表面的应力实测为 1.74-2.18 × 10⁻³ MPa(约屈服阈值 40-50%)——这是 v1.0 在实验室仿垄环境实测 6.3% 破损率的力学边界。物种说明:σ_y 数值与物种强相关(蓝莓 0.063 MPa / 草莓 0.0045 MPa,量级差 14×),蓝莓 / 黑莓数据保留作 cross-reference,工程目标针对草莓数据对齐。
动作学习主线锁定为 Diffusion Policy + RTC:Diffusion Policy 学习最后接近、包覆、夹持和撤回动作,RTC 在兼容的 action-chunk 执行路径内减少异步推理造成的边界停顿。第一轮按 150–300 条可回放 episode 规划采集预算;旧 300 次实验只有在同步图像、深度、关节/末端状态、动作、力/气压、时间戳和结果标签完整时才进入训练集。ACT、GR00T N1.7 与 Qwen-VLA保留为后续升级储备,不改变当前交付主线。[2]
⑤ 跨作物泛化
跨作物扩展不再简化成“每种水果一个 LoRA”。新版将迁移拆成五个独立问题:感知域、抓取几何、果梗与枝条动力学、末端执行器、成功/损伤判据;策略层再比较 LoRA、adapter、部分微调、全量微调、混合作物训练或独立策略。草莓仍是 v2.0 主基线,因为团队拥有 v1.0 物理样机和力学数据;番茄、枸杞及其他作物顺序作为产品路线 C/T 保留,但 demo 数、适配器大小和复用比例由实验决定。[3][52]
公开论文里 2024-2026 没有任何系统同时达到 ≥ 85% 未疏遮挡成功率 + ≤ 5% 损伤率 + ≤ 8 s 周期三件套。这是我们的工程目标,也是商业窗口的来源。
02我们的架构原则
每条原则都有公开论文或源代码支撑——不是产品宣传,是工程依据。
专用感知、标定几何、运动规划、力/位控制和硬安全构成可解释基线;学习策略只在统一基准证明增益后进入生产。大模型不可成为安全完成当前动作或安全退出的必要条件。
当前动作策略锁定 Diffusion Policy,以完好果实/小时、破损率、接管率、恢复率、P95 周期和边缘稳定性持续验收。ACT、GR00T N1.7 与轻量 VLA进入技术储备,不并行分散当前研发资源。
RTC 与 Diffusion Policy 配套部署在动作策略到实时控制的 action-chunk 执行路径中,用于减少异步推理造成的边界停顿与动作跳变。RTC 不处理 VLM JSON;其收益通过真机 A/B 量化,但架构位置与接口已经锁定。[4]
草莓做 v2.0 实证基线;后续作物分别评估感知、几何、动力学、末端和策略的复用程度。LoRA 只是实验变量之一,不预设 rank、数据量、适配器大小或“80% 代码复用”等结论。
架构
系统采用具身推理、感知与几何、Diffusion Policy 动作技能、实时控制、独立硬安全五层架构,并以现场数据闭环持续改进。Qwen3-VL、YOLO11s / NanoSAM / RGB-D、Diffusion Policy + RTC、ROS 2 / MoveIt 2、Jetson Orin / RK3588构成当前锁定主栈。
系统总览 — 六类能力,一条安全闭环
传感器、专用感知、具身推理、动作策略、实时控制和硬安全各司其职。VLM 可以建议目标、换视角、重试或放弃,但不直接生成最终电机指令,也不定义力、速度和空间安全边界。
— 感知层 · sensing
Intel RealSense D405 + D435 双相机硬件立体深度,30 Hz · ±5 mm,果实 6D 定位主力。
Depth Anything V2 Small 单目神经深度填补叶遮 / 阴影 / 反光下的"幽灵深度"。两路一致才信,不一致 NanoSAM 重分割投票。
Livox + RTK GPS,仅底盘果园行间穿梭用 · 不参与果实感知(1-2 cm 果实在远距离 LiDAR 分辨率不够)。Pilot 档起配。
Jetson AGX Orin + RK3588 构成当前边缘计算主平台:Orin 承载 Qwen3-VL、神经感知与策略推理,RK3588承载边缘服务、设备接入和任务协同;机器人控制器/MCU负责硬实时与安全执行。算子覆盖、量化损失、P95/P99 延迟、热降频、功耗与8小时稳定性继续验收。
— ai 认知层 · cognition
YOLO11s 作为当前果实检测与成熟度初判主模型,在统一温室数据和 Orin 目标设备上验收精度、置信度校准与尾延迟;商业化阶段完成 Ultralytics 授权,RT-DETR保留为许可证备份路线。
YOLO11s 四级成熟度分类 + DINO 特征复核构成成熟度链路;标注量通过按温室、日期、品种和光照隔离的学习曲线确定,避免相邻视频帧跨训练与测试造成数据泄漏。
BoT-SORT 多目标跟踪 < 5 ms/帧,处理一簇果 50+ 候选。
Qwen3-VL-4B 锁定为本地具身推理监督器,负责目标选择、多视角复核、进度/成功检测、异常解释、重试/放弃和技能编排;运行频率、显存与延迟以 Orin 多视角输入实测验收。Gemini Robotics ER 2仅作为高层能力参照。[58][60]
Diffusion Policy + RTC 锁定为柔性采摘动作主线,输出连续 action chunk 并在异步执行中保持动作衔接。ACT、GR00T N1.7 与轻量 VLA作为后续升级储备,不占用当前交付主线资源。[59]
分别评估感知、几何、动力学、末端和策略复用。LoRA、adapter、部分/全量微调、混合作物训练或独立策略均为 H/C,不预设 rank、大小或数据量。
通用模型进步会持续降低语义理解和动作学习成本,但不会替代标定、末端力学、实时控制与功能安全。分层使模型能够快速升级,同时确保任何模型失效时机器人仍可确定性 hold、完成安全原子动作或受控撤退。
本系统正式定义为分层具身智能系统:Qwen3-VL负责高层具身推理,Diffusion Policy负责连续动作,二者通过类型化技能契约协同,但不冒充单一端到端自研 VLA。GR00T N1.7、Qwen-VLA与其他端到端方案进入后续升级路线,用于未来统一视觉、语言和连续动作建模。[61]
03五层具身架构
五层描述的是责任边界,不是五台计算机。当前部署锁定 Jetson AGX Orin + RK3588 + 机器人控制器/MCU:Orin负责大模型、视觉与动作策略,RK3588负责边缘服务和设备协同,控制器/MCU负责硬实时执行与安全联锁。
目标选择、任务分解、多视角复核、进度与成功检测、异常解释、重试/放弃和技能编排。事件驱动,不直接控制电机。
检测、分割、跟踪、RGB-D、手眼标定、抓取候选帧、障碍物与不确定度。最终执行几何的唯一权威来源。
Diffusion Policy + RTC 输出并连续执行 action chunk;策略结果受视觉伺服、力控和安全配置约束,ACT/GR00T/Qwen-VLA列入后续升级储备。
视觉伺服、IK、力/位控制、轨迹跟踪、动作超时和受控撤退。策略频率、伺服频率与电机内环分别度量。
E-stop、STO/断驱、力限、速度限、空间限制、看门狗与安全配置版本管理,独立于 VLM/VLA 运行。
为什么不写死频率?高层推理、动作策略、视觉伺服和电机/力控内环是四种不同时间尺度。新版以事件驱动的高层推理、可测的策略输出、独立视觉伺服和控制器内环分别建立 P50/P95/P99 延迟与抖动预算,不再用“1–2 Hz + 30–50 Hz”代替整套系统的实时性证明。
RTC 放在哪里?如果 L3 采用兼容 diffusion/flow 的 action-chunk policy,RTC 可在 L3→L4 的异步执行内部生成下一段动作并约束重叠部分;L1 只更新目标、约束引用和失败恢复意图,不发送 8×6D 动作 chunk。
失败时怎么办?高层命令缺失或过期时,不复用旧目标继续追踪。L4 只允许在明确时限内完成不可中断的安全原子动作,随后 hold 或受控 retract;L5 始终可以独立停止驱动。
初始基准可覆盖:高层推理 0.5–5 Hz(事件驱动)、动作策略 5–30 Hz、视觉伺服/状态估计 30–100 Hz、电机与力控内环按控制器能力运行。最终阈值由草莓末端、果梗运动、相机时延与力控稳定性共同决定,任何公开模型频率都不能直接外推为智采真机指标。
03.5工程骨架:ROS 2 + 地面导航 + 续航
AI 决策层(§03 双脑)之下需要一个可靠的"地面层"承接命令:机械臂去哪里、移动平台怎么开过去、电池什么时候要回去充。这一层的栈技术早已成熟,不是 differentiator——但栈深度、算法选型、场景切换逻辑是工程能力分水岭。下面三块——ROS 2 中间件 / SLAM + RTK 导航 / 续航管理——一次性讲清楚。
① ROS 2 是什么 · 为什么用
ROS 2 Humble + rmw_zenoh shared memory 是整套机器人的"操作系统"——节点通信、硬件抽象、消息传递、规划框架都跑在 ROS 2 之上。AI 决策层是骨架之上的大脑 + 灵巧手,不是替代 ROS 2 的方案。这两层的关系类似 Android 系统 (ROS 2) + App (VLM + DP):没有底层 OS,每个 App 都要重写驱动 / 调度 / IPC。
为什么是 ROS 2 不是 ROS 1:(i) DDS 真实时通信,端到端延迟 5 μs(同机进程内)/ 1 ms(千兆以太网跨机),ROS 1 的 TCPROS 至少 200 μs;(ii) 原生多机架构(多臂 + 移动平台同总线管理),ROS 1 master 单点故障;(iii) 国内主流机械臂厂商 ROS 2 driver 覆盖完整(JAKA / Dobot / Aubo / Doosan 都有官方支持[42])。为什么不自研中间件:写一个跑得动的中间件需要 2-3 工程师年 + 生态绑死。"生态 > 性能微调" 在这个阶段的取舍下,ROS 2 + Zenoh 是 Pareto 最优。
② SLAM + 自主导航
SLAM 三路融合,不是单一算法兜底——温室 / 露天 / 强光眩光三场景下任何单一 SLAM 都有失效域,单点失败会卡死整机。三路并行输出统一在 robot_localization EKF 投票,给上层一个稳定的全局位姿。
| SLAM 算法 | 角色 | 适用场景 | 失效域 |
|---|---|---|---|
| FAST-LIO2(主) | 3D LiDAR + IMU 紧耦合 | 露天果园 · 农场粗糙地形 · 适配 Livox MID-360(已选型 §13 module 04) | 极端粉尘 · 反光面 (玻璃温室) |
| Cartographer(2D fallback) | 多传感器 2D 栅格图 | 结构化温室 · 大棚行间 | 3D 起伏地形 |
| ORB-SLAM3(视觉冗余) | IMU + 多地图 + 重定位 | CPU-only 紧急模式 / 激光模块故障兜底 | 低纹理 · 强反光 · 单作物垄 |
自主导航 Nav2(不是 ROS 1 时代的 move_base):Behavior Tree navigator + behavior server 统一调度全局规划(A* / Dijkstra · 农田跨垄长路径)和局部规划(DWA · 标准;TEB · 弯道 / 窄通道 / 农具避让),输出 cmd_vel 给底盘驱动。多目标排序、归航、暂停、避障兜底全在 BT 树里描述,**改场景换 BT 文件,不改代码**。
③ 北斗 / GPS / RTK 室外定位
室内依赖 SLAM 已够;但开放果园 / 农田场景需要绝对全局坐标。RTK 北斗 B1I/B2a 双频 + GPS L1/L5 双频 + RTK 差分是国产基线选型,定位精度 ±2 cm(开阔)/ ±10 cm(弱遮挡)。
实现链:北斗模块串口 → nmea_navsat_driver 解析 NMEA-0183 → ROS 2 标准 /fix 话题 → robot_localization EKF 融合 GPS + 9 轴 IMU + 底盘里程计 + SLAM 局部位姿 → 输出 UTM 全局坐标 + 协方差。室内/室外切换:温室入口 entry-zone(GPS 锁定 + LiDAR 同时观测 5 s)触发定位栈交班,避免单一定位栈失效时机器人"瞎"了。
④ 续航 + 自动归航联动
导航栈不只为"开过去"服务——还为"回家充电"服务。Energy-aware mission planner 每 30 s 评估一次:
- 当前电池剩余电量 (BMS SoC);
- 完成当前任务 cluster(剩余果簇 × 单果能耗)所需能量;
- 完成后归航到充电桩所需能量(用 SLAM 持久化地图 + A* 估算路径长度 × 平均移动能耗);
- 叠加 30% 安全裕度;
- 若 (1) < (2) + (3) + 裕度 → 立即触发 Nav2 归航 to 充电桩 RTK 锚点。
详细电池规格 / 自动换电流程 / 充电桩部署见 §13 module 06 续航 + 自动换电。
ROS 2 / SLAM / RTK / 续航是客户技术尽调的基础项。新版不使用“国内不超过多少家”等缺少可核验来源的竞争话术,而以节点失联恢复、定位漂移、归航成功率、连续运行时间和维护记录证明工程深度。
04感知栈
感知主链锁定为 RGB-D + YOLO11s + NanoSAM + BoT-SORT + 标定几何。旧稿把多个模块延迟相加后仍写成端到端28ms,调度关系并不成立;v4.4在目标设备上分别报告串行、并行、跨帧与条件触发模块的 P50/P95/P99、抖动、丢帧和热降频。Qwen3-VL从实时主链移出,只做事件驱动复核。
为什么 SAM2 原版不用?SAM2 在 AGX Orin 上只有 2 FPS,跑不动 30 Hz 主循环。NVIDIA 自己开发的 NanoSAM 把 image encoder 蒸馏到 mobile ViT 量级,AGX 上可达 30 FPS。[8]
为什么 SAM 只对 top-K 候选做?YOLO 每帧检测可能输出 50 个 bbox,但机械臂一次只能摘一个。优先级排序后取最高的 3-5 个候选送 SAM 做精细分割,剩下 45 个直接丢——节约 80% 算力。
Depth Anything V2 用 Small 不用 Base 或 Large?因为我们用立体硬件深度做 ground truth,DA 只负责"补洞"(叶子重叠、阴影区域)。Small 已经够用,Base 多 50% 延迟收益不到 2% 精度。
05动作分块与 Real-Time Chunking
RTC 已锁定为 Diffusion Policy 动作分块执行组件,部署在动作策略到实时控制之间;它负责动作衔接,不负责连接 VLM 与控制器。
RTC 的论文是 Physical Intelligence 团队 2025 年 6 月发的 Real-Time Execution of Action Chunking Flow Policies[4]。它解决的问题是:diffusion / flow policy 一次推理出未来 H=50 步动作,但实际只执行前几步就要重新推理。如果新旧 chunk 拼接的位置不平滑,关节就会抖。
RTC 的核心 trick 是把新 chunk 的去噪过程额外加一项软约束,让前 d 步(已执行)冻结,中间 (H-s) 步软约束向旧 chunk 靠近,最后 s 步自由生成。这样新旧 chunk 在中间过渡段自然衔接。
数学上是 ΠGDM (pseudo-inverse guided diffusion model) 的移植——原本用在图像 inpainting 上,现在用在动作 chunk 的"时间维度 inpainting"上。整个修正函数的核心 15 行代码(JAX 版本):
def pinv_corrected_velocity(self, x_t, obs, y, t, inference_delay): # Predict clean sample x_1 via flow ODE def denoiser(x_t): v_t = self(obs[None], x_t[None], t)[0] return x_t + v_t * (1 - t), v_t x_1, vjp_fun, v_t = jax.vjp(denoiser, x_t, has_aux=True) weights = get_prefix_weights(inference_delay, prefix_attention_horizon, self.action_chunk_size, schedule) error = (y - x_1) * weights[:, None] pinv_correction = vjp_fun(error)[0] inv_r2 = (t**2 + (1 - t)**2) / ((1 - t)**2) c = jnp.nan_to_num((1 - t) / t, posinf=max_guidance_weight) guidance_weight = jnp.minimum(c * inv_r2, max_guidance_weight) return v_t + guidance_weight * pinv_correction
外部证据边界 R:论文 Figure 1 的“300 ms”来自单条 rollout,并非智采场景统计平均;系统评测覆盖特定任务、模型和延迟注入区间。它证明 RTC 能在论文设置下缓解 action chunk 异步执行问题,不能证明其能吸收智采高层 VLM 延迟,也不能直接推导草莓采摘的控制频率。
① 仅服务当前 Diffusion Policy 主线;② 与无 RTC 基线使用同一 episode、控制器和测试集;③ 同时报告吞吐、成功率、轨迹连续性、推理开销和 P95/P99 延迟;④ 若特定硬件版本收益不足,优化其参数与实现但不改变既定接口;⑤ RTC 不参与语义消息、最终几何或安全限制。
| 属性 | 是 / 不是 | 说明 |
|---|---|---|
| 数学本质 | ΠGDM pseudoinverse guidance | 图像 inpainting 移植到 action chunks |
| 适用策略 | 仅 diffusion / flow | ACT 无 denoiser,论文 §6 明文排除 |
| 延迟容忍 | +200 ms 注入实测 / fig 1 单条 rollout | 60 ep ±1 SEM;更高延迟未测 |
| 智采状态 | D · 主栈组件 | 架构与接口锁定,性能按真机 Gate 验收 |
| 代码状态 | JAX-only sim repo | PyTorch 端需自写 torch.autograd.grad |
| LeRobot 集成 | v0.6.1 锁定 | 按项目 commit 完成迁移、测试与边缘导出 |
| 开销 | 每步 VJP 增加 30-50% 计算 | per-step backward-mode autodiff |
06动作策略主线与升级储备
当前主线锁定 Diffusion Policy CNN + RTC,围绕草莓柔性接近、包覆、夹持与撤回动作持续优化。ACT、GR00T N1.7、Qwen-VLA等方案保留在技术储备池,只有主线完成温室 Pilot 后才启动替换性评测,避免参赛阶段分散研发资源。
| 策略 | 状态 | demo 需求 | 推理延迟 | RK3588 | 结论 |
|---|---|---|---|---|---|
| Diffusion Policy CNN | 主线 D | 按学习曲线 | 待本机测 | 待导出测 | 当前交付策略;跨作物单独训练与验收 |
| ACT | 升级储备 | 按学习曲线 | 待本机测 | 待导出测 | 主线完成 Pilot 后再做替换性评测 |
| iDP3 | 不在 LeRobot | 10 × 3 task | 9 Hz CPU | 不可行 | issue #26 不可复现 · 需 L515 EOL |
| Equivariant DP | DISQUALIFIED | 100 | untested | 不导 ONNX | issue #9 等变测试自己失败 |
| GR00T N1.7 3B | 升级储备 R/H | 需后训练 | 待 Orin 测 | ONNX / TRT 路径 | 公开可用;草莓适配与许可证边界另行核验 |
| Qwen-VLA | 研究参照 R/H | 公开研究配方 | 智采未知 | 生产栈未确认 | 不写成已可直接部署 |
07通信总线
ROS 2 Humble + MoveIt 2 + Nav2 锁定为机器人软件与模块通信骨架,高层语义、执行几何、动作参考和安全配置使用不同契约。高层消息只传目标 ID、任务意图、批准技能、约束配置引用和有效期;最终抓取帧来自感知/几何层;连续动作由 Diffusion Policy输出;力、速度和空间限制来自签名、版本化的安全配置。
target_id: fruit_track_0187 intent: harvest approved_skill: strawberry_cut_retract_v3 constraint_profile: strawberry_soft_v2_signed recovery_policy: reobserve_then_retract issued_at_ns: 1786665600000000000 expires_at_ns: 1786665601500000000 trace_id: harvest_row03_0187
为什么不把所有消息都塞进 JSON?高层意图可以保留可读表示,但实时动作、时间戳、坐标系、协方差和安全状态必须使用类型化消息并进行版本协商。可调试性不能以模糊单位、静默字段缺失或安全边界被模型覆盖为代价。
技能接口保持稳定:高层只可从已批准技能目录选择,技能内部可以由状态机、经典控制、DP、ACT 或 VLA 实现。作物变化时必须重新验证末端、动力学、参数边界与成功判据,不能仅通过更换 LoRA 宣称完成迁移。
JSON Schema · 大脑—小脑契约
结构化解码可以降低格式错误,但格式合法不等于语义正确,更不等于安全。VLM 输出必须经过目标存在性、技能白名单、坐标系、时间有效性、权限与状态机校验;任何字段缺失、超时、重放或前后矛盾都进入确定性回退。
目标语义归具身监督器;最终抓取帧和不确定度归感知/几何层;连续动作归策略/控制层;力、速度、空间限位与急停归独立安全层。VLM 不输出最终 6D pose,不生成安全参数,也不通过“修复 JSON”绕过校验。
三级容错管道
- L1 消息校验:schema、版本、坐标系、单位、时间窗、目标 ID 和技能白名单任一失败即拒绝,不猜测修补安全关键字段。
- L2 模型回退:VLM 不可用时回到专用感知与规则任务;策略超时、崩溃或 GPU OOM 时进入 hold 或受控 retract。
- L3 独立安全:网络中断、ROS 节点失联、相机掉线、旧消息和时钟跳变由看门狗处理;E-stop、STO、力/速/空间限制始终独立于模型。
数据 · 训练
数据资产不再用“成功 demo 数量”单点衡量,而以可回放 episode、失败与接管、结果标签、跨场景隔离和持续纠正闭环衡量。LeRobot 0.6.1锁定为数据采集、训练、rollout、纠正与版本管理底座。
08现场数据闭环
论文 demo 数只能作为外部参考 R,不能保证智采达到目标。生产数据必须覆盖“示教—自主运行—失败—接管—纠正—再训练—回归测试”的完整循环。
| 论文 / 任务 | demo 数 | 成功率 | 环境 | 引用 |
|---|---|---|---|---|
| DP Push-T (real) | 136 | 95 % | tabletop | Chi 2023 T3 |
| DP Pour 6DoF | 90 | 79 % IoU | real-robot | Chi 2023 §7 |
| DP Mug Flip | 250 | ~90 % | tabletop | Chi 2023 §7 |
| DP Shirt Folding | 284 | — | deformable | Chi 2023 §7.5 |
| iDP3 Pick / Pour / Wipe | 10 × 3 | 9–10 / 10 | indoor | Ze 2024 §IV-D |
| Robofruit strawberry | — | 83 % pluck | polytunnel | Parsa 2024 JFR |
| WSU strawberry + fan | — | 58 → 74 % (+15) | outdoor | CEA 2025 110684 |
| Cherry tomato Rong | — | 57.7 % | greenhouse | Rong 2024 JFR |
| Grape dual-arm | — | 96.7 % | vineyard | Frontiers 2022 |
| π0.5 LIBERO Long-10 | 50 | 92.4 % | sim block | openpi README |
| OpenVLA-OFT LIBERO | 50 | 94.5 % | sim block | OFT §V Tbl I |
150–300 条 episode 可作为草莓第一轮采集预算 T。旧 300 次实验先做 Gate 0 数据资格审计:只有同步视频/深度、关节或末端状态、动作、力/气压、时间戳、结果和失败原因齐全且可回放,才能转换为训练 episode。新版同时保存成功、失败、放弃、碰撞前兆、人工接管与纠正;训练/验证/测试按植株、行、温室、日期、季节和品种隔离,同一 episode 的增广版本不得跨 split。
09LeRobot 0.6.1
当前工程版本锁定 LeRobot v0.6.1。相对 v0.5.1 的 breaking changes通过独立迁移分支处理,重点打通 LeRobotDataset v3.0、Diffusion Policy训练、rollout、reward/success detection、人工纠正、RTC与边缘导出路径;旧版源码审计只作为历史资料。[62]
| 状态 | 模块 | 路径 / 说明 |
|---|---|---|
| ✓ 已成熟 | ACT + DP | src/lerobot/policies/{act,diffusion}/ |
| ✓ 已成熟 | LeRobotDataset v3.0 | 新分片格式 · 转换器 convert_v21_to_v30 |
| ✓ 已成熟 | PEFT 集成 | pretrained.py:wrap_with_peft + peft 0.18.1 |
| ✓ 已成熟 | RTC 集成 | policies/rtc/modeling_rtc.py · π0 / π0.5 / π0F / SmolVLA |
| ✓ 已成熟 | SO-100 / 101 | lerobot-calibrate · Feetech 真支持 |
| ✓ 已成熟 | Async gRPC | policy_server.py · 真生产架构 |
| ⚠ 需 patch | ONNX / TRT 导出 | 0 个 policy 有 export path · 要自写 |
| ⚠ 需 patch | π0.5 inference bugs | open issues #3439 · #3591 · #3425 · 待修 |
| ⚠ 需 patch | DP-async crash | #3445 stack expects non-empty TensorList |
| ⚠ 需 patch | 校准越界 | #3585 / #3587 写超 min/max 无警告 |
| ⚠ 需 patch | iDP3 不在仓库 | 需自己 fork 集成 |
| ⚠ 需 patch | 无 wall-clock benchmark | benchmarks/ 目录无数据 · 要自测 |
下面的 v0.5.1 命令仅作为历史实现记录,不再视为 v4.4 生产方案。 当前流程固定 LeRobot v0.6.1 与项目 commit,由 CI 验证采集、训练、rollout、纠正和导出命令。
10跨作物迁移
跨作物迁移的关键是分清哪些能力可共享、哪些必须重新验证。新版用迁移矩阵替代“共享骨干 + 每作物固定 LoRA”:
| 迁移单元 | 可共享内容 | 必须重新验证 | 候选方法 |
|---|---|---|---|
| 感知域 | 标注工具、数据 schema、基础视觉特征 | 品种、光照、遮挡、成熟度与置信度校准 | 微调、蒸馏、开放词汇复核 |
| 抓取几何 | 标定框架、跟踪与候选生成 | 果形、果梗、冠层、接近方向和容许区间 | 关键点、分割、候选帧集合 |
| 末端与动力学 | 控制接口、传感器和日志 | 材料、压力、扭转/剪切/振摇、枝条耦合 | 新末端、参数档位、技能重构 |
| 动作策略 | episode 格式、评测框架、部分预训练能力 | 动作空间、成功率、损伤、恢复和边缘时延 | LoRA、adapter、部分/全量微调、独立策略 |
| 成功判据 | 事件框架、审核和回放工具 | 商品等级、破损、漏采、周期和人工接管 | 规则 + reward/success model |
适配方法如何决定?LoRA rank、adapter 位置、冻结范围、数据量和适配器大小均作为实验变量。每种方法必须在固定跨作物测试集上报告成功率、破损率、遗忘、恢复率、训练成本和边缘部署代价;没有团队实测,不引用其他模型的默认 rank 作为农业结论。
为什么 v2.0 主基线选草莓?(1) v1.0 已实证——团队 2025 物理样机在实验室仿垄环境实测 91.3% 综合成功率 / 6.3% 破损率 / 15.1 s 单果周期(300 次重复试验),是公开范围内已有的最强工程基线 anchor,v2.0 直接继承软爪 + 移动平台 + 仿垄环境硬件资产[52]。(2) 客户 narrative 强——中国草莓产量 368.2 万吨(2021),2007 年起全球第一,单机 ROI 与销售路径明确。(3) 力学数据齐全——σ_y 0.0045 MPa / E 0.356 MPa / μ 0.76 / 软爪 16 kPa 工作点全套自测,可作为 DP small-brain 训练时的边界约束参考(具体 force-bound 加入 loss 的方式 W5-8 实验确定)。跨作物按优先级展开:v3.0 番茄(Helios 原生 + 学术权重多)→ v3.1 枸杞(全国 100+ 亿综合产值)→ v3.2+ 冬枣 / 桃 / 梨 / 柑橘 → v3.3+ 咖啡(云南 niche)/ 茶(需新末端硬件:剪+吸 / 微镊,独立工程预算 2-3 月),不是 v2.0 day-1 焦点;详 §11 战略论证 + §16 W21+ 路线图。
作物 · 仿真
Helios 提供部分程序化植株资产,但“仿真中存在某个物种”不等于策略可直接迁移。每种作物仍需验证视觉域、植株结构、果梗动力学、末端和成功判据;仿真与合成数据只能作为增广和压力测试,不能冒充独立真实 episode。
11主作物 roadmap · v2.0 草莓 base → v3.0 番茄 → v3.1 枸杞 → v3.2+ 扩展
v2.0 base = 草莓(继承 v1.0 物理样机、柔性末端、力学数据和仿垄试验条件)。候选产品顺序保持为番茄 → 枸杞 → 冬枣 / 桃 / 梨 / 柑橘 → 咖啡 / 茶,但不再承诺“80% 代码复用”或“只换 LoRA”。每一作物先完成迁移矩阵与商业 Gate,再决定复用、改造或独立 SKU。
| 维度 | 草莓 · v2.0 base ★ | 番茄 · v3.0 候选 | 枸杞 · v3.1 候选 |
|---|---|---|---|
| 优先级理由 | v1.0 91.3% 已实证 + 客户 narrative 强 + 力学数据齐全 | Helios 原生 ✓ + 全年设施 + 权重生态成熟(迁移成本最低) | 全国 100+ 亿综合产值 / 宁夏 340 亿 ★ + AI under-served 24-27/30 但 Helios 自写 + 季节短 |
| 作业季节 | 全年 · 实验室仿垄 → 温室 / 露天 | 全年 · 设施 | 6-11 月 · 50 天/年 |
| 种植方式 | 垄作 ▲(v1.0 已验证) | 棚架吊蔓 | 大田丛栽 |
| 仿真原生支持 | Helios Strawberry ✓ | Helios cherry tomato ✓ | 需自写 PhytomerFn (4-8 周 · ¥40-80k) |
| 主路线 | v1.0 唇齿软爪 + 五层具身架构 | 视觉柔爪 + 扭转(待验证) | 振摇 + 气吸软接(待验证) |
| 数据 Gate | 旧数据审计 + 新采学习曲线 | 跨作物迁移实验 | 跨作物迁移实验 |
| 末端硬件 | v1.0 4 指气动软爪(16 kPa · 已验证) | 气动软爪 + 扭转头 | 多层硅胶气吸 |
| v1.0 基础线 / SOTA | v1.0 91.3% / 6.3% / 15.1s 实测 | Rong 2024 57.7% | Xu 2015 振动 93.5% (整丛) |
| 竞争对手 | Robofruit (83% 商温) / Tortuga (M&A 退出) / DexFruit (Stanford) | 乔戈里 (出口) + 遨博 | 零商业对手 (学术原型) · 100+ 亿综合产值 AI under-served |
* Helios v1.3.72 共 24 个原生物种(2026-05 验证,commit 锁定)。7 战略作物覆盖率:Strawberry + Cherry Tomato 直接原生 ✓(v2.0 + v3.0 即用);桃 ← Almond · 梨 ← Apple 同属借用 ⚠(~2 工程师周 / 种);柑橘 · 枸杞 · 冬枣 完全自写 ✗(4-8 工程师周 / 种)。Helios Strawberry asset 功能稍薄(仅 Fruit/Flower/PhytomerCreation 函数,无 PhytomerCallback),v2.0 阶段补 ¥40-80k sim asset 工程预算[52]。完整原生物种清单详见 §12。
可持续护城河:v1.0 物理样机、柔性末端与作物力学、真实温室同步多模态 episode、失败与人工纠正数据、跨季节可靠性、客户现场交付和运维能力。模型组合、中文指令、单个 LoRA 或板卡调优不再折算为固定“18–24 个月壁垒”。训练成本、现金回收点和跨作物投入在完成数据与 Pilot Gate 后重新测算。
12仿真:能干什么 · 不能干什么
Helios plugins/plantarchitecture/include/Assets.h 物种清单(commit 1.3.72,2026.05 验证):
Almond · Apple · Asparagus · Strawberry ▲ v2.0 base 我们用 · Cherry Tomato ▲ v3.0 LoRA 我们用 · Tomato ▲ v3.0 LoRA 我们用 · Grapevine (4 trellis types) · Walnut · Pistachio · Olive · Bean · Cowpea · Capsicum · Maize · Rice · Wheat · Sorghum · Soybean · Butter Lettuce · Bougainvillea · Redbud · Bindweed · Cheeseweed · Puncturevine
v3.1+ 自写 PhytomerFn 路径:枸杞 Lycium barbarum (优先级 2 · 全国 100+ 亿 / 宁夏 340 亿) → 冬枣 Ziziphus → 柑橘 → 桃 / 梨 (同属借用)
柑橘 · Wellington 是 RAMI IV 外部几何
枸杞 Lycium barbarum · 4-8 工程师周自写
冬枣 Ziziphus · 同等工作量
Isaac Lab 农业 assets · ZERO
lab_assets/robots/ · 0 个农业机器人
manager_based/ · 0 个 agriculture / orchard / harvesting
"Find the Fruit" (arXiv 2505.16547) 的真相:Isaac Lab 农业相关最高调的论文,测试用的是塑料假果实——not real plants. 96% sim → 87% real-on-fake.[10]
3DGS + Helios 双轨
2024-2026 出现的 3D Gaussian Splatting 把 sim-to-real gap 又拉低一档。我们采用双轨而非二选一——Helios 负责程序化植株几何 + RL 训练,3DGS 负责视觉 sim-to-real 桥接 + 数字孪生 + 时序追踪。
| 方法 | 实证成功率 | 场景 | 引用 |
|---|---|---|---|
| RoboSplat(RSS 2025) | 87.8 % | 桌面 6 类泛化(姿态/类别/视角/外观/光照/本体) | arXiv 2504.13175[20] |
| SplatSim(CoRL 2024) | 86.25 % | zero-shot sim2real RGB policy | arXiv 2409.10161[21] |
| DexFruit / FruitSplat(Stanford 2025) | 92 % | 草莓/番茄/黑莓抓取 + 瘀伤减少 20 % | arXiv 2508.07118[22] |
| GrowSplat(Berkeley CASE 2025) | 时序数字孪生 | Sequoia/Quinoa 76 天 55 个时间点 | arXiv 2505.10923[23] |
① 几何精度 ~cm 级,不能直接驱动末端闭环——必须与硬件立体 / LiDAR 融合到 mm 级;② 户外强光 + 风扰 + 大尺度果园未公开实证;③ Jetson AGX 只能渲染 / SLAM,训练仍需云端 RTX 4090 / A100;④ 上述 86-92 % 数字限定桌面级 + 单物体 + 室内,不外推到田间。
结论:3DGS 作为数据增广 + 数字孪生外观层进入仿真栈;抓取闭环几何与物理仍以 Helios + 传统传感为准。二者非替代而是分层。
13能力模块图
整套系统按 6 个能力模块组织 — 感知、计算、机械臂、移动平台、末端 + 力反馈、续航 + 自动换电。每个模块给出 SOTA 主选型 + 国产可选 + 国际对照 + 阶段成熟度,主流件 80%+ 可国产替代,供应链对外脱钩可达。下文不出零售价 — 量产档采购口径由 Pilot 期议价框定,白皮书层面只锁住技术选型与阶段升级路径。
主选型:Intel RealSense D405 + D435 立体 · Depth-Anything-V2 神经深度 · YOLO11s + NanoSAM。国产可选:Orbbec Gemini 335 / 镭神 LS01D / 大族机器视觉(接口与 D435 等效)。成熟度:MVP 起 · Pilot 起加 NBV 第三视角。团队前期:v1.0 视觉栈使用 HALCON 离线相机标定 + Canny 边缘 + 亚像素曲率(团队 2025 已验证),v2.0 替换为 VLM-guided 神经感知栈 (YOLO11s + DINOv3 + Depth-Anything-V2 + NanoSAM + Qwen-VL 6-stage pipeline),HALCON 退化为离线 dataset 标注辅助保留[52]。License 说明:YOLO11s / YOLOv8 等 Ultralytics 系采用 AGPL-3.0,商业部署需购买 Ultralytics Enterprise license 或保留 copyleft;备选 RT-DETR (Apache 2.0) / NanoSAM (Apache 2.0) / Depth-Anything-V2 (Apache 2.0) 均无此限制,v0/Pilot 期评估是否切换。
主选型:Jetson AGX Orin + RK3588 + 机器人控制器/MCU。Orin承载 Qwen3-VL、YOLO11s/NanoSAM与 Diffusion Policy,RK3588承载边缘服务、设备接入和任务协同,控制器/MCU承载硬实时与安全联锁。国产 NPU保留为量产降本路线,但不改变当前参赛架构。
主选型阶梯:Dobot CR3(MVP 验证)→ Aubo i5 / Doosan M0617(Pilot)→ JAKA Zu 7 × 4(Scale)。国产可选:Aubo / 节卡 JAKA / 越疆 Dobot / 法奥 FAIR — 该模块 100% 国产可选,官方 ROS 2 + MoveIt2 dual_arms 兼容。对照:UR5e / Franka FR3。团队 v1.0 历史:v1.0 物理样机用双侧 Y-Z 直线笛卡尔臂(行程 135 mm / 重复精度 ±1.5 mm),v2.0 升级 6-DOF 串联以获更大灵巧度[52]。
主选型:AgileX Scout Mini 底盘 + Livox MID-360(3D LiDAR · 跑 FAST-LIO2 SLAM 主路)+ RealSense D435 视觉冗余(ORB-SLAM3 兜底)+ 9 轴 IMU + RTK 北斗 B1I/B2a 双频 + GPS L1/L5 双频(±2 cm 开阔 / ±10 cm 弱遮挡)。软件栈:ROS 2 Humble + Nav2(A* 全局 + DWA/TEB 局部)+ robot_localization EKF + nmea_navsat_driver,详见 §03.5 工程骨架。国产可选:宇树 Unitree / 阿尔法 Alpha / 拖挂自研底盘(按温室宽度定制);北斗模块千寻 / 司南导航。对照:Clearpath Husky。成熟度:Pilot 起配 · MVP 阶段固定工位免移动。团队 v1.0 历史:v1.0 龙门跨垄移动平台尺寸 350 × 1000 × 500 mm,离地间隙 600 mm,已验证硬件 v2.0 沿用[52]。
主选型:自研 4 指对称气动柔性硅胶软爪(食品级硅胶 + 增强纱网 + FDM 3D 打印模具,单指 60 mm 楔形,仿形曲率 R₁ = 10 mm / R₂ = 21 mm 双指,7 气腔室,16 kPa 闭环气压控制,单根输出力 0.263-0.334 N)+ 六轴 F/T 传感器 + IMU。国产可选:奥诺科技六维力 / 元生创新 ATI 替代 / 鑫精诚指尖传感。对照:ATI Mini40 / Robotiq FT-300。成熟度:团队 v1.0 物理样机已验证(300 次重复试验 / 91.3% 综合成功率 / 6.3% 破损率),v2.0 直接继承;Pilot 集成国产六维力 → Scale 模块化快换[52]。
电池主选:48 V / 100 Ah 磷酸铁锂(LFP,IP65,热插拔 < 5 min)×2 组双仓位,连续作业 4-5 h / 组。充电桩:固定式 6.6 kW DC 快充桩(CCS-Combo2 / GB/T 双协议),机器人自归航对桩(精度 ±2 cm 由 RTK + LiDAR 视觉对准协同保证)。BMS:CAN 总线接 ROS 2 节点,SoC / 温度 / 单体电压实时发布到 /battery_state 话题。能量管理:energy-aware mission planner 每 30 s 评估"剩余电量 vs 完成任务 + 归航 + 30% 裕度",不足即触发 Nav2 归航(详 §03.5 ④)。国产可选:宁德时代 / 比亚迪 LFP 电芯 + 沃特玛 BMS / 国轩高科 PACK;充电桩特来电 / 星星充电定制 6.6 kW 版本。对照:扫地机器人 ChargeStation 逻辑(精度等级不同,原理一致)。成熟度:MVP 阶段固定工位免移动 → Pilot 单充电桩 + 单换电仓 → Scale 多桩布点 + 备用电池架共享池。
13.3 自助 BOM 估算器
读完上方能力模块图,如果你想亲手拨一拨"这套机器跑起来到底多少钱"——下方配置器允许你按类别选机型、调定价倍率、看实时毛利结构。数据源于 2026-05 京东 / 淘宝 / 厂商官网 / 海外经销实价(详见 audit-2026-05/_phase2_5/bom-real-prices.md,38 条挂牌价多源交叉)。OEM 价按 100 台/年量产折扣 30-35% 推算。
计算单元A
机械臂 1 B · ×N
深度摄像头 2 C · ×N
激光雷达 + RTK GPSD
移动平台E
末端 + 力反馈 1 F · ×N
电源 / BMS(可选)G
勾选后并入 BOM。MVP 工位通电场景可不勾;Pilot / Scale 自带电源场景需勾入。
数据来源:京东 / 淘宝 / 厂商官网 / 海外经销(DJI Store / Intel RealSense Store / Ardusimple / Devonics / Vention / Unchained Robotics)多源交叉,时点 2026-05。OEM 100 台/年口径含 25-35% 量产折扣,与节卡港股 ASP ¥4.71 万、节卡招股书 ¥5.80 万互证。最终以厂商意向报价单为准。海外部署 +12-25% 关税 / +25-40% 经销加价 / +10-20% 现场服务,总价 ×3-5 倍。完整数据见 audit-2026-05/_phase2_5/bom-real-prices.md。
MVP · 实验室验证——固定工位完成单臂感知、视觉伺服、柔性抓取和独立安全闭环。Pilot · 首批试点——进入真实温室,增加移动平台、连续运行、漂移监控与现场接管。Scale · 量产候选——只有在全机能耗、8 小时稳定性、故障隔离、维护成本和客户 ROI 验证后,才确定多臂数量、计算板拆分和国产化组合。
采后分级 · Y2 规划
末端不背 NIR — 让光谱模组留在分级线。机械臂末端要的是 < 100 ms 决策延迟 + 抗振动 + 量产成本 < 500 元;而 NIR 单果糖度商用精度依赖 50-500 ms 静态积分 + 单品种 PLS 模型,至今全球无量产末端集成。Y2 起把糖度判断后置到采后线,由 NIR 模组完成 ±0.5 °Brix 的内部品质分级,与机器视觉外观瑕疵 + 称重粒径合并出标准化结果。
| 层级 | 方案 | 精度 / 速度 | 量级 |
|---|---|---|---|
| 整线 · 国际标杆 | TOMRA Inspectra² / Compac MLS | 10 fruit/s 通道 | 千万级整线 |
| 整线 · 国产主力 | 江西绿萌 FRUSCAN 7.0 · 合肥泰禾 | 5-8 fruit/s 通道 | 千万级国产整线 |
| NIR 模组 | 奥谱天成 NY2300 · 迅杰光远 IAS | ±0.5 °Brix · 5-8 fruit/s | 万元级 NIR 模组 |
| 手持参考 | Felix F-750 · Atago PAL-HIKARi | R² > 0.85 | 千元-万元级手持 |
| 芯片级 SWIR | Hamamatsu C12880MA · ams AS7421 | ≤ 100 ms 静态可达 | 千元级芯片 |
枸杞特殊说明:鲜枸杞蜡质反光 + 单粒 0.3-1 g 远低于 NIR 采样体积(> 5 g 等效路径),单粒 NIR 信噪比不足。Y2 走 高光谱成像 + 群体采样;等 SWIR 芯片化(trinamiX / ams-OSRAM 1-3 µm)成熟再升级单粒。
"整体解决方案"叙事必须给出 采→分→冷链完整链路。把 NIR 明确放在分级线(而非末端)是经过 ROI + 技术成熟度双重权衡的结果,避免被技术读者反问"采摘臂为什么不带 NIR"。
竞品 · 路线
国内 5 家直接对手中 3 家声明仅出自新闻稿,缺少同行评议。SOTA 三件套在我们的 2024-01 至 2026-05 检索范围内尚未同时被任何 peer-reviewed 系统达成——窗口未关。
14中国对手 · 经核实
| 公司 | 声明 | 证据级别 | 对我们威胁 |
|---|---|---|---|
| 蓝侠机器人 (深圳) | 冬枣 8s/果 85% <8% 损伤 | 新华网 + 人民日报 2025 | 大荔试点真 · 单作物 · 公开学术贡献有限 |
| 禾芯动力 | 蘑菇 + 植保 + 除草 5 场景 | 36Kr / 中国日报 | 邻接威胁 · 公开口径止于"环境感知 + 农业 AI 模型 + 多机协同" · 不同子市场 |
| 乔戈里 (KRTECH) | 多果种通用平台 · 国内 40w/台 | 2024 出口 2000 万美金 | 出海样本 · 不重叠技术对手 |
| 集萃智造 | 查无实据 · 主业非农业 | 公开定位为生态供方 · 非直接对手 | |
| 伟景智能 | 3D 相机累计 1500 出货 | 人形采摘仍 demo 阶段 | 平台型 · 非直接对手 |
| 遨博智能 / 岚江科技 | 关节臂 · 喷洒 / 除草 / 运输 | 行业可查 | 供应商 / 邻接 · 非采摘对手 |
| 南京农大 汪小旵 | 草莓 66→84% / 20s 演示 | 南农新闻办 + 新华社 2026-03 | 产业演示 benchmark · 软爪方向公开材料有限(团队设施农业 / 智能农装方向有显著学术积累) |
| 华南农大(番茄 / 荔枝末端执行器) | YOLOv9/v10-pose · STRAW-YOLO CEA 2024 | CEA / TASE peer-reviewed | Tier-1 学术 benchmark |
| CAS 合肥 + 宁夏大学 Xu 2015 | 振动 93.5% / 2.54% · 整丛非选择性 | Trans CSAE 2015 | 相关学术背景 · 非同赛道 |
* 本表分析以截至 2026-05 公开材料 + 媒体访谈为依据;对竞品技术栈的判断以其公开口径为准,未涉及对未披露内容的推断。中国发明专利申请有自申请日起 18 个月的公开期,本表可能未涵盖该窗口内未公开材料。表中具名学者在其主要研究方向(如汪小旵团队在设施农业 / 智能农装)有显著公开学术贡献。
15SOTA 三件套
跨 12 篇 2024-2026 论文综述后的真实瓶颈——不是夹爪软硬度,是遮挡感知和周期时间。
我们 2024-01 ~ 2026-05 检索 arXiv (cs.RO) + IEEE Xplore + Google Scholar + 知网 CNKI + Springer JFR/CompAg(共筛 ≥ 50 篇候选),在检索范围内未发现同时满足五条件的 peer-reviewed 系统:≥ 85% 成功率 + ≤ 5% tactile-graded 损伤 + ≤ 8 s 单果周期 + 开放果园 + 同行评审。最接近者:Tiantian 3/5(损伤未披露)、Lanxia 4/5(非 peer review)、柑橘 dual-arm 3/5。单项 SOTA 均已被分别跨越,窗口正在收紧。
| 最接近者 | 成功率 | 损伤率 | 周期 | 差在哪 | 出处 |
|---|---|---|---|---|---|
| Tiantian 番茄 (3 臂 gantry · Dong et al.) | 91.0 % | 未披露 | 4.62 s 等效(单臂 ~9 s) | 损伤未定量 | JFR 2026 rob.70168[32] |
| Lanxia 冬枣(新闻稿) | 85 % | < 8 % | 8 s | 损伤 > 5% · 非 peer review | People Daily 2025 |
| DailyRobotics 草莓(商业试点) | 未披露 | ~ 4 % | 4.57 s | 成功率未披露 · 非 peer review | AgFunder 2026 |
| 柑橘自适应抓取 | 未披露 | 2.6 % | — | 成功率与周期未对齐 | CompAg 2025 |
| Robofruit 草莓(商业温室) | 83 % | — | — | 损伤与周期未对齐 | Parsa JFR 2024[13] |
| 葡萄双臂 | 96.7 % | 3.2 % | 13.7 s/试 | 周期 > 8 s | Frontiers 2022 |
三个洞察:
- 软爪硬件不再是瓶颈——损伤率已 ≈ 人类。问题在视觉遮挡 + 周期
- WSU 草莓加风扇移遮挡 58 → 74%(+15.8 pp)—— "物理介入感知"是新思路[19]
- Rong 番茄 cut-point 88.5% → 抓取成功率 57.7% — 30 pp 流失在抓取/规划,不在感知前端
- 多臂加速比双口径:Tiantian 三轴 Cartesian gantry 3 臂 1.96×(η ≈ 0.65)/ Lammers & Zhu 双 4-DOF 苹果 28% time reduction(= 1.39× speedup, η ≈ 0.695)/ Zhu et al. arxiv 2505.10028 12 臂 Cartesian gantry simulation 12.7× @ 100 fruits/m² / Lu Agronomy 15:1446 4 臂运动学。6-DOF 4 臂协作目标 2.5-2.8×(stretch, η = 0.62-0.70)/ 保守 1.8-2.4×(紧协作 baseline, η = 0.45-0.60)—— 不是 N 倍线性,BOM × N 时收益边际递减
团队 v1.0 物理样机基础线 E(垄作草莓采摘机器人,2025 年实验室仿垄环境,300 次内部重复试验):综合成功率 91.3% / 破损率 6.3% / 单果周期 15.1 s(移动 5.9 s + 唇展 4.4 s + 齿抓 0.4 s + 唇闭 4.4 s)。破损率距 ≤5% 目标尚有 1.3 pp,周期仍需显著提速;73.1% 的破损与视觉坐标偏差导致的唇机构擦伤相关。v2.0 工程目标 T仍为 ≥95% 成功率 / ≤5% 破损率 / ≤8 s,但不再宣称由某个固定 VLM + DP + RTC 组合保证,而由感知、策略、安全和真实温室 Gate 逐级验证。[52]
HarvestFlex 等工作已经证明农业 VLA 不再是空白,因此新版不再宣传“最早定义品类”。通用模型越强,模型拼装本身越难成为壁垒;智采的差异化应建立在柔性末端与作物力学、真实温室同步 episode、失败与人工纠正数据、跨季节稳定性、恢复策略和现场交付能力上。GR00T N1.7、Qwen-VLA 与其他通用策略只作为加速器和对照组。[33]
* 五条件定义:(1) ≥ 85% 选择性采摘成功率(开放/温室环境,未受控);(2) ≤ 5% tactile-graded 损伤率(FEA 仿真或人工评级,非外观目测);(3) ≤ 8 s 单果周期(含视觉 → 规划 → 抓取 → 放置完整链路);(4) 开放果园环境(含遮挡 / 风扰 / 光照变化);(5) peer-reviewed 期刊或顶会发表。检索方法:2024-01 至 2026-05 检索 arXiv (cs.RO) + IEEE Xplore + Google Scholar + 知网 CNKI + Springer JFR/CompAg,关键词 fruit harvesting / picking robot / selective harvesting / orchard robot,共筛 ≥ 50 篇候选。本声明每 3-6 个月复核。
166 个月技术里程碑
路线图以“通过 Gate”而不是“按周宣布模型成功”为核心。人员与工期需要在 Gate 0 数据审计后重新核算;两名工程师同时覆盖数据、感知、策略、机械臂、安全、边缘部署和真实温室 Pilot 属于高风险假设。
旧数据可回放率、字段完整性、时间同步、失败/接管/结果标签与 split 防泄漏。
跨光照、遮挡、风扰、品种、镜头污损的精度、校准、不确定度和 P95/P99 延迟。
完成 Diffusion Policy + RTC 真机闭环,验收轨迹连续性、成功率、破损率、恢复率和周期 P95;升级储备不阻塞主线。
算子覆盖、量化损失、尾延迟、热降频、峰值功耗、全机能耗和 8 小时稳定性。
断网、节点失联、相机掉线、模型超时/OOM、旧消息、时钟跳变和独立硬安全。
完好果实/小时、接管率、恢复率、破损率、周期 P95、连续运行与分布漂移。
CE 认证与功能安全 · 重新基线
截至 v4.4,旧表中的 2026-06 / 2026-07 节点已经过去,不能继续作为默认完成状态。认证路线已经确定,具体完成状态由项目负责人重新基线;独立硬安全从 Gate 0 起进入架构,不等待 Pilot 最后一阶段补做。
| 时间 | 动作 | 交付 |
|---|---|---|
| 2026-06 | NB 询价(TÜV SÜD / SGS 双线)+ EN 标准对账 | NB 报价单 + 适用 EN 清单 |
| 2026-07 | NB 合同签订 | 项目启动函 |
| 2026-10 | 技术文档提交(含 AI safety function 论证 + EN ISO 13849 PLd/PLe) | TD pack v1 |
| 2027-04 | 样机测试通过 | Test Report |
| 2027-07 | CE 拿证 | EC Declaration of Conformity |
| 2027-08 | EU 首发 | 首单交付 + Notified Body 证书附本 |
出海 · GTM 路径
国内开放果园选择性采摘的规模商业化(农场端采购)尚处早期(设施菇 / 草莓室内 0→1 已加速,长三角果林 / 西北枸杞仍空白);欧美劳工缺口 + H-2A 工签 + 头部种植集团 3 季商业试点已积累,短期订单池形成(多以 RaaS / 多年订阅为主)——叠加 CE Machinery Regulation 2027 切换。团队选择海外优先收订单 + 国内长三角 / 卢皋落户同步打样的双轨节奏,与 §20 乔戈里 / 极飞 / 大疆出海路径同源。
17需求侧 · H-2A 缺口曲线
美国农业劳工市场已被 H-2A 工签体系深度依赖,缺口曲线持续陡峭——这是采摘机器人海外订单池的根本来源。
| 指标 | 数值 | 趋势 | 来源 |
|---|---|---|---|
| FY2025 H-2A 认证岗位 | 398,258 | 10 年 +185 % | AFBF 2025-03 |
| 2030 趋势线预测 | 突破 50 万 (500,000+) | 近 5 年 CAGR 8.7% | DOL ETA OFLC + AFBF + MPI |
| 2025 岗位本土申请率 | 182 / 415,000 ≈ 0.04 % | 近乎归零 | Niskanen Center |
| 典型客户决策周期 | 2-3 季试点 → 量产 | 蘑菇 / 温室更快 | Tevel · Advanced.farm WA |
18直接对标 · 欧美 5 家
采摘机器人海外赛道已分化为四种商业模式。学谁、避谁,由商业模式可持续性决定。本表事实截至 2026-05;海外赛道动态(Wavemaker / CNH Industrial / Oishii 等收购链)持续跟踪。
| 公司 | 作物 | 商业模式 | 定价 / ROI | 融资 | 结局 / 状态 |
|---|---|---|---|---|---|
| 4AG Robotics (CA) | 蘑菇 | 前置硬件 + 续费 | ~100w USD · ROI 18-30 月 | C$40M Series B (2025-07, 约 US$29M) | 最热 · 学这个 |
| Tevel (IL) | 苹果 / 桃 / 橙 | 飞行集群 + 整机伙伴 | 不公开 | $20M Series B | 飞行方案最有量产相 |
| Advanced.farm (US, 2024-Q4 起 CNH Industrial 旗下) | 草莓 + 苹果 | 卖断 + 服务合同 | 前 roadmap 2027 商业 20 台(CNH 整合后未单独重申) | 前融资 $34-35M (Kubota / Yamaha);2024-10 CNH Industrial 全资收购 | 并入 CNH · 退出通路验证 · 商业化通道最稳 |
| Tortuga AgTech (US) | 草莓 | 纯 RaaS (pay-per-pick) | 现金流压力大 | ~$49M(PitchBook $49.29M;Crunchbase 含 SAFE+debt 宽口径约 $55M) | 2025/3 核心团队与专利被室内草莓公司 Oishii 人才并购(acqui-hire) |
| Abundant Robotics (US) | 苹果 | 卖断(行业估算 ~$1.5M/台) | 实测 ≈ 6 vs 目标 ~10 bins/h | ~$12M 累计 (GV / Yamaha / KPCB Edge) | 2021/5 停运(wind-down · funding fail)· IP 售 Wavemaker Labs / Future Acres(2021/10, 后续搁置)· Advanced.farm(当时独立)拍卖得原型机独立研发 |
赛道 M&A 密集本身就是信号:5 家中 3 家在 2021-2025 已发生重大事件 —— Abundant 2021/5 停运 + 资产拍卖、Tortuga 2025/3 被 Oishii 收购、Advanced.farm 2024/10 被 CNH Industrial 全资收购。三起事件都发生在"工程原型成熟但还没规模化营收"的窗口期。这说明采摘机器人赛道的关键里程碑不是 IPO,而是"做出 CNH / Kubota / John Deere 愿意 M&A 的工程原型"——退出通路已被 Tortuga / Advanced.farm 两案验证。
* 货币说明:C$ = 加元;表内未前缀 $ 默认 US$。4AG Series B 公告时点 2025-07,月均 C$/US$ ≈ 0.731(Bank of Canada)。
学 4AG 前置硬件 + 续费(资本最买单,C$40M Series B 是证据);避 Tortuga 纯 RaaS(押注算量,现金流坑);学 Tevel 整机伙伴(与本地 OEM 配套,避免单打独斗的渠道空缺)。
19认证 · 第一道硬门槛
| 区域 | 认证 | 关键点 | 影响 |
|---|---|---|---|
| 欧盟 | CE Machinery Regulation (EU) 2023/1230 | 2027-01-20 application date(无双轨期)· Annex I Part A Items 5-6 + Article 25 §2 强制 Notified Body 第三方认证(非 self-declaration)· 周期典型 9-15 月含 1-2 轮返工 / AI safety 复杂场景 18+ 月 · 费用 NB €80-200K + 全包 €150-480K · 12+ 项 EN 标准(ISO 18497-1/2/3/4 + ISO 10218 + ISO/TS 15066 + ISO 13849 PLd/PLe + ISO 12100 + EN 60204-1) | 硬门槛 · 2027 前必须前置 · 江苏 / 卢皋补贴对冲 30-50% |
| 美国 | ANSI/ASABE + OSHA + EPA | 无统一强制;UV-C / 化学剂涉 EPA | 可逐步合规 |
| 电池 | UN38.3 | 锂电运输 + 海运强制 | OEM 标配 |
| 中国出海 | — | 极飞 70 国 / 大疆 100 + 国农机渠道可复用 | 现成基础设施 |
20中国样本 · 乔戈里 2000 万美金
乔戈里科技(杭州 KRTECH)2024 年出口 2000 万美金,业务遍布五大洲。卖断为主,覆盖猕猴桃 / 苹果 / 番茄 / 草莓 / 梨多果种——中国采摘机器人出海最实在的样本。路径 = 多果种通用平台 + 渠道分销,不押注单果种深度。
同时极飞 / 大疆的植保无人机已建好海外农机渠道(极飞 70 国、大疆 100 +),丰疆智能插秧机用 20-30 % 低价进入欧美——这些基础设施都可被采摘机器人复用。短板是 (a) CE 认证流程未补齐 (b) 海外售后季节保障团队空白 (c) 单果种深度不及 Tevel WA 3 季试点。
中国农机出海 CE 样本
| 公司 / 机型 | 认证 | 认证机构 | 时点 | 覆盖 |
|---|---|---|---|---|
| 极飞 P/R150 植保无人机 | CE Machinery | TÜV Rheinland | 2018-2020 | 70 国 |
| 极智嘉 Geek+ AMR | CE Machinery | TÜV Rheinland | 2019 | 全球仓储 |
| 高仙商用清洁机器人 | CE Machinery | TÜV / SGS | 2020-2023 | 欧美主要市场 |
| 智采·万果通(本团队) | CE Machinery Regulation (2023/1230) | TÜV SÜD / SGS(询价中) | 2027-07 目标 | 中国农业自主移动双脑机器人 (VLM + Policy) EU CE 第一例差异化 |
海外订单池真实 + 4AG/Tevel 商业模式可学 + CE 认证可前置 + 乔戈里 / 极飞 / 大疆渠道可复用 + 蘑菇 / 温室决策周期短 = "先蘑菇 + 温室出海拿现金流,再果园 + 长周期拿大单" 双阶段路径。
为什么这套架构
参赛主栈已经锁定:Qwen3-VL理解任务,YOLO11s/NanoSAM/RGB-D完成感知定位,Diffusion Policy + RTC生成柔性动作,ROS 2/MoveIt 2组织系统,Orin/RK3588承载边缘计算,独立硬安全守住执行边界。
所有重要数字与技术结论区分 E / R / T / H / C;外部论文、厂商能力和工程目标不再写成团队已实现事实。
具身监督、感知几何、动作技能、实时控制和硬安全各有唯一权威来源;VLM 不控制电机或安全边界。
Diffusion Policy + RTC负责柔性采摘动作和连续执行;ACT、GR00T N1.7、Qwen-VLA作为下一阶段升级储备。
从成功 demo 升级为示教、自主运行、失败、接管、纠正、结果与漂移监控的完整数据闭环。
感知、几何、动力学、末端、策略与成功判据分别评估,不用固定 LoRA 数字掩盖硬件与场景差异。
v1.0 样机、柔性末端与力学、真实温室 episode、失败恢复、跨季节运行和客户现场交付。
引用
- Oquab et al. DINOv2: Learning Robust Visual Features without Supervision arXiv 2304.07193 (2023). arxiv.org/abs/2304.07193
- Chi et al. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion RSS 2023. arxiv.org/abs/2303.04137 · code: github.com/real-stanford/diffusion_policy
- Kim et al. OpenVLA: An Open-Source Vision-Language-Action Model arXiv 2406.09246 (2024). arxiv.org/abs/2406.09246
- Black et al. Real-Time Execution of Action Chunking Flow Policies arXiv 2506.07339 (2025). arxiv.org/abs/2506.07339 · code: github.com/Physical-Intelligence/real-time-chunking-kinetix
- HuggingFace LeRobot v0.5.1 (commit 1396b9fab7) — v4.2 历史基线,v4.4 已锁定迁移至 v0.6.1。github.com/huggingface/lerobot
- π0.5 — Physical Intelligence. pi.website/blog/pi05 · openpi: github.com/Physical-Intelligence/openpi
- Qwen2.5-VL Technical Report arXiv 2502.13923 (2025) — v4.2 历史方案;v4.4 主栈已升级并锁定 Qwen3-VL-4B。
- NVIDIA NanoSAM. github.com/NVIDIA-AI-IOT/nanosam
- PlantSimulationLab Helios v1.3.72. github.com/PlantSimulationLab/Helios · plugins/plantarchitecture/include/Assets.h
- Subedi et al. Find the Fruit: Sim-to-Real Manipulation in Deformable Plant Foliage arXiv 2505.16547 (2025).
- Chi et al. real-world DP demo counts: Push-T 136, Pour 90, Mug Flip 250, Shirt 284 (Table 3 + §7).
- Ze et al. iDP3 arXiv 2410.10803 (2024) · 15 Hz claim contested by issue #26.
- Parsa et al. Robofruit: Automated Strawberry Harvesting Robot J. Field Robotics 2024. DOI 10.1002/rob.22229
- Rong et al. A Selective Harvesting Robot for Cherry Tomatoes J. Field Robotics 2024. DOI 10.1002/rob.22377
- Xu, He et al. Simulation Analysis and Prototype Test of Vibration Mechanism for Lycium barbarum Picking Trans. CSAE 31(10), 2015.
- NJAU sea-anemone gripper announcement. Xinhua 2026-03-30. english.news.cn (84%/20s 已验证;25%→<2% 数据无主源)
- Lanxia winter jujube pilot. People's Daily Online 2025-07-17. en.people.cn (新闻稿,无 peer-reviewed paper)
- Zheng et al. Multiscale computation study on bruise susceptibility of blueberries from mechanical impact Postharvest Biol. Technol. 209 (2024). sciencedirect.com/S0925521423004210 (FEA 离线损伤判据 · PEEQ ≥ 0.1 · E=0.339 MPa · σ_y=0.063 MPa)
- He et al. Hidden strawberries: AI vision + silicone fingers + fan to address occlusion Computers and Electronics in Agriculture 2025, article 110684. sciencedirect.com/S0168169925007902 (WSU · 58 → 74% +15.8 pp)
- Yang et al. RoboSplat: Generalizable one-shot manipulation via 3DGS augmentation RSS 2025. arxiv.org/abs/2504.13175 · github.com/OpenRobotLab/RoboSplat
- Qureshi et al. SplatSim: Zero-shot sim-to-real RGB policy with Gaussian Splatting CoRL 2024. arxiv.org/abs/2409.10161
- Stanford ARMLab. DexFruit / FruitSplat: dexterous fragile fruit handling with 3DGS arXiv 2508.07118 (2025). arxiv.org/abs/2508.07118
- Berkeley AUTOLab. GrowSplat: 4D digital twins of growing plants CASE 2025. arxiv.org/abs/2505.10923
- Gunderman et al. Tendon-driven soft robotic gripper for blackberry harvesting IEEE RA-L 2022. ieeexplore.ieee.org/9684953 (黑莓软爪 0.5 N 工作点 — "0.5N" 真正出处)
- Yu et al. Visual bruise assessment and analysis of mechanical impact measurement in southern highbush blueberries ASABE Paper 44284 (2014). researchgate.net/293349787 (BIRD 法 · 120 cm 跌落 / Scintilla 76% 瘀伤)
- [已删除] 此处原引用 DuoCore-FS arXiv 2512.20188 在 arXiv / Google Scholar / OpenReview 检索 0 命中,疑似幻觉来源,2026-05 audit 中移除。1-3 Hz / 25-30 Hz 频率分工的实证背书改由 [27] Hi Robot / [28] GR00T N1.5 / [29] Helix 三条共同支撑。
- Physical Intelligence. Hi Robot: Hierarchical VLA with high-level reasoning arXiv 2502.19417 (2025). arxiv.org/abs/2502.19417 · pi.website/research/hirobot
- NVIDIA GEAR. GR00T N1 / N1.5: A foundation model for generalist humanoid robots arXiv 2503.14734 (2025). arxiv.org/abs/2503.14734 · research.nvidia.com/labs/gear/gr00t-n1_5
- Figure AI. Helix: A Vision-Language-Action model for generalist humanoid control 2025. figure.ai/news/helix (7-9 Hz VLM + 200 Hz visuomotor)
- MLC AI. XGrammar: Flexible and efficient structured generation engine 2024. github.com/mlc-ai/xgrammar · OpenReview rjQfX0YgDl (FSM 压缩 · 零增量延迟)
- JAKA Robotics. jaka_ros2 official ROS 2 driver. github.com/JAKARobotics/jaka_ros2 · MoveIt2 dual_arms 兼容
- Dong T., Zhang Y., Luo X., Song X., Qin X., Liu Y., Bai Z. Design, Development, and Field Test Analysis of a Multiarm Tomato Harvesting Robot Journal of Field Robotics, first published online 26 January 2026, advance online publication. DOI 10.1002/rob.70168 (NUIST · 3 臂 Cartesian gantry · 91% / 4.62 s 等效 · 加速比 1.96×)
- Kim et al. Behavior Cloning in Unstructured Agricultural Environments for Pepper Harvesting arXiv 2411.09929 (2024). arxiv.org/abs/2411.09929 (300 demo / 28.95% in-field · BC + scissor gripper · peduncle 失败模式 · 原描述误标 "diffusion policy",audit 订正)
- Black et al. (HarvestFlex). Strawberry VLA with 227 VR teleop demos arXiv 2603.05982 (2026). arxiv.org/abs/2603.05982 (唯一草莓采摘 VLA 公开数据)
- Open-X-Embodiment Collaboration. Open X-Embodiment: Robotic learning datasets and RT-X models arXiv 2310.08864 (2023). github.com/google-deepmind/open_x_embodiment (1M+ 轨迹 · pre-training 基座)
- Khazatsky et al. DROID: A large-scale in-the-wild robot manipulation dataset arXiv 2403.12945 (2024). droid-dataset.github.io (76K 轨迹 · Franka 同构 pre-train)
- 4AG Robotics. Series B C$40M announcement (Astanor / Cibus 领投, 2025-07). 4ag.ai/40m-series-b (蘑菇采摘 · 前置硬件 + 续费模式)
- Tevel Aerobotics. Series B $20M for flying fruit harvesting robots (2021-02-09). fruitgrowersnews.com/tevel-20m (Maverick Ventures Israel 领投 · Bosch RBVC + Kubota 跟投 · 2024 Washington / Italy 试点扩张延续 · 整机伙伴模式)
- AFBF. H-2A Program Use Continues to Soar — 398,258 H-2A positions projected for FY2025 Market Intel, March 2025 (accessed 2026-05-18). fb.org/market-intel/h-2a-program-use-continues-to-soar (10 年 +185%; 首手源 USDOL OFLC Annual Selected Statistics FY2025)
- DOL ETA OFLC. H-2A Performance Data FY2024. dol.gov/agencies/eta/foreign-labor/performance (2024).
- Migration Policy Institute. H-2A Agricultural Visa Program: Trends and Outlook. migrationpolicy.org (2023). 注:"突破 50 万 by 2030"为行业外推测算,非 DOL 官方点预测。
- EU. Regulation (EU) 2023/1230 on machinery. OJ L 165, 29.6.2023, p.1-102. 关键节点:Annex I Part A Items 5-6、Article 25 §2、Recital 51-55、Article 51-52。eur-lex.europa.eu/eli/reg/2023/1230
- CEMA. Transition to Machinery Regulation 2023/1230: Implementation Guide for Agricultural Equipment. Brussels, 2024. cema-agri.org
- EU-OSHA. Machinery Regulation 2023/1230 — Worker Safety and AI Safety Functions. Bilbao, 2024. osha.europa.eu
- European Commission DG GROW. Machinery Regulation Q&A. Brussels, 2024-2025. single-market-economy.ec.europa.eu
- OJ list of harmonized standards under Machinery Regulation 2023/1230(含 EN ISO 18497 · EN ISO 10218 · ISO/TS 15066 · EN ISO 13849 · EN ISO 12100 · EN 60204-1 等)。2024-2025 更新。
- The Robot Report. Abundant Robotics is shutting down (2021-05-26). therobotreport.com/abundant-robotics-shutting-down
- The Robot Report / dot.LA. Wavemaker Labs acquires Abundant Robotics technology (2021-10-19).
- Good Fruit Grower. Advanced.farm apple harvester project · prototype acquired at Abundant auction (2022). 原文措辞 "one of the prototype units"(弱定量)。
- CNH Industrial newsroom. CNH to acquire advanced.farm (2024-10-29). + The Robot Report mirror 2024-10-29.
- Oishii. Strengthening our automation roadmap (2025-03-11). + AgFunderNews mirror 2025-03-12 "Oishii acquires Tortuga AgTech's robotics IP".
- Tortuga AgTech 融资 ledger:Crunchbase crunchbase.com/organization/tortuga-agtech;PitchBook Tortuga AgTech profile (subscription,$49.29M ledger 主源)。
- 本团队柔性并联机器人动力学建模与神经网络补偿控制内部研究(2023);内部技术资料(奇异摄动 + RBF 神经网络复合控制 / 混合轨迹 RBF 补偿,方法可迁移至 §13 末端力位混合反馈)。
- 本团队垄作草莓采摘机器人 v1.0 物理样机内部研究(2025);内部技术资料(力学数据见 §01 ④;末端 spec 见 §13 module 05;整机基础线 91.3% / 6.3% / 15.1 s 见 §15 SOTA 表后段)。
- Meta AI Research. DINOv3: Self-supervised vision transformers, scaled (2025-08). ai.meta.com/dinov3 · github.com/facebookresearch/dinov3 (drop-in upgrade vs DINOv2; NASA JPL / World Resources Institute production users).
- Ordinal regression head for 4-class fruit ripeness (天然有序 绿→粉→红→过熟): see Cao & Niu 2020 / Niu 2016 (ordinal logistic CNN), 2024-2025 在农业 ripeness 复用 (better than softmax MLP for ordered labels).
- Liu et al. Grounding-DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection arXiv 2303.05499 (2023). arxiv.org/abs/2303.05499 (long-tail fallback: 文本 prompt "ripe X" 自然语言指定新作物类,无需重训分类头).
- Fruit-Ripeness-MetaFruit / MaturNet (CDFRB) — 5-crop ripeness detector mAP 62.6%, 2025 closest "multi-crop foundation" attempt. 还不是真 foundation model, 但是 cross-crop baseline 参考.
- Cross-VLM agriculture benchmark (arXiv 2512.15977, 2025): Gemini-3 Pro MCQ 62%, all VLMs underperform YOLO11 supervised baseline on 27 AgML datasets / 162 classes — confirms VLM zero-shot ripeness is only viable as assistive cross-check, not standalone.
- Qwen Team. Qwen3-VL official repository and technical resources (2025-2026). github.com/QwenLM/Qwen3-VL (2B/4B/8B 等 edge-to-cloud 候选;空间、遮挡与 2D/3D grounding 能力)。
- NVIDIA. Isaac GR00T N1.7 official repository and 3B checkpoint (2026-07). github.com/NVIDIA/Isaac-GR00T · NVIDIA Technical Blog (ONNX/TensorRT 路径;草莓场景和许可证边界需单独核验)。
- Google DeepMind. Gemini Robotics ER 2 (2026-07-30). official announcement · model card (高层具身推理与 VLA/工具编排参照;非开源本地动作模型)。
- Qwen Team. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments arXiv 2605.30280 (2026). official repository (研究与评测参照;公开页面不足以证明生产部署栈已完整发布)。
- Hugging Face. LeRobot releases v0.6.0 / v0.6.1 (2026-07/08). github.com/huggingface/lerobot/releases (world/reward models、rollout、人工纠正与 breaking changes)。
- Physical Intelligence. π*0.6 / RECAP (2025-2026). pi.website/blog/pistar06 (demonstrations、on-policy experience、expert interventions 与 reward-driven post-training 数据闭环)。
声明:v4.4 参赛技术栈与机器人基础模型资料复核至 2026-08-14。D表示已锁定技术决策,E/R/T/H/C分别表示团队实测、外部证据、工程目标、待验证假设和技术储备。主栈确定不等于全部性能指标已经达成;成功率、破损率、周期、延迟、功耗和迁移效果按 Gate 验收。