EgoANT
on WGO-Bench HomER

WGO-Bench HomER · EgoANT

EgoANT 是一套面向第一视角人类操作视频的自动标注管线,用于将长视频划分为动作级片段,并为每个片段生成简洁的操作描述。在 WGO-Bench HomER 的 25 个视频 / 470 个参考片段上,最佳分段配置取得 Segment F1 0.2031;在固定该预测边界后,多候选标注与选择方案取得 Semantic E2E F1 0.1542。

第一视角 人手数据 子任务 WGO-Bench EgoANT
进入报告

导读:第一视角操作视频的子任务分段与语义标注

为将第一视角人类操作视频转化为结构化训练数据,我们需要识别其中的动作级时间片段,并为每个片段生成简洁的语义描述。这类视频通常包含相机运动、手部遮挡和连续的细粒度操作。

动作边界与语义描述可用于 VLA 预训练、层级技能学习和奖励模型构建。人工逐小时标注难以覆盖大规模视频,因此需要可审计的自动标注管线。

相关数据集与标注方法

  • Egocentric 数据族:EgoVerse / EgoDex / EgoLive 等第一人称人手操作演示,面向规模化 human-to-robot 数据。
  • HomER:WGO-Bench 里的 egocentric human 子集;本报告的评测范围为 HomER 25 / 470 gold 段。
  • VITRA:把真实人手视频转成 VLA 训练信号的公开工作,启发「先运动/手部信号,再写 caption」的思路;EgoANT 生产线用 HaWoR 腕速实现切段,而非直接跑 VITRA 模型。
  • WGO-Bench / Macrodata blog:公开「切段 + 短句」评测协议与 Gemini 参考分,以及约 $2.64/视频小时(batch)的端到端开销。
  • Scale Labs dense video captioning:在已切好的 clip 上做稠密描述;不做 raw episode 的切段问题。

本页报告 EgoANT 在 HomER 上的评测协议、方法设计、主要组件比较、失败模式和成本分析。

评测范围:本页分数与推荐配置与使用边界均锚定 HomER。WGO-Bench 中的 robot 视角子集,以及其他 egocentric 库上的同协议结果尚未在本页报告,留待后续扩展。
HomER-only 范围对照:EgoANT 的 Segment F1 为 0.2031;Macrodata 报告的 HomER-only Gemini 参考约为 0.227,绝对差为 0.0239。 端到端本页 0.1542(公开 blog 全量 E2E≈0.168 为不同子集,只作量级对照)。 固定边界标注 Qwen 栈 Gemini judge 下 raw 27B 为 55.7%,raw 397B / HaWoR hand-crop 约 50.2–50.9% vs Macrodata 公开 ≈61%——句子质量仍有差距。 核心观察:粗到细的分段策略显著高于腕速生产基线;简单 raw-frame 标注在 HomER 上比更复杂的视觉上下文更稳定;多候选选择在额外调用成本下取得最高 E2E 观察值。

结论速览

Segment F1
0.2031
整集粗分 + 局部再切(窗口不外扩、盖住完整动作)· Qwen3.6-27B
Label Acc(固定边界)
55.7%
raw 27B:固定参考边界下的最高 Label Acc
E2E F1
0.1542
S2 预测边界 + 397B 多候选 selector

1. 术语、数据集与实验设置

Macrodata 公开报告在谈什么

Macrodata · Annotating Robot Video Subtasks 将“长视频 → 动作级片段 + 短语义描述”定义为公开评测问题:发布数据集 WGO-Bench、三种分数(分段 / 固定边界标注 / 端到端),以及 Gemini 等参考分。 本报告在同一评测协议上,给出 EgoANT 的可复现消融:主要配置、失败模式与推荐路径。

Egocentric 数据与 WGO-Bench

规模化第一人称人手数据常见族系包括 EgoVerse / EgoDex / EgoLive 等;它们提供长程 human 演示,但「如何生成时间边界和短操作描述」仍需标注协议与评测。 WGO-Bench 把这一问题做成公开基准(约 100 个 episode),其中 HomER 是第一视角人类操作子集——画面晃、手挡、动作密,通常比桌面第三人称更难。 本报告固定评测:HomER 25 集 / 470 个 gold 子任务段。 Macrodata 全量 100 集 Segment F1≈0.306 是 Gemini 主线 headline;HomER-only 更公平的对照约 0.227。 不宜与全量 100 集 headline(0.306)直接对比。同协议下其他子集的结果见导读范围声明。

生产管线与 WGO-Bench 评测管线

EgoANT 是我们的 egocentric 人手视频自动标注系统。它有两条需要分清的路径:

  • 生产管线(日常批标):HaWoR 手重建 → 腕速平滑与 minima 切段 → 段内 raw 抽帧写短句 → merge judge / rewrite。 细节见 附录 D。启发来自 Vitra 一类「先运动再 caption」工作流,但切段后端是 HaWoR 腕速,不是 Vitra 模型
  • WGO-Bench 评测管线:带时间戳的 contact sheets → Qwen3.6-27B 分段 → 固定预测边界后的语义标注与多候选选择。 正文消融主要讲这条线。

模型栈以 Qwen 为主:分段用 Qwen3.6-27B(快、便宜、可复现), 标注 / judge / selector 用 Qwen3.5-397B(句子质量与选优)。 相对 Gemini 参考栈,同一套权重与 prompt 可在不同机器上复跑,消融结论可核对。

角色 模型 是否读取 gold 信息 在本文中的作用
Segmenter Qwen3.6-27B 生成预测时间边界
Caption generator Qwen3.6-27B / Qwen3.5-397B 生成候选语义标签
Candidate selector Qwen3.5-397B 从候选标签中选择最终标签
Primary evaluation judge Gemini-3.5-Flash 只读取 gold 标签用于离线评分 计算 Label Acc 与 Semantic E2E F1

GEPA 在本文里指什么

  1. GEPA 本身:一种 reflective prompt evolution 方法。Macrodata 博客中说明,他们用 GEPA 在独立验证集上搜索更好的分段 prompt。
  2. 我们实际复用的东西:搜索结果沉淀下来的一段英文分段 prompt(他们内部名 completed_events_duration_prior_v1)。
  3. 因此本文不把 GEPA 当作运行时模块:我们没有重新跑 GEPA,也没有把 GEPA 当模型或后处理脚本;只是把那组规则写进 VLM 请求文本。
  4. 怎么用:整集 contact sheet 图像 + 这段英文规则 → 一次粗分。规则要求只标完成事件、偏好约 2–10 秒、忽略靠近/微调/收回等非完成事件。样例 Step 02 折叠区为英文全文;概念与实现见 附录 B,原文下载见 附录 F

后面会反复出现的几个词

  • 时间窗口:视频时间轴上的一段连续区间(例如 84–94 秒),不是软件 UI 窗口。
  • 第一遍加密切(S1):提高切段密度以抬召回(容易切碎)。详见 附录 B
  • 第二遍局部精修(S2):在粗边界附近的一小段时间里再切一次。
  • 窗口不外扩(pad=0):精修时只看粗边界这段,不引入窗口外相邻动作。
  • 盖住完整动作(full-cover):这段里看得见的完成事件都要切到,避免不完整微动作片段。
  • selector / judge:selector 从多条候选标签里选一句定稿;judge 只用于打分,判断预测句与 gold 是否同一完成事件。
  • HaWoR:手部重建,用来得到估计腕部轨迹并生成 wrist-guided crops(贵;默认标注仍可用 raw 帧)。
  • Qwen3.6-27B:分段主模型(日志有时写作 28B endpoint,同一服务);Qwen3.5-397B:标注 / judge / selector。
易混淆的视觉输入: contact sheet(分段用时间戳拼图)≠ 整帧 temporal collage ≠ L1 邻段 sheet ≠ L2 YOLO/proxy hand-collage ≠ HaWoR-reconstructed wrist-guided crop。

2. 评测指标

完整公式与直觉见 附录 A。正文只记定义与玩具例。

  1. Segment F1:只评时间切分(时间边界质量);IoU≥0.75 一对一配对。
  2. 固定边界 Label Acc:时间用 gold,只评句子是否同一完成事件(语义描述)。
  3. Semantic E2E F1:先时间配对,再对配对成功的 pair 做语义 judge;时间边界质量与语义描述都过才算。

简化示例(与 scorer 逻辑一致):

Temporal IoU and F1 scoring diagram
该图展示如何先用 IoU 判断 pred/gold 时间段是否重叠足够,再由匹配数计算 precision、recall 和 F1。

Gold:G0[0,3], G1[3,6], G2[6,10] · Pred:P0[0.5,2.8], P1[2.8,5.5], P2[5.5,8], P3[8,9.5]

  1. Outer snap:P0.start→0,P3.end→10
  2. IoU:P0–G0≈0.933,P1–G1≈0.781
  3. n_match=2 → P=0.50,R≈0.67,F1≈0.571
Gold / 人工标注 Pred / 模型预测

3. Contact-sheet 视觉输入

我们不把整段 MP4 作为视觉输入直接提交给模型,而是每隔 0.5 秒抽一帧,缩到约 224×144, 每张 sheet 20 格(5×4),格子上画黄色时间戳。 一张 sheet 大约覆盖 10 秒;一集长视频会拆成多张 sheet。

Visual input taxonomy comparing raw frames, proxy overlays, temporal collages, neighbor sheets, and hand crops
该图展示 raw frames、proxy overlay、temporal collage、neighbor sheet 和 wrist-guided crop 等视觉输入的差异。

读图:contact sheet 用来找边界;raw 是固定边界标注的最朴素输入;proxy overlay 是在原帧上叠加光流/启发式提示,不是真手部重建; temporal collage 与 neighbor sheet 引入前后文;基于 HaWoR 重建腕轨迹的裁剪依赖估计腕部轨迹。Gemini 重评显示,增加视觉上下文并未提高 HomER 上的固定边界标注准确率。

3.5 边界对照:同一视频上的三种分段结果

对齐 Macrodata 博客的 Boundary comparison 交互:上方播视频,下方多轨时间轴;播放头随时间移动,点击色块可跳到该段。

边界对照 HOMER_4
now 0.0s / 42s

Instruction: …

Gold / 人工标注 Whole-episode coarse Contact-sheet prediction

模型常能叫出粗事件,却漏掉更细的子任务边界。同集 homer_4(与下方样例走读一致)对照:人工 gold、整集粗分、contact sheet 粗分。悬停色块可看完整标注。

4. 样例:案例分析:homer_4 的端到端处理流程

下列走读为 selector 路径(宽屏 1080p、擦桌子动作清楚);生产可在同边界下改用单路 raw。任务:用布擦桌面 / 柜面。折叠内 Prompt 为英文原文。

本集成绩:gold 15 / pred 11;IoU≥0.75 匹配 4;语义匹配 3;本集 E2E≈0.231 (全集 HomER micro 仍是 0.1542)。
00

输入视频

Loading…

下方为整集预览。到 Step 06 点选时间轴或表格行,可只播该段并同步看标注。

01

生成 contact sheet

参数与上一节相同。模型后续只看这些带时间戳的拼图,而不是原始 MP4 字节流。

下方为首张 sheet 示例(同参数)。

homer_4 contact sheet
02

粗分:整集一次 + 切段规则清单

把该集尽量多的 sheet 一次送给分段模型,并在请求文本里贴上切段规则清单 (GEPA 搜索得到的英文规则:只标完成事件、偏好约 2–10 秒等——见下方折叠全文)。 这样能消灭「分片接缝假切点」,但容易切太少(欠分割)。

Prompt (English only) — segmentation rules
Loading…
03

局部再切一遍:窗口不外扩,盖住完整动作

在粗边界附近开一个短时间窗,用同一版式的 sheet 再切一次。 窗口不外扩:只使用粗边界内部的视觉上下文(技术名 pad=0); 盖住完整动作:窗内看得见的完成事件都要切到,避免不完整微动作片段(技术名 full-cover)。 (整步技术名:S2 · pad=0 · full-cover)

step03 local sheet
局部时间窗 contact sheet(第二遍精修输入)。
S2 no-pad full-cover local refinement diagram
该图展示 S2 如何在粗分窗口内重切;pad=0 不引入窗口外上下文,full-cover 要求覆盖窗口内完成动作。
Prompt (English only)
Loading…
04

多候选标注

固定分段边界后,对每一段用多条路径各写一句: raw=默认读帧; ffmpeg=换解码抽帧路径; seed=带先验/种子标签的变体; rawprior=带 prior 的 raw。 下表是本集一段真实候选:意见不一致时,selector 才有价值。

来源候选标签

Prompt (English only) — labeling
Loading…
05

Candidate selector 定稿

用 Qwen3.5-397B 从候选里挑一句最像「完成操作」的短指令。

Prompt (English only) — selector
Loading…
Prompt (English only) — judge (scoring only)
Loading…
06

点选 pred 段:看视频 + 标注

这里只走 selector 预测轨(点色块或表格行 → 右侧播该段、左侧看标注)。 与 gold / 整集粗分 / contact sheet 的多轨边界对照见上方 §3.5,不再重复画 gold 时间轴。

点击 pred 色块或表格行。
尚未选择片段
#时间 (s)子任务Selector

5. 开销对照:Macrodata 公开数字 vs EgoANT

Loading…

两种 WGO 路径共用同一套 S2 分段(Seg F1=0.2031),只改标注调用。API 次数由公开报告产物结构计数;token 为工程估计。Macrodata 报的是 Gemini batch 美元价;本页给出 Qwen 栈的结构化估计,二者不是同模型账单。细节见附录 G。

与 Macrodata 公开开销对照

来源 口径 数字
Macrodata 公开 E2E seeded relabel(batch) ~$2.64 / 视频小时;segmentation-only batch ~$0.43/h
Macrodata 公开 contact sheet vs 逐帧输入 约 12× 更便宜(文中有 token/价格示意)
EgoANT(本页 WGO) raw / selector 工程估计 + 产物 API 次数 见下表;非 Gemini 账单
EgoANT 生产管线 同一 HomER 子集上的内部工程估计 仅保留聚合调用量级;不公开内部机器、路径或服务状态

WGO 两条标注路径(估计 tokens)

单路 raw(E2E 0.1414) 候选+selector(E2E 0.1542)

6. 方法演进与组件比较

按时间线叙述;主表与图跟在后面。实验细节(做法卡、pad 消融)默认折叠。

6.1 分段:从分片伪边界到局部精修

  1. 原 EgoANT rule-based 腕速切段:过碎(F1≈0.095)。
  2. Contact sheet 分片(max_sheets=3,每次最多送 3 张):外形接近公开报告做法,但接缝处引入伪边界。
  3. 整集一次 + legacy prompt(尚无切段规则清单):假切点没了,却欠分割。
  4. 换成 切段规则清单(GEPA):到 0.137,仍偏少。
  5. 第一遍加密切(S1):召回上升,但过分割。
  6. 第二遍局部精修:结果支持局部精修这一设计方向;最终 窗口不外扩 + 盖住完整动作(S2 · pad=0 · full-cover)到 0.2031。 (另测过用算法补覆盖的后处理:不如把「盖住完整动作」写进 prompt。)
  7. 相邻 merge 三种规则后处理(不是再调模型):时间轴更好看,但 均降低 Segment F1,因此不作为默认配置。

Segment F1(主路径)

表头:P(Precision)= match / pred(预测段里配对成功的比例); R(Recall)= match / gold(gold 段被找回的比例); match / pred / gold= 配对成功数 / 预测段数 / gold 段数(本子集 gold 恒为 470)。 「模型」列若写规则后处理,表示在已有预测上做脚本合并,不再调用 LLM。

条件F1P / Rmatch/pred/gold模型或方法结果一句话

窗口外扩秒数(旧称 pad)的消融未进入主决策路径;细节见折叠区。

展开:分段实验细节
条件F1P / Rmatch/pred/gold模型或方法结果一句话

6.2 标注:更复杂的视觉输入未必提高准确率

固定参考边界后,Gemini judge 全量重评显示:raw 27B 最高,为 55.7%; temporal collage 27B 为 52.8%,proxy overlay 27B 为 50.6%,HaWoR-reconstructed wrist-guided crop 397B 为 50.9%,raw 397B 为 50.2%。 397B 上,overlay 48.5%、temporal collage 45.1%、neighbor / proxy hand-collage 约 39–40%。 结论很朴素:在 HomER 这个子集上,复杂视觉输入常常污染当前动作描述;先固定 judge,再讨论输入设计。

标注准确率

条件Accn_match/n模型Δ vs raw备注
展开:标注实验细节(做法卡)

6.3 E2E:锁边界,单路生成与多候选选择

分段锁在 0.2031 后,只改标注路径(时间 match 数不变,变的是语义 match)。 27B 自标为 0.1234;27B raw 重标虽然在固定参考边界 Label Acc 上最高,但在预测边界上 E2E 只有 0.1285; 397B raw 重标到 0.1414;ffmpeg raw397B-prior neighbor都到 0.1491; candidate selector从多路候选中选择最终标签,取得最高观察值 0.1542

E2E F1

条件Seg F1E2E F1pred/gold备注
展开:E2E 实验细节(做法卡)
要点:分片 contact sheet 易在接缝造假切点;切段规则定「切什么」、局部精修(盖住完整动作)定「切多细」; 三种规则合并策略均降低 Segment F1;Gemini 重评后,raw 27B 是固定参考边界下的最高标注配置,但端到端最高观察值仍来自 S2 预测边界 + 397B 多候选 selector。 换句话说,27B 是最好的 fixed-boundary captioner,但不是最好的 noisy predicted-segment label resolver

7. 推荐配置与使用边界

01
Contact sheet
0.5s · 224×144 · 20 tiles · yellow stamps
02
Coarse cut
Whole episode + rule list
03
Local refine
No pad-out · cover actions · 27B → 0.2031
04
Selector
397B multi-cand → Gemini E2E 0.1542
阶段推荐当前不推荐
分段 Qwen3.6-27B + 切段规则清单 + 局部精修(窗口不外扩、盖住完整动作) 分片 max3;基于规则的相邻片段合并
标注(省钱) 固定参考边界诊断:27B raw(Label Acc 55.7%);预测边界 E2E 低成本配置:397B raw(0.1414) proxy overlay / 邻段 / 整帧 collage / proxy hand-crop 默认启用
高准确率配置 同上边界 + 多候选 + 397B selector(Gemini E2E 0.1542) 分段小模型自标当终稿
对照 HomER-only vs Macrodata HomER≈0.227 用全量 0.306 headline 直接对比

参考文献

  1. Macrodata Labs. (2026). WGO-Bench: What's Going On Benchmark. Hugging Face. https://huggingface.co/datasets/macrodata/WGO-Bench
  2. Macrodata Labs. (2026). Segmenting Robot Video into Actionable Subtasks. Macrodata Labs. https://macrodata.co/blog/annotating-robot-video-subtasks
  3. Agrawal, Lakshya A., Tan, Shangyin, Soylu, Dilara, Ziems, Noah, Khare, Rishi, Opsahl-Ong, Krista, et al. (2026). GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning. arXiv. https://arxiv.org/abs/2507.19457
  4. Choghari, Jade, Sansone, Agustin, Pasqualis, Nicolas, Mader, Conrado, Tiupikov, Aleks, Sivapurapu, Mouli. (2026). The Path to Large Scale Dense Video Captioning. Scale Labs. https://labs.scale.com/blog/path-to-large-scale-dense-video-captioning
  5. Li, Qixiu, Deng, Yu, Liang, Yaobo, Luo, Lin, Zhou, Lei, Yao, Chengtang, et al. (2025). VITRA: Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos. Project page. https://microsoft.github.io/VITRA/
  6. Zhang, Jinglei, Deng, Jiankang, Ma, Chao, Potamias, Rolandos Alexandros. (2025). HaWoR: World-Space Hand Motion Reconstruction from Egocentric Videos. arXiv. https://arxiv.org/abs/2501.02973
  7. Hoque, Ryan, Huang, Peide, Yoon, David J., Sivapurapu, Mouli, Zhang, Jian. (2025). EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video. arXiv. https://arxiv.org/abs/2505.11709
  8. EgoVerse Consortium. (2026). EgoVerse: Egocentric Data for Robot Learning from Around the World. Project website. https://egoverse.ai/
  9. Li, Yihang, Wei, Xuelong, Luo, Jingzhou, Xiao, Yingjing, Bai, Yibo, Zhou, Guangyuan, Zou, Teng, et al. (2026). EgoLive: A Large-Scale Egocentric Dataset from Real-World Human Tasks. arXiv. https://doi.org/10.48550/arXiv.2604.23570