EgoANT

EgoANT

用开源视觉语言模型对第一视角人类视频进行分段与标注

第一视角人手数据 子任务标注 预训练
进入报告

导读:为什么要给第一视角人类视频做子任务标注

第一视角(egocentric)人类视频通常由头戴相机拍摄,记录人在真实环境中完成日常操作的过程,例如在厨房切菜、在工位装配零件或在商店整理货架。相机随头部运动,双手及其操作对象构成画面的主体;场景、光照、遮挡以及操作中的失败与重试均自然发生,而非来自预设的实验室环境。近年来,EgoVerse8、EgoDex7 和 EgoLive9 等公开数据集已将此类视频扩展到千小时量级。

这类数据对机器人学习的潜在价值首先来自操作语义的可迁移性。尽管人手与机器人末端执行器的形态不同,物体状态、操作目标以及「根据观测选择动作」的高层语义仍有相通之处。因此,人类操作视频可用于视觉—语言—动作(VLA)模型的预训练,再通过真机数据将动作空间适配到具体机器人本体1。与遥操作采集的机器人数据相比,真实人类视频还具有两项优势:其一,覆盖的场景、物体和技能更为丰富,有助于提升策略在未见环境中的泛化能力;其二,采集不依赖机器人硬件和遥操作员,更容易在多个真实环境中并行扩展。

原始第一视角视频本身可以用于视频生成和世界模型训练;结合手部重建得到的腕部轨迹,还可以提供弱动作监督。这里称为「弱监督」,是因为腕部轨迹只能近似描述手部运动,并不包含机器人控制指令、接触力或执行器状态,也未必能直接映射到具体机器人本体。然而,这些信号通常不显式说明当前正在执行哪项操作,以及该操作何时完成。这类时间对齐的高层语义正是许多机器人策略所需要的监督。VLA 训练样本通常由「观测、语言指令、动作」组成,其中语言指令必须与相应的时间区间对齐。π0.5 等层级模型还会先预测高层子任务指令,再以此为条件生成低层动作1;训练这一高层模块需要时间对齐的子任务标签。分段边界同样具有独立价值:它界定一次完整操作的起止,可作为成功判定、奖励建模、技能检索以及预训练数据筛选与配比的基本单位。因此,将长视频转化为可用监督,需要同时回答两个问题:每项操作何时开始、何时结束,以及该时间段内完成了什么操作。本文将这两个问题分别称为子任务分段与语义标注。

自动完成这两项任务并不容易。第一视角画面随头部运动,手部经常遮挡操作对象;相邻动作之间缺少清晰停顿,细粒度操作又可能连续发生。人工逐段标注难以扩展至千小时规模,因此需要可审计、可复现且成本可控的自动标注流程

TL;DR

Segment F1(分段得分)
0.2031
470 个参考片段中,79 个与预测片段的配对通过时间匹配标准。
配置:Qwen3.6-27B · 时间戳网格 · 粗分后局部精修
Label Acc(固定分段标注得分)
55.7%
470 个固定分段中,262 个描述通过语义匹配标准。
配置:Qwen3.6-27B · 原始帧 · 固定人工分段
E2E F1(端到端整流程得分)
0.1542
60 个片段同时通过时间匹配与语义匹配标准。
配置:Qwen3.6-27B 分段 + Qwen3.5-397B-A17B 候选判别器

实验范围:WGO-Bench 的第一视角人类子集 HomER,共 25 个视频、470 个人工标注片段。分段与描述均由开放权重 Qwen 视觉语言模型生成;Gemini-3.5-Flash 仅用于离线判断描述是否与人工标注语义一致。三类指标的完整定义见 §1

  • 先选对模型,再考虑复杂的视觉输入增强。给定人工分段、只评估片段描述时,Qwen3.6-27B 使用原始帧取得 55.7% 的固定分段标注得分;改用多帧拼图或叠加启发式视觉提示后,得分分别降至 52.8% 和 50.6%。在输入和提示词完全相同的分段实验中,Qwen3.6-27B 的分段得分为 0.1278,高于 Qwen3.5-397B-A17B 的 0.0952。就本组实验而言,模型选择带来的收益大于额外的视觉输入技巧。
  • 最佳分段方案是「整集粗分 + 局部精修」。系统先用时间戳网格浏览完整视频并给出粗边界,再在每个粗边界附近重新判断动作起止。相较腕部速度规则基线,这一方案将分段得分从 0.0953 提升至 0.2031,并在 470 个人工参考片段中找到 79 个合格的时间匹配。Macrodata 公布的同范围 Gemini 分段得分为 0.227,与本方案相差 0.024。
  • 分段和描述需要不同的视觉输入。判断动作边界时,模型需要观察较长时间范围内的变化,因此带时间戳的图片网格更有效;边界已经给定后,模型需要看清片段内的手部和物体细节,此时原始帧更有效。加入相邻片段不但没有提高固定分段标注得分,还会把相邻动作误写进当前描述。
  • 端到端整流程目前首先受分段质量限制。最佳方案生成 308 个预测片段,但与 470 个人工参考片段完成时间匹配的只有 79 个;其中 60 个片段的描述进一步通过语义评判。换言之,大部分损失发生在描述生成之前。现阶段,改进动作边界比继续润色描述更可能提高端到端整流程得分。
  • 单路原始帧标注已接近多候选判别方案,且成本更低。在相同预测边界上,使用 Qwen3.5-397B-A17B 进行单路原始帧标注,端到端整流程得分为 0.1414;生成多条描述并由候选判别器定稿后,得分为 0.1542,相对提高约 9.1%。前者估计为 $0.84–$1.59 / 视频小时,后者为 $2.11–$3.80 / 视频小时,均不含离线语义评判费用。对成本敏感的批量处理,单路原始帧标注是更合适的默认方案。

1. 我们如何评估这条管线

要比较不同的标注方案,需要一个公开、可复现、并且和我们的任务同构的基准——它必须同时考核「切得对不对」和「写得对不对」。本文用的是 WGO-Bench1

WGO-Bench 与 HomER 子集

WGO-Bench(What's Going On Benchmark)由 Macrodata 随其公开博客一同发布2,把「长视频 → 动作级片段 + 一句话描述」定义成一个可以打分的公开任务。它包含约 100 个 episode,每个 episode 提供人工标注的子任务时间边界,以及每段对应的一句短描述。 其中 HomER 是它的第一视角人类操作子集:画面随头动晃、手常挡住物体、动作连续且细,通常比第三人称桌面视频更难。 本报告的所有分数固定在 HomER 的 25 个视频 / 470 个参考片段上。

三类分数分别在考什么

完整公式与直觉见 附录 A。正文只记定义与玩具例。

  1. Segment F1:只评时间切分(时间边界质量);IoU≥0.75 一对一配对。
  2. 固定边界 Label Acc:时间用 gold,只评句子是否同一完成事件(语义描述)。
  3. Semantic E2E F1:先时间配对,再对配对成功的 pair 做语义 judge;时间边界质量与语义描述都过才算。

下面用一个人造的小例子,把 Segment F1 完整走一遍。

Temporal IoU and F1 scoring diagram
评分分两步:先用时间 IoU 判断预测片段与参考片段是否重叠得够多,再由配对成功的数量算出 precision、recall 与 F1。

参考片段(gold):G0[0,3]、G1[3,6]、G2[6,10];模型预测(pred):P0[0.5,2.8]、P1[2.8,5.5]、P2[5.5,8]、P3[8,9.5]。

  1. 先把首尾对齐到视频两端,避免开头结尾少切的几帧影响判定:P0 的起点归到 0,P3 的终点归到 10。
  2. 逐对计算时间 IoU(交集 / 并集),只有 ≥0.75 才算配对成功:P0–G0≈0.933、P1–G1≈0.781 通过,P2 与 P3 和任何参考片段都不达标。
  3. 配对成功 2 个 → 精确率 = 2/4 = 0.50,召回率 = 2/3 ≈ 0.67,F1 ≈ 0.571。
Gold / 人工标注 Pred / 模型预测
评测范围:本文所有实验结果与配置建议均基于 HomER 的 25 个视频、470 个参考片段。Macrodata 公布的完整 WGO-Bench Segment F1 约为 0.306,覆盖约 100 个 episode,不能与本文结果直接比较。其 HomER-only Gemini 结果约为 0.227,数据范围与本文一致,但仍属于外部报告值,并非在本文环境中复现的受控对照。

2. 相关工作与实验设置

在我们之前,已经有几条把长视频变成子任务标注的公开路线。它们各自解决了问题的一部分,也各自留下了空白;这些空白决定了本文选择往哪些方向尝试。

Rule-based 分段:VITRA 与固定时长切分

VITRA5 把单目第一视角视频处理成三维手部与相机运动、原子动作片段和语言指令,它的切段依据是手部运动信号——取腕部速度的局部极小值当作动作边界。另一类更简单的做法直接按固定时长切。我们把这两类统称为 rule-based 分段。 它们共同的问题是过分割:一个动作内部的停顿、重新抓握、手腕微调都会产生速度低谷,于是「把胡萝卜放进碗里」被切成五六段。EgoANT 最早的一版分段也尝试过这条路线(HaWoR 腕速 + 低谷切段 + 相邻合并),本文把它保留为对照基线:在 HomER 上它切出 810 段,而参考只有 470 段,Segment F1 只有 0.0953。后面的 contact-sheet 方案正是为了替换掉这一版。

Macrodata / WGO-Bench:把子任务标注变成一个可以打分的公开问题

Macrodata · Annotating Robot Video Subtasks2 是目前最系统的公开工作:它把「长视频 → 动作级片段 + 短语义描述」定义成可打分的公开问题,发布了 WGO-Bench 与三类分数(分段、固定边界标注、端到端都有报告),给出了 contact sheet 一类的视觉输入设计和用 GEPA 搜索得到的分段 prompt,并在多个闭源与开源模型上做了对照。 它留下的空白与我们直接相关:各种 trick 的收益主要是在强模型(Gemini)上测出来的,报告没有回答预算有限、只能用开源模型时应该加哪些 trick——而这恰恰是我们要标几千小时视频时的真实约束。本文可以看作在这个约束下对它的一次补充。

Scale Labs:已切好的 clip 上的稠密描述

Scale Labs 的 The Path to Large Scale Dense Video Captioning4 讨论的是在已经切分好的 clip 上写稠密描述,以及拼贴、时间戳、稳定抽帧这些具体工程做法。它对我们的视觉输入设计有直接启发,但它的设定默认边界已经给定,不涉及「从原始长视频里预测边界」这一步——而分段恰恰是后面会看到的端到端瓶颈。

EgoANT 是面向第一视角人类操作视频的自动标注流程:先将长视频划分为动作级片段,再为每个片段生成简洁的操作描述。在 HomER 的 25 个视频、470 个参考片段上,最佳分段配置的 Segment F1 为 0.2031;在固定参考边界上,语义标注的 Label Acc 为 55.7%;仅以视频为输入的最佳端到端配置取得 Semantic E2E F1 0.1542。这些结果表明,完全基于开放权重视觉语言模型构建可复现的第一视角子任务标注流程是可行的。

EgoANT 的两条管线

EgoANT 是我们面向第一视角人类操作视频的自动标注系统。本文涉及它的两条管线:

  • 腕速基线(EgoANT 的第一版):HaWoR 手部运动重建 → 腕部速度平滑与低谷候选边界 → 段内抽原始帧写短句 → 相邻片段合并与重写。它借鉴了 VITRA 一类「先运动、后描述」的思路,但切段依据是 HaWoR 的腕部运动信号,并没有使用 VITRA 模型。细节见 附录 D;本文只把它当作对照基线。
  • contact-sheet 管线(本文的实验对象):带时间戳的 contact sheets → Qwen3.6-27B 分段 → 固定预测边界后的语义标注与多候选选择。正文的实验都针对这条管线。

三个模型的分工是:Qwen3.6-27B 负责分段,也可以顺带生成一部分标注候选;Qwen3.5-397B 负责生成候选描述并从中选出定稿;Gemini-3.5-Flash 只在离线评测时充当语义评判,不参与生成标签,也不参与选择候选。早期用 Qwen 做评判的结果只作为评判敏感性检查,不计入主分数。

角色 模型 在本文中的作用
分段模型 Qwen3.6-27B 预测片段的时间边界
描述生成模型 Qwen3.6-27B / Qwen3.5-397B 为每个片段生成候选描述
候选选择器(selector) Qwen3.5-397B 从多条候选描述中选出定稿
语义评判模型(judge) Gemini-3.5-Flash 离线计算 Label Acc 与 Semantic E2E F1

「GEPA-derived prompt」在本文里指什么

  1. GEPA 本身是一种用反馈自动改写 prompt 的方法3。Macrodata 用它在另外 15 个 episode 的验证集上搜索更贴合标注规范的分段规则。
  2. 我们复用的是搜索的结果,也就是他们公开的那段英文分段规则(completed_events_duration_prior_v1):只切已经完成的操作事件,片段长度偏好 2–10 秒,靠近、微调、收回这类动作不单独成段。
  3. 我们没有重新跑 GEPA。后文写「GEPA-derived prompt」时,指的只是这段规则文本——它既不是模型,也不是后处理脚本,而是请求里的一段文字。
  4. 怎么用:整集的 contact sheets 加上这段规则,一次调用完成粗分。相比不带规则的旧 prompt,它把 Segment F1 从 0.1230 提到 0.1369。英文全文见样例 Step 02 的折叠区;概念与实现见 附录 B,原文下载见 附录 F

后面会反复出现的几个词

Segmentation terminology on one timeline
同一段 40 秒视频的四种切法:人工参考、整集粗分、S1 加密切、S2 局部精修。绿色虚线框就是「时间窗口」,S2 只在框内重切。
  • 时间窗口:视频时间轴上的一段连续区间(例如 84–94 秒),不是软件界面里的窗口。
  • 第一遍加密切(S1):把切段密度调高,让更多真实边界被覆盖到,代价是容易切碎。详见 附录 B
  • 第二遍局部精修(S2):只在粗分边界附近的一小段时间里重切一次。
  • 窗口不外扩(pad=0):精修时只看窗口内部的画面,不把窗外的相邻动作纳入视野。
  • 盖住完整动作(full-cover):窗口里看得见的完成动作都要切到,同时不要把靠近、微调、收回单独切成碎片。
  • 候选选择器(selector):从多条候选描述里挑一条定稿,只在生成阶段使用。
  • 语义评判(judge):只在评测阶段使用,判断预测描述与参考描述说的是不是同一个完成动作。
  • HaWoR6:从第一视角视频中重建手部运动的方法,用来估计腕部轨迹并裁出手部区域。它给出的是估计值,不是传感器真值。

五种容易混淆的视觉输入

后文反复出现 contact sheet、temporal collage、邻段 sheet、proxy overlay、手部裁剪这几个词,它们的差别只有看图才说得清。下面是同一段视频、同一个动作(homer_4 第 22.9–26.8 秒,「拉开床头柜抽屉」)分别渲染成五种输入的样子,参数与管线一致。

Three whole frames sampled inside one segment
raw 原始帧:在片段内均匀抽 3 帧,作为 3 张独立图片提交。固定边界标注的默认输入,也是本文准确率最高的一种(55.7%)。
The same frames tiled into a single image
temporal collage 时间拼贴:同样几帧,但拼成一张图一次性给模型。省 token,画面里仍只有当前这一个动作。
Contact sheet with yellow timestamps
contact sheet:每 0.5 秒一帧、缩到 224×144、20 格一张,格子左上打黄色时间戳,一张覆盖约 10 秒。这是分段用的输入,也是本文收益最大的那处改动。
Previous, current, and next segment frames
邻段 sheet:把上一段(灰条)、当前段(绿条)、下一段(灰条)一起给模型。上下文更多,但模型经常把邻段的动作写进当前描述。
Heuristic centre box and the resulting crop
proxy overlay 与手部裁剪:左边在画面中心偏下画一个固定方框(启发式猜测,不是手部检测),右边是裁出后真正送进模型的图。真正依据 HaWoR 腕部轨迹的裁剪见 附录 E

以上五张按管线参数重新渲染,用于说明差别本身。在固定边界的标注实验里,除 contact sheet 只用于分段外,其余四种都低于 raw;数字见 §6.2

3. Contact-sheet 视觉输入

我们不把整段 MP4 作为视觉输入直接提交给模型,而是每隔 0.5 秒抽一帧,缩到约 224×144, 每张 sheet 20 格(5×4),格子上画黄色时间戳。 一张 sheet 大约覆盖 10 秒;一集长视频会拆成多张 sheet。

Visual input taxonomy comparing raw frames, proxy overlays, temporal collages, neighbor sheets, and hand crops
该图展示 raw frames、proxy overlay、temporal collage、neighbor sheet 和 wrist-guided crop 等视觉输入的差异。

读图:contact sheet 用来找边界;raw 是固定边界标注的最朴素输入;proxy overlay 是在原帧上叠加光流/启发式提示,不是真手部重建; temporal collage 与 neighbor sheet 引入前后文;基于 HaWoR 重建腕轨迹的裁剪依赖估计腕部轨迹。Gemini 重评显示,增加视觉上下文并未提高 HomER 上的固定边界标注准确率。

3.5 边界对照:同一视频上的三种分段结果

对齐 Macrodata 博客的 Boundary comparison 交互:上方播视频,下方多轨时间轴;播放头随时间移动,点击色块可跳到该段。

边界对照 HOMER_4
now 0.0s / 42s

Instruction: …

Gold / 人工标注 Whole-episode coarse Contact-sheet prediction

模型常能叫出粗事件,却漏掉更细的子任务边界。同集 homer_4(与下方样例走读一致)对照:人工 gold、整集粗分、contact sheet 粗分。悬停色块可看完整标注。

4. 样例:案例分析:homer_4 的端到端处理流程

下列走读为 selector 路径(宽屏 1080p、擦桌子动作清楚);批量标注时可在同一边界下改用单路 raw 以省成本。任务:用布擦桌面 / 柜面。折叠内 Prompt 为英文原文。

本集成绩:gold 15 / pred 11;IoU≥0.75 匹配 4;语义匹配 3;本集 E2E≈0.231 (全集 HomER micro 仍是 0.1542)。
00

输入视频

Loading…

下方为整集预览。到 Step 06 点选时间轴或表格行,可只播该段并同步看标注。

01

生成 contact sheet

参数与上一节相同。模型后续只看这些带时间戳的拼图,而不是原始 MP4 字节流。

下方为首张 sheet 示例(同参数)。

homer_4 contact sheet
02

粗分:整集一次 + 切段规则清单

把该集尽量多的 sheet 一次送给分段模型,并在请求文本里贴上切段规则清单 (GEPA 搜索得到的英文规则:只标完成事件、偏好约 2–10 秒等——见下方折叠全文)。 这样能消灭「分片接缝假切点」,但容易切太少(欠分割)。

Prompt (English only) — segmentation rules
Loading…
03

局部再切一遍:窗口不外扩,盖住完整动作

在粗边界附近开一个短时间窗,用同一版式的 sheet 再切一次。 窗口不外扩:只使用粗边界内部的视觉上下文(技术名 pad=0); 盖住完整动作:窗内看得见的完成事件都要切到,避免不完整微动作片段(技术名 full-cover)。 (整步技术名:S2 · pad=0 · full-cover)

step03 local sheet
局部时间窗 contact sheet(第二遍精修输入)。
S2 no-pad full-cover local refinement diagram
该图展示 S2 如何在粗分窗口内重切;pad=0 不引入窗口外上下文,full-cover 要求覆盖窗口内完成动作。
Prompt (English only)
Loading…
04

多候选标注

固定分段边界后,对每一段用多条路径各写一句: raw=默认读帧; ffmpeg=换解码抽帧路径; seed=带先验/种子标签的变体; rawprior=带 prior 的 raw。 下表是本集一段真实候选:意见不一致时,selector 才有价值。

来源候选标签

Prompt (English only) — labeling
Loading…
05

Candidate selector 定稿

用 Qwen3.5-397B 从候选里挑一句最像「完成操作」的短指令。

Prompt (English only) — selector
Loading…
Prompt (English only) — judge (scoring only)
Loading…
06

点选 pred 段:看视频 + 标注

这里只走 selector 预测轨(点色块或表格行 → 右侧播该段、左侧看标注)。 与 gold / 整集粗分 / contact sheet 的多轨边界对照见上方 §3.5,不再重复画 gold 时间轴。

点击 pred 色块或表格行。
尚未选择片段
#时间 (s)子任务Selector

5. 开销对照:Macrodata 公开数字 vs EgoANT

Loading…

两种 WGO 路径共用同一套 S2 分段(Seg F1=0.2031),仅标注调用不同。API 次数来自报告产物计数,输入 token 根据图片数量与分辨率估算,输出 token 则按任务类型设置区间。Qwen3.6-27B 按输入 $0.422/M、输出 $2.532/M 计价;Qwen3.5-397B-A17B 按输入 $0.1644/M、输出 $0.9864/M 计价。流程未使用网页搜索,因此不计 $0.000548/次的搜索费。美元结果不含离线 Gemini judge,也不能与 Macrodata 的 Gemini batch 账单视为同条件价格比较。细节见附录 G。

与 Macrodata 公开开销对照

来源 口径 数字
Macrodata 公开 E2E seeded relabel(batch) ~$2.64 / 视频小时;segmentation-only batch ~$0.43/h
Macrodata 公开 contact sheet vs 逐帧输入 约 12× 更便宜(文中有 token/价格示意)
EgoANT(本页 WGO) raw / selector 工程估计 + 产物 API 次数 raw 约 $0.84–$1.59/h;selector 约 $2.11–$3.80/h
EgoANT 腕速基线 同一 HomER 子集上的内部工程估计 仅保留聚合调用量级;不公开内部机器、路径或服务状态

WGO 两条标注路径(token 与美元估算)

单路 raw(E2E 0.1414) 候选+selector(E2E 0.1542)

6. 方法演进与组件比较

按时间线叙述;主表与图跟在后面。实验细节(做法卡、pad 消融)默认折叠。

6.1 分段:从分片伪边界到局部精修

  1. 原 EgoANT rule-based 腕速切段:过碎(F1≈0.095)。
  2. Contact sheet 分片(max_sheets=3,每次最多送 3 张):外形接近公开报告做法,但接缝处引入伪边界。
  3. 整集一次 + legacy prompt(尚无切段规则清单):假切点没了,却欠分割。
  4. 换成 切段规则清单(GEPA):到 0.137,仍偏少。
  5. 第一遍加密切(S1):召回上升,但过分割。
  6. 第二遍局部精修:结果支持局部精修这一设计方向;最终 窗口不外扩 + 盖住完整动作(S2 · pad=0 · full-cover)到 0.2031。 (另测过用算法补覆盖的后处理:不如把「盖住完整动作」写进 prompt。)
  7. 相邻 merge 三种规则后处理(不是再调模型):时间轴更好看,但 均降低 Segment F1,因此不作为默认配置。

Segment F1(主路径)

表头:P(Precision)= match / pred(预测段里配对成功的比例); R(Recall)= match / gold(gold 段被找回的比例); match / pred / gold= 配对成功数 / 预测段数 / gold 段数(本子集 gold 恒为 470)。 「模型」列若写规则后处理,表示在已有预测上做脚本合并,不再调用 LLM。

条件F1P / Rmatch/pred/gold模型或方法结果一句话

窗口外扩秒数(旧称 pad)的消融未进入主决策路径;细节见折叠区。

展开:分段实验细节
条件F1P / Rmatch/pred/gold模型或方法结果一句话

6.2 标注:更复杂的视觉输入未必提高准确率

固定参考边界后,Gemini judge 全量重评显示:raw 27B 最高,为 55.7%; temporal collage 27B 为 52.8%,proxy overlay 27B 为 50.6%,HaWoR-reconstructed wrist-guided crop 397B 为 50.9%,raw 397B 为 50.2%。 397B 上,overlay 48.5%、temporal collage 45.1%、neighbor / proxy hand-collage 约 39–40%。 结论很朴素:在 HomER 这个子集上,复杂视觉输入常常污染当前动作描述;先固定 judge,再讨论输入设计。

标注准确率

条件Accn_match/n模型Δ vs raw备注
展开:标注实验细节(做法卡)

6.3 E2E:锁边界,单路生成与多候选选择

分段锁在 0.2031 后,只改标注路径(时间 match 数不变,变的是语义 match)。 27B 自标为 0.1234;27B raw 重标虽然在固定参考边界 Label Acc 上最高,但在预测边界上 E2E 只有 0.1285; 397B raw 重标到 0.1414;ffmpeg raw397B-prior neighbor都到 0.1491; candidate selector从多路候选中选择最终标签,取得最高观察值 0.1542

E2E F1

条件Seg F1E2E F1pred/gold备注
展开:E2E 实验细节(做法卡)
要点:分片 contact sheet 易在接缝造假切点;切段规则定「切什么」、局部精修(盖住完整动作)定「切多细」; 三种规则合并策略均降低 Segment F1;Gemini 重评后,raw 27B 是固定参考边界下的最高标注配置,但端到端最高观察值仍来自 S2 预测边界 + 397B 多候选 selector。 换句话说,27B 是最好的 fixed-boundary captioner,但不是最好的 noisy predicted-segment label resolver

7. 推荐配置与使用边界

01
Contact sheet
0.5s · 224×144 · 20 tiles · yellow stamps
02
Coarse cut
Whole episode + rule list
03
Local refine
No pad-out · cover actions · 27B → 0.2031
04
Selector
397B multi-cand → Gemini E2E 0.1542
阶段推荐当前不推荐
分段 Qwen3.6-27B + 切段规则清单 + 局部精修(窗口不外扩、盖住完整动作) 分片 max3;基于规则的相邻片段合并
标注(省钱) 固定参考边界诊断:27B raw(Label Acc 55.7%);预测边界 E2E 低成本配置:397B raw(0.1414) proxy overlay / 邻段 / 整帧 collage / proxy hand-crop 默认启用
高准确率配置 同上边界 + 多候选 + 397B selector(Gemini E2E 0.1542) 分段小模型自标当终稿
对照 HomER-only vs Macrodata HomER≈0.227 用全量 0.306 headline 直接对比

参考文献

  1. Physical Intelligence, Black, Kevin, Brown, Noah, Darpinian, James, Dhabalia, Karan, Driess, Danny, et al. (2025). π0.5: a Vision-Language-Action Model with Open-World Generalization. arXiv. https://arxiv.org/abs/2504.16054
  2. Macrodata Labs. (2026). WGO-Bench: What's Going On Benchmark. Hugging Face. https://huggingface.co/datasets/macrodata/WGO-Bench
  3. Macrodata Labs. (2026). Segmenting Robot Video into Actionable Subtasks. Macrodata Labs. https://macrodata.co/blog/annotating-robot-video-subtasks
  4. Agrawal, Lakshya A., Tan, Shangyin, Soylu, Dilara, Ziems, Noah, Khare, Rishi, Opsahl-Ong, Krista, et al. (2026). GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning. arXiv. https://arxiv.org/abs/2507.19457
  5. Choghari, Jade, Sansone, Agustin, Pasqualis, Nicolas, Mader, Conrado, Tiupikov, Aleks, Sivapurapu, Mouli. (2026). The Path to Large Scale Dense Video Captioning. Scale Labs. https://labs.scale.com/blog/path-to-large-scale-dense-video-captioning
  6. Li, Qixiu, Deng, Yu, Liang, Yaobo, Luo, Lin, Zhou, Lei, Yao, Chengtang, et al. (2025). VITRA: Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos. Project page. https://microsoft.github.io/VITRA/
  7. Zhang, Jinglei, Deng, Jiankang, Ma, Chao, Potamias, Rolandos Alexandros. (2025). HaWoR: World-Space Hand Motion Reconstruction from Egocentric Videos. arXiv. https://arxiv.org/abs/2501.02973
  8. Hoque, Ryan, Huang, Peide, Yoon, David J., Sivapurapu, Mouli, Zhang, Jian. (2025). EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video. arXiv. https://arxiv.org/abs/2505.11709
  9. EgoVerse Consortium. (2026). EgoVerse: Egocentric Data for Robot Learning from Around the World. Project website. https://egoverse.ai/
  10. Li, Yihang, Wei, Xuelong, Luo, Jingzhou, Xiao, Yingjing, Bai, Yibo, Zhou, Guangyuan, Zou, Teng, et al. (2026). EgoLive: A Large-Scale Egocentric Dataset from Real-World Human Tasks. arXiv. https://doi.org/10.48550/arXiv.2604.23570