← 返回研究面板
Improvement Log · 任务改进档案 #01

Task_12 数据源换血记
从 64×64 玩具基准,到 720p 机械臂 + 4K 物理考卷(v1 → v2)

一份「验货合格」的报告不是终点。这一页记录 Task_12(物体运动与操作的未来帧预测)如何被两条质疑推动,在一天内完成 质疑 → 复盘 → 硬核查证 → 读代码定标准 → 换血执行 → 复核清退 的完整迭代——供后续每个任务的改进照此归档。

2 轮迭代 8 个候选字节级实测 1 次读代码替代问人 −61GB 死重清退 9,935 eps @720p60 入湖

Yilan Zhang (Winnie) × Claude · 2026-07-12 → 07-13 · 成果:Dataset Report v2

0
07-12 · 起点

v1 入湖 — 流程对了,选材偏了

按「最容易上手」选了文献经典 Moving MNIST + BAIR,完整走通 溯源→同区 EC2→官方全量→逐字节审计→入湖→7 段验货报告(184 obj / 60.9GiB)。流程从此成为 SOP 样板;但选材埋下隐患——两个源都是 64×64。

1
07-13 · 质疑

Winnie 的两条质疑,句句打在要害

质疑 ①「第一个数据集(Moving MNIST)和物理运动就没有什么关系。」——手写数字飘移只是最骨架的平移+反弹,没有重力/摩擦/接触,学不到真实动力学。
质疑 ②「第二个数据集(BAIR)的像素这么低,真的有用吗?」——64×64 是 2017 年算力的产物,对 2026 年的视频模型而言低于输入地板,放大也变不出信息。

随后的灵魂拷问:「那这个 Task_12 到底有什么意义?」——迫使把「流程价值」和「数据价值」分开审视。

2
07-13 · 复盘

根因:优化了「易得」,不是「营养」

  • 选源时按「最易上手」优化 → 选出了文献经典基准,把「标准」误当「先进」;
  • 「分辨率」只是摸底表里的普通字段,没有当成硬门槛
  • 「容易拿」和「有营养」的冲突存在已久,但没有被摆上台面让用户选——这是真正的错。
教训:easy-to-ingest ≠ worth-ingesting,冲突必须显式暴露
3
07-13 · 查证

8 个候选,字节级实测(不再信文档)

两个查证 agent 以分辨率为头条硬指标重扫候选,多项直接下载真文件 ffprobe / 读 GCS 桶内 features.json 量字节:

  • 操作线:BridgeData V2(原生 640×480,RLDS 恰 256²/123GiB)· DROID(原生 720p 立体×3,但 RLDS 版仅 320×180)· Language-Table(360p 画面单调)· OXE(分辨率彩票)
  • 物理线:Physics-IQ(真实拍摄 4K,396 段=评测量级)· Physion/++(实测 256²@30fps,34k 段,MIT)· Kubric/MOVi(2 秒短片+数据许可未标)· CLEVRER(480×320 偏玩具)

初版结论:BridgeData V2 RLDS 256² 为训练主力。这个结论只活了一小时。

4
07-13 · 转折点

不问人,读代码 — 找到真正的及格线

原计划请 Zhengze 确认「模型训练输入多大」,结果发现团队训练代码 Video-Reason/VBVR-Wan2.2 是公开仓库,直读官方脚本:

  • wan2.2-I2V-14B_vbvr_dataset.shHEIGHT=384 WIDTH=384 NUM_FRAMES=209
  • LTX2.3-I2AV_vbvr_dataset.shHEIGHT=512 WIDTH=512 NUM_FRAMES=209
  • 再读 dataloader:帧数是软门(短片自动降级训练),分辨率是质量门(低清被放大=糊)
地板从 256 抬到 384/512 → 一小时前的推荐被推翻:BridgeData RLDS(256²、且每轨迹仅 ~38 帧)与 Physion 256² 跌为不合格/边缘;DROID 原始 720p 成为唯一全过关的操作源。
收获:及格线永远从消费方(模型代码)拿,不从文献拿
5
07-13 · 执行

v2 换血 — 智能子集 + 全托管循环

  • DROID 720p 智能子集:探明 episode 结构后做预算式取样——跳过立体/SVO/128px 冗余,每 episode 从 ~390MB 精简到 ~18MB → 同样 180GB 装下 9,935 episodes(跨 12 实验室),选样清单可复现;下载字节与目标逐字节吻合,抽检 5/5 = 1280×720@60fps。
  • Physion+Physion++(34k 段真物理仿真,MIT)+ Physics-IQ(4K 实拍,官方 3s条件→5s预测 预切对 = 与任务定义逐字同构的考卷)。
  • 全托管循环(Winnie 首次要求「设定时循环」):心跳唤醒 ×3 轮完成盯进度/ffprobe 抽查/异常自愈(Physics-IQ 自动补拉 19 个缺失对象)/自动收尾停机;本地哨兵被杀两次,全靠 harness 级心跳兜底。
  • 报告 v2 同 URL 重写(v1 归档),EC2/IAM 用后销毁,本轮成本 <$1。
6
07-13 · 复核闭环

用户二审抓出两个漏洞 — 当天修完

复核 ①「之前那两个数据集你删除了吗?我觉得可以删除。」——同意:64×64 进不了 384/512 训练、复现零门槛、数据湖卫生优先 → S3 清退 −184 obj / −61GB(sha256/recipe 存档,知识零损失)。
复核 ②「来源 A(DROID)你没有给出 sample pair。」——属实:演示对只放了 §1 封面,§2 卡片漏了 → 已补进卡片。

终账:54,302 obj / 243,059,726,181 B(226.4 GiB)——纯三层有效数据(training 双源 + eval 考卷),零死重。

收获:用户复核是质检的最后一环——两个漏洞都是自查没兜住的

v1 → v2 对照

v1(07-12)v2(07-13)
训练源Moving MNIST + BAIRDROID 720p60 子集(9,935 eps)+ Physion 34k 段
分辨率64×641280×720 / 256²(注记)/ 评测 4K
选型依据文献经典 + 最易上手VBVR-Wan2.2 真实训练配置(384²/512²×209 帧)
动作条件BAIR 4 维向量DROID 完整动作树(笛卡尔/关节/夹爪 + 目标位姿)
评测集Physics-IQ(协议与任务同构,训完直接出分)
S3 体量60.9 GiB(后判定死重清退)226.4 GiB 全有效(54,302 obj)

沉淀的三个机制(已写进 SOP)

M1分辨率 = 硬门槛列摸底表直接标 pass/fail,不再是普通字段;帧数/时长按加载器行为分软硬。
M2源分层制度training / benchmark / eval 显式分层;「易上手」只允许决定 benchmark 层取舍。
M3模型侧需求先行任何任务摸底前先读消费方(训练代码/配置)拿及格线——问代码优于问人。
📋 成果:Dataset Report v2 🎬 所属:V2V Taxonomy 明细存档 research/2026-07-13_task12-source-upgrade/ · SOP research/2026-07-13_taxonomy-task-ingest-sop.md