← 返回研究面板
Improvement Log · 任务改进档案 #02
Task_13 视角生成定稿记
从「单张图片 i2v」到「N 个离散静止视角 → 360° 整圈」,再到「静止 + 小弧双输入并存」(v1 → v2 → 双输入定案)
这一页记录 Task_13(Novel View Generation)如何被一场逐项 review 推动,在两天内完成 三连问 → 开实物查证 → 设计定稿 → 全量复核 → 深夜再返工 的完整迭代。核心转变:任务的输入形态从「数据集给什么」变成「我们设计什么」——因为 raw 里根本没有现成的训练图。最新一步:开会后 leader 要求「静止 + 小弧」两种输入都保留,用配对样本把这个研究变量编码进四件套。
3 轮设计迭代
3 连问触发
9.4GB 全量重下复核
1 桩悬案解开(1,046 vs 1,030)
2 组新演示对
双输入 · 配对样本编码
Yilan Zhang (Winnie) × Claude · 2026-07-13 → 07-14 · 成果:Dataset Report v2
0
07-12/13 · 起点
v1 入湖 — 数据全对,设计是「初拟」
过夜完成 GSO(1,030 件 3D 扫描)+ RealEstate10K(79,267 条相机轨迹)官方全量入湖与 7 段验货报告。数字全部盘上实测。但两颗雷埋下了:类型标签「i2v · 单张图片」是 agent 初拟、没人拍板过;RE10K 卡片只有文字、没有演示对。
1
07-13 · 三连问
Winnie 逐项 review,三问问穿设计地基
问 ①「这里不是有一个完整的 pair 吗?还是说 target 和 input 我们都有,但让 input 变成 target 的 code 我们没有?」——直指「数据集自带训练对」的错觉。
问 ②「GSO 的 input 只有一张图吗?那视觉盲区岂不是完全是臆想出来的?」——直指单图设定下任务到底在考什么。
问 ③「RealEstate10K 没有 sample pair 给我看,我不知道它是用来干什么的。是你没有部署好吗?」——抓住了报告的真实缺口。
顺带暴露:连「i2v」这个标签本身都是 agent 提的,任务形态从未被正主拍板。
2
07-13 · 查证
不猜,开 S3 实物解剖 — 三个答案一次落地
- GSO zip 解剖(3D_Dollhouse_Lamp 实开):meshes/model.obj + 9.2MB 纹理 + 5 张 14KB 低清 thumbnail + 仿真配置。raw 里没有一张训练图 → 「input 有几个视角」不是数据属性,是渲染时的设计自由度。
- RE10K txt 解剖(train/53857414accb7b44 实开):首行 YouTube URL,之后每帧一行 19 列(时间戳+内参+3×4 位姿)——官方只发轨迹,画面自取。
- 概念沉淀(入 memory 词汇表):公开数据集只给原材料,(INPUT, TARGET) 对永远是管线制造的;「把 input 变成 target 的东西」就是要训练的模型本身。盲区补全不是臆想,是「有根据的推断」——这正是要考的空间常识。
收获:设计决策前先开实物——文件清单比文档和直觉都可靠
3
07-13 · 设计定稿
i2v → 多视角 v2v,四个附带决定一并拍板
- 主设计(Winnie 拍板):INPUT = 多视角短视频,TARGET = 360° 整圈含已见视角(Stability SV3D 同款;盲区考推断、已见视角当校验锚点)。
- RE10K 留在 Task_13:场景静止 + TARGET 位姿作条件 = 纯 novel view;不给位姿才会滑向 Task_68/12 的预测题。顺带发现 Duncan 的 Task_68 可直接复用本 raw(他正被 YouTube 挡在 EC2 外)→ 报告加 cross-ref。
- 13+16 不合并:能力同族、数据已共享,但 ABO 是 CC BY-NC(非商用)——分开可天然隔离 license;合并需按样本打标签。Winnie 决定保持分开。
- uCO3D 推荐但缓行(CO3D 官方继任,170k 物体/1,000 类):先过 Hokin 三待办(按类别分包的单元定义 / license 原文 / 体量成本),不先烧 TB;ACID 不立项(场景级样本量不缺)。
4
07-13/14 · 复核 + 执行
标准流程走全:同区 EC2 全量重下,悬案顺手解开
- EC2 winnie-task13-report(c5.4xlarge, us-east-2, SSM 驱动不开 SSH):9.4GB raw 全量重下复核——GSO 1,030 zips / 8,665,764,398 B ✓、RE10K sha256 ✓、71,556+7,711 clips ✓、抽检 zip 完整性 OK。用后 terminate 确认。
- 1,046 vs 1,030 悬案解开:model list 多出的 16 名(Bed / Fridge / Door handle…)是 Fuel API 收藏查询混入的非 GoogleResearch 杂项,非 GSO 正身、不可下载——非漏采,勘误写进报告 §2A。
- 补上 RE10K 演示对(问 ③ 的闭环):本机 yt-dlp 抓对应视频段(EC2 IP 会被 YouTube 挡——Duncan 的教训直接复用),按轨迹时间戳精确抽 122 帧 → 「路径前段(客厅出发)→ 沿路径续写(走进厨房)」。
- 报告 v2 用新生成器 build13.py 同 URL 重写上线,dashboard 同步。
5
07-14 · 深夜返工
第二轮质疑:INPUT 到底长什么样 — 静止图胜出
质疑 ④「input 好像不止一个视角啊。你做的是每视角 ±6° 小弧扫动,但我想要每个视角一张 image 占 1s。哪一个更好呢?」
对比后用户版胜出,三条实打实的理由:①信息账干净——模型确实只见过 N 个视角,N∈2~5 成为干净的难度旋钮;②考纯「脑内 3D」——小弧自带运动视差 = 送几何提示,推理含量下降;③final/ 渲染成本低 12 倍。
诚实勘误:此前反对静止版的「跳切」论点不成立——小弧版视角之间同样硬切;「冻结帧无新信息」也无害,把静止图按秒摊进视频容器本就是业界喂离散图的标准做法。
本机 Blender 重渲 4 张离散静止视角(az 45°/135°/225°/315°),报告 §1/§4/版本注全面同步;小弧版按不删除原则存档 _report_media/gso_input_multiview_arc.mp4。
收获:格式选择也要过「信息账」——别让输入格式偷偷替模型解题
6
07-14 · 开会定案
Leader 要「两版都留」— 用配对样本收编研究变量
Leader「静止和小弧两版 input 都保留:一个微微转、一个完全不转,指向同一个 target。有没有一点运动视差会不会帮到模型——这本身就是个有研究意义的对照点。」
表面冲突:流程指南规定四件套「一个 sample 只有一个 input」(input_video.mp4 唯一),没法把两种 input 塞进同一个 sample。
解法(与 leader 一致确认):指南那条是「一个 sample 一个 input」,不是「一个 物体 一个 sample」——所以拆成两个并列 sample 即可,各自是干净四件套:
- sample A:input = 静止版 · target = 360° 整圈
- sample B:input = 小弧版 · target = 同一个 360° 整圈
- 差异只写进 metadata:
transformation.input_mode = static | small_arc + pairing.pair_id(同物体同视角组合)→ 事后可按 pair_id 拉齐做对照。
prompt 两版保持一致:变换指令都是「生成这个物体的 360° 转台」,让 prompt 完全相同,则两个 sample 的唯一变量就是 input 本身——正是对照实验想要的干净设计。
附带要跟 Hokin 报的两点:①样本数按输入模式翻倍(叠加换视角放大要报总数);②「两版都训 / 留一版做评测对照」以后再定——metadata 打了标,两种玩法都留着。
收获:研究变量不塞进单个 sample,而是跨样本编码 + metadata 打标——格式合规与科学诉求两不误
v1 → v2 对照
| v1(07-12/13) | v2(07-13/14) |
| 任务类型 | i2v · 单张图片(agent 初拟,无人拍板) | v2v · N∈2~5 个离散静止视角 → 360° 整圈(Winnie 定稿) |
| TARGET 定义 | 「其余视角」(未明确) | 整圈含已见视角(SV3D 同款:盲区考推断 + 锚点做校验) |
| 演示对 | 仅 GSO 单图→环绕;RE10K 零演示 | GSO 4 静止视角→整圈 + RE10K 路径前段→续写(全真实数据) |
| GSO 账目 | 1,030 zips(list 1,046 差额未解释) | 全量重下复核一致 + 16 杂项勘误 + thumbnails 澄清 |
| deferred 指针 | CO3D v2(数 TB) | uCO3D(官方继任)+ 三待办;ACID 评估后不立项 |
| 协作 | — | cross-ref:Task_68(Duncan)复用本 raw,勿重复入湖 |
| 输入模式 | 单图(无此问题) | 静止版定为主配方;开会后 leader 要求 + 小弧版并存 → 配对样本(同 target,metadata input_mode 区分),不破四件套 |
沉淀的三个机制
M1每个 ingested 源必配演示对RE10K 零演示是这轮被抓的缺口——文字描述不算交付,INPUT→TARGET 真数据演示才算。
M2输入形态先过「信息账」「模型见过什么」必须可数、说得清(N 个离散视角);拒绝让输入格式偷送几何提示。
M3类型标签 = 设计决策,要留名i2v/v2v 不是数据自带属性;谁拍板、哪天定的写进报告版本注——「agent 初拟」不算数。
M4研究变量 = 配对样本 + metadata 标签Leader 要的「两种 input 对照」不塞进一个 sample,而是拆成共享 target 的两个样本、用 input_mode 打标——不破四件套,对照关系还能按 pair_id 回收。