← 返回研究面板

Task_13 — 物体新视角 / 360° 生成
单物体双视频 + N 张视角图片 → 环绕/新视角 · Dataset Report

输入同一物体的两路多视角短视频与构成静止视频的 N 张源照片,生成它在其他视角乃至 360° 整圈的画面。GSO(真实 3D 扫描) 与 ABO(真实电动转台商品)处理方式一致——都是「单物体 → 绕圈多视角」,故合并为本任务。演示对全部来自真实入湖数据。

STATUS: USABLE (raw ingested) Task_13 · taxonomyv2v · 续写 final/ 未做(按决定)
1,030
GSO 3D 扫描件
8,116
ABO 干净 72 帧 spin
2 + 3
sources ingested + deferred
51.5 GB
raw in S3

Yilan Zhang (Winnie) · ingested & verified 2026-07-12/13 on EC2 winnie-task13-14-ingest (us-east-2) · 多源 7 段标准 · 所有数字为盘上/S3 实测

版本注(2026-07-15 重组):本任务由原 Task_13(GSO+RE10K)与原 Task_16(ABO)合并而来—— GSO 与 ABO 处理方式完全一致(单个物体 → 绕圈生成多视角/整圈),故并入同一任务;原属场景级的 RealEstate10K 已移出到 Task_16 场景新视角。S3 前缀名保留(ABO 现物理位于 Task_13_novel_view_generation/ABO/)。每个样本保留两路视频输入,并新增一路由 N 张源照片组成的图片输入。

1What this task is

任务:输入同一物体的 N∈2~5 个视角:Input (A) 小弧视频、Input (B) 静止版视频,以及 Input (C) 构成 B 的 N 张源照片,让模型推理出该物体的其他视角 / 360° 整圈环绕—— 物体级空间 world-model 的核心能力(模型必须在脑内建出物体完整 3D 形状与纹理,才能补出没见过的视角)。 TARGET 包含已见视角:盲区考「有根据的推断」,已见视角兼作「看图说话」校验锚点(业界标准,Stability SV3D 同款)。 两个来源覆盖通用物体(GSO 合成渲染)白底电商商品(ABO 真实转台)。自监督友好:配对全部免人工标注。

🎬 INPUT→TARGET · 入湖的 GSO 真实扫描件渲染(Blender Cycles)
INPUT — 4 个离散视角 × 各 1s 静止(4s)
TARGET — 360° 整圈(含已见视角)

↑ 同一件入湖 GSO 扫描件(Animal Crossing 3DS 游戏盒):INPUT 是 4 张离散视角静止图(az 45°/135°/225°/315°)各占 1s;模型要补出整圈,已见视角兼作校验。GSO 的 mesh 即完美 ground-truth。

2每个来源负责什么 + 演示

A · Google Scanned Objects [INGESTED] CC-BY 4.0 · 通用物体·合成

负责:1,030 件真实物品的带纹理 3D 扫描——可从任意视角渲染任意数量的(多视角 INPUT→环绕 TARGET)训练对,几何/纹理完全真值,提供可控合成增广。§1 演示即出自它。

实测:1,030 zips / 8,665,764,398 B(2026-07-13 全量复核一致,抽检 zip 完整性 OK);每件含 meshes/model.obj + 纹理 + thumbnails + metadata。两点勘误/澄清:① zip 内 thumbnails 仅为低清预览图,训练视角数完全由渲染决定,raw 不含任何现成训练图;② Fuel 收藏查询返回 1,046 名,其中 16 个为非 GoogleResearch 杂项(Bed/Fridge/Door handle 等,不可从 GSO 端点下载,非 GSO 正身)——正身 1,030 全量在湖。

B · ABO spins(Amazon Berkeley Objects)[INGESTED · 移入自旧 Task_16] 真实转台 GT · 白底电商

负责:真实商品的电动转台序列——spins/original/<hex>/<spin_id>/<spin_id>_<az:02d>.jpg, 每商品 72 帧、方位角 0..71(步长 5°);listings/ 为商品目录元数据。真实拍摄而非渲染,是本任务的真数据主力;与 GSO 的可控合成互补。每个样本包含三路输入:Input (A) 多视角小弧视频、Input (B) 相同视角的静止版视频,以及 Input (C) 构成 B 的 N 张源照片;三者共享同一 target。

🎬 INPUT(A)→TARGET · 入湖 ABO 真实转台(asin 00002a0f,N=4)
INPUT A — 4 个均匀视角,每视角小弧真转(3.6s)
TARGET — 360° 整圈(36 帧,含已见视角)

↑ 同一件入湖 ABO 真实商品(米色吧椅):A 模式给 4 个绕圈均匀视角(az 0/90/180/270°),每个视角连取 3 张相邻真帧(≈10° 真旋转);模型补出整圈。全部为电动转台真帧,非渲染。

🎬 INPUT(B)→TARGET · 同一 spin 的静止视频输入(N=4)
INPUT B — 同样 4 个视角,但每视角定住不动(3.6s)
TARGET — 同上,A/B/C 共享

↑ Input (B) 给同样 4 个视角(az 0/90/180/270°),但每视角冻结不动;Input (A) 与 Input (B) 两路视频均保留,并共享同一 target。

🖼️ INPUT(C) · 构成 Input (B) 的源照片(N=4)
IMAGE 1 / 4 · 00002a0f_00.jpg · az 0°
{IMG('abo_input_C_1.jpg')}
IMAGE 2 / 4 · 00002a0f_18.jpg · az 90°
{IMG('abo_input_C_2.jpg')}
IMAGE 3 / 4 · 00002a0f_36.jpg · az 180°
{IMG('abo_input_C_3.jpg')}
IMAGE 4 / 4 · 00002a0f_54.jpg · az 270°
{IMG('abo_input_C_4.jpg')}

↑ 这 4 张不是从 MP4 截帧,而是直接取自 ABO S3 raw 的原生 616×918 JPG;内部镜像相对路径为 ABO/spins/original/00/00002a0f/。Input (C) 与 N 一一对应:N=2/3/4/5 就列出 2/3/4/5 张原图,它们正是组成 Input (B) 的中心视角。

实测(Phase 0,官方 spins.csv.gz 逐行统计):桶到桶直拷未落盘,586,605 objects / 42,079,462,004 B;图片 586,584 张,属 8,209 个 spin——其中 8,116 个是完整 72 帧(az 0..71 齐全),93 个仅 24 帧(默认剔除)。⚠️ 分辨率高度不一:全库 5,941 种 (w,h),但每条 spin 内部一致 → 切样本时按原生尺寸 letterbox 到 640² 白底(不拉伸)。
▲ deferred / gated(未入湖,附回来路径):uCO3D(CO3D 官方继任,CVPR 2025:170k 件真实物体环绕视频 / 1,000 类,github.com/facebookresearch/uco3d——对本任务是理想原料;按类别分包可作合规 raw 单元,待办:①Hokin 批准单元定义 ②核 license ③估成本);Objaverse-XL(10M+ 资产、逐资产 license → deferred(size/license),HF allenai/objaverse-xl);OmniObject3D(OpenXLab 通道)→ gated;MVImgNet(表单)→ gated;CO3D v2(数 TB)→ deferred(size)。当前 GSO 1,030 + ABO 8,116 已远超 10k 底座,上述均非阻塞。

3Data type & format(实测)

文件 / 前缀格式类型实测含义
GSO/<name>.zip ×1030zip(mesh)3D assetmeshes/model.obj + materials/textures + thumbnails/ + model.sdf
ABO/spins/original/<hex>/<spin_id>/*.jpgjpgimage seq每 spin 72 帧环绕(az 0..71,步长 5°);分辨率随商品而异
ABO/spins/metadata/spins.csv.gzcsv.gzmeta官方索引:spin_id, azimuth, image_id, height, width, path(586,584 行)

4How raw becomes V2V samples

samples/<sample_id>/
├── input_A.mp4          # 多视角小弧视频
├── input_B.mp4          # 相同 N 视角的静止视频
├── input_C/             # 正好 N 张、构成 B 的独立源图
│   ├── 01_<source>_<az>.jpg|png
│   └── ...
├── target_video.mp4
├── prompt.txt
└── metadata.json        # A/B/C 路径、N、azimuth、raw URI、逐文件 hash
final/ 未生成(按决定,维持)。ABO 批量切法已在 样品预览页冻结规格(含给 agent 的执行指令)——注意该页现归本任务(Task_13),产出应写 final_v1/New_Tasks/Task_13_.../

5Data volume(S3 实测)

SourceStatusVolume
GSO✓ ingested1,030 zips / 8,665,764,398 B
ABO spins+listings✓ ingested(移入)586,605 obj / 42,079,462,004 B(8,116 满 72 帧 spin)
uCO3D / Objaverse-XL / CO3Ddeferred(size)数 TB / 10M+ 资产
MVImgNet / OmniObject3Dgated(表单/通道)

S3 前缀精确总账Task_13_novel_view_generation/ = 587,643 objects · 50,745,647,581 B(ABO 586,606 / 42,079,463,171 B;GSO 1,032 / 8,665,805,460 B;RealEstate10K MOVED tombstone 1 / 550 B;_report_media 4 / 378,400 B)。

6License

License商用
GSOCC-BY 4.0✅ 署名
ABO spinsCC BY-NC 4.0(实际文件 LICENSE-CC-BY-NC-4.0.txt)❌ 非商用 → flag
license 注:ABO 桶内 spins/README.md 顶部通用头写"CC BY 4.0",但实际文件为 NonCommercial,以 NC 文件为准,对外发布前 flag Hokin。

7Source & re-download

s3://tv2v-data/raw/taxonomy/Task_13_novel_view_generation/   # 前缀名沿用(RE10K 已移出到 Task_16)
├── GSO/                  1,030 zips + _model_list.json + DATASET_CARD.md
├── ABO/                  spins/original + spins/metadata/spins.csv.gz + listings/ + README + LICENSE + CARD
└── _report_media/
# GSO: Fuel API 分页 + https://fuel.gazebosim.org/1.0/GoogleResearch/models/{name}.zip
# ABO 公开桶(无需凭证): aws s3 cp s3://amazon-berkeley-objects/spins/ <dst> --recursive

验证:GSO 逐件计数 + sha256 + 抽样解包(2026-07-13 EC2 全量复核一致);ABO Phase 0 用官方 spins.csv.gz 逐行统计 + 抽样解帧 + 单 spin 渲 A/B/target 三段演示核对。2026-07-15 重组:ABO 由旧 Task_16 前缀 S3 内搬入本前缀,RE10K 移出到 Task_16。