← 返回研究面板

Task_15 — 背景替换
绿幕主体视频 + 背景条件 → 真实背景视频 · Dataset Report

最终任务合同:输入绿幕主体视频和目标背景条件,输出主体不变、背景真实且帧间一致的视频。DAVIS 原视频与逐帧 mask 是构造这组监督所用的 source-native Raw,不是模型的 Input/Target。

STATUS: RAW + DEMO VERIFIED; FINAL NOT BUILT Task_15 · taxonomyv2v · 编辑(内容 C) final/ 未做(按决定)
绿幕→真背景
最终 V2V 合同
90 seq
DAVIS source
6,208 + 6,208
RGB frames + masks
832.77 MB
压缩 Raw

Yilan Zhang (Winnie) · ingested & verified 2026-07-12/13 on EC2 winnie-task13-14-ingest (us-east-2) · 多源 7 段标准 · 所有数字为盘上/S3 实测

1What this task is

模型任务:输入绿幕主体视频和目标背景条件,生成主体运动不变、背景符合条件且帧间一致的真实视频。与 Task_24 去除物体Task_26 属性/天气编辑不同,Task 15 保留主体并替换其余背景像素。

🎬 FINAL TASK CONTRACT · 绿幕主体 → 真实背景
INPUT — 绿幕主体视频
TARGET — 原始真实背景视频

↑ 这才是模型学习的 Input→Target。英文 prompt 另行描述目标背景;主体位置、动作和时间保持一致。

2Source-native Raw 与派生关系

A · DAVIS 2017 [INGESTED] 前景掩码 GT · 与 Task_24 共享

原生内容:90 个视频序列,共 6,208 张 RGB JPEG 与 6,208 张逐帧 PNG mask。压缩包实测 832,766,765 B(794.19 MiB / 0.833 GB)。mask 只用于从原视频派生绿幕 input;原视频本身作为真实 target。原视频→mask 不是本任务的训练合同。

派生链路:DAVIS 原视频 + GT mask → 绿幕 input.mp4;DAVIS 原视频 → target.mp4;背景描述/参考背景 → conditioning。按整序列计当前最多 90 个基本样本;如切固定长度窗口,必须先冻结窗口长度、步长和短序列策略后再实算,不能把 6,208 帧直接当作 6,208 个样本。
Reference-background pipeline 的边界:现有 shadow-aware LaMa v2 代码只负责从 DAVIS frame 生成去主体、尽量去阴影的参考背景图。当前 manifest 覆盖 90/90 序列,30/90 检测并处理阴影,自动 QC 90/90;人工视觉验收和完整训练盒组装仍待完成。它是 conditioning 辅助构造器,不是完整 V2V pipeline。
🔒 gated:YouTube-VOS(注册/竞赛通道)——更大规模的视频对象分割掩码,与 DAVIS 同形态、可直接扩背景替换训练量;批准后按卡片 recipe 取。
拆分说明(改进档案 #03):本任务原为「视频元素编辑」一行装六个子任务。按能力拆分后其余五包 raw 原地不动(S3 前缀仍名 Task_15_video_element_editing/),按任务 cross-ref 归位:GoPro/REDS → Task_25 超分/修复(Helen)DeepStab → Task_70 稳像Vimeo-90K triplet → 视频插帧已弃用,raw 归档 archive/2026-07/、上色 → Task_50(无专用集,彩色源灰度化自监督)。明细见 改进档案 #03 与 relocation note。

3Source-native data type(实测)

文件格式类型含义
DAVIS-2017-trainval-480p.zipjpg+pngimage seq+mask90 序列;6,208 RGB JPEG + 6,208 PNG masks。用于派生训练盒,不是原生 V2V pairs。
YouTube-VOS(gated)jpg+pngimage seq+mask更大规模视频对象分割掩码(同形态)

4数据格式(已定稿:B「绿幕 + 文字 → 真实背景」)

✅ 2026-07-15 数据格式定稿。比较过三条路(A 文字描述 / A2 给定背景图 / B 绿幕→真背景),Winnie 选定 B——因为 B 的答案是 100% 真实素材、零合成,且全程只用 DAVIS。样品见 B 绿幕→真背景样品页(含完整 4 文件盒 + prompt/metadata)。

每个样本 = 4 文件盒

文件角色内容
input.mp4输入①绿幕 + 主体:用 DAVIS 真值掩码把主体抠出、其余填 chroma 绿 rgb(0,177,64)subject*mask + green*(1-mask),边缘 0.8px 羽化)
prompt.txt输入②英文文字,详细描述要生成的背景(Input/Task/Background 三段)——描述的正是原视频背景
target.mp4答案原始 DAVIS 真视频(主体 + 真实背景)——真实素材、无合成
metadata.json元数据v2v-metadata/2.0:两输入 + 目标 + background_prompt + 绿幕 RGB/合成式 + 主体来源(DAVIS 掩码 GT)
阶段:Raw 已验证;B 格式 Demo 已验证;reference backgrounds 待人工审核;Final 尚未生成

5Data volume(S3 实测)

SourceStatusVolume
DAVIS 2017✓ raw verified832,766,765 B;90 序列;6,208 RGB + 6,208 masks
YouTube-VOSgated

Task 15 有效主源:DAVIS 832,766,765 B(794.19 MiB / 0.833 GB)。当前可定义 90 个整序列基本样本;固定窗口 clip 数尚未冻结、尚未实算,Final 仍为 0。共享历史前缀还包含其他任务的 cross-reference raw,不能计入 Task 15 数据量。

6License

License商用
DAVIS学术/研究
YouTube-VOS竞赛/注册条款⚠️ gated

7Source & re-download

s3://tv2v-data/raw/taxonomy/Task_15_video_element_editing/   # 前缀名沿用拆分前旧名(raw 不搬家)
├── DAVIS/        DAVIS-2017-trainval-480p.zip + DATASET_CARD.md   ← 本任务(背景替换)
├── GoPro/ REDS/  → 见 Task_25(超分/修复,Helen)
├── DeepStab/     → 见 Task_70(稳像)
├── (Vimeo90K/)   → 已弃用,raw 移到 archive/2026-07/(视频插帧不做)
└── _report_media/

# DAVIS: data.vision.ee.ethz.ch/csergi/share/davis/DAVIS-2017-trainval-480p.zip
# YouTube-VOS(gated): youtube-vos.org → 注册/竞赛通道

验证:zip 逐项 entries 计数 + 抽样解包 + DAVIS 演示渲染肉眼核对 + S3 summarize 对账。拆分依据见 改进档案 #03