← 返回研究面板

Task_15 背景替换 · A2 样品
背景给定式:输入 = 原视频 + 一张新背景 → 输出 = 主体贴上去

按 Winnie 拍板的 A2 方向重做:新背景直接作为第二个输入给模型(不再靠文字脑补),背景素材换成真实场景库 Places365。3 条真实样本,含完整 5 文件盒子结构。未批量、未入 final_v1。

Task_15 · 背景替换A2 · 背景给定主体掩码 = DAVIS 真值样品 · 待确认

1A2 是什么:新背景「直接给」,不是「用文字描述」

上一版(A)是:给原视频 + 一句话说"换成湖边",模型自己脑补湖边长啥样。
这一版(A2)是:给原视频 + 直接塞一张背景图,模型只要把主体抠出来贴上去。→ 任务明确、答案干净。

为什么 A2 的答案最干净:我们造答案的过程本来就是「抠主体 → 贴到某张背景上」,那张背景本来就存在。 A2 只是把它也放进输入里——不额外花力气,而且答案里不含"模型自己乱想"的成分。

2一个样本盒子里装什么(两个输入,都自带)

sample_00/
├── input.mp4          ← 输入1:原视频(主体 + 老背景)
├── condition_bg.jpg   ← 输入2:给定的新背景  ← 图打进盒子里,不靠外部路径
├── target.mp4         ← 答案:主体保留、背景已换
├── prompt.txt         ← 文字说明
└── metadata.json      ← 记录两个输入 + 两边出处(DAVIS 序列 / Places365 文件+原始地址)

你提的 reference 也留了metadata.background_source.origin 里记着背景的原始下载地址, 好溯源;但真图仍自带在盒子里,所以不会因为外部文件夹搬家而断链。

字段值(样本 0)
methodA2_background_given
inputssource_video(input.mp4) + condition_background(condition_bg.jpg)
subject_sourceDAVIS-2017 / blackswan / ground-truth 逐帧分割
background_sourcePlaces365 / Places365_val_00006382.jpg / +origin 地址
compositetarget = subject*mask + bg*(1-mask),feather 0.8px,背景静止

3三条真实样本

样本 0 · blackswan 黑天鹅 → 新背景「湖边/河面」 48 帧 · 640x360

🎬 两个输入 → 一个答案
输入 1 — 原视频(主体+老背景)
输入 2 — 给定的新背景(condition_bg.jpg)
答案 — 主体贴到给定背景上

↑ 模型看输入1 的主体输入2 那张背景,输出「主体原样保留、背景换成输入2」。主体掩码来自 DAVIS 真值;背景来自 Places365 Places365_val_00006382.jpg

prompt.txt把画面主体(blackswan)身后的背景替换成给定的背景图 condition_bg.jpg(湖边/河面),主体的形状、位置、动作逐帧保持不变。

样本 1 · dog 金毛 → 新背景「树林小径」 48 帧 · 640x360

🎬 两个输入 → 一个答案
输入 1 — 原视频(主体+老背景)
输入 2 — 给定的新背景(condition_bg.jpg)
答案 — 主体贴到给定背景上

↑ 模型看输入1 的主体输入2 那张背景,输出「主体原样保留、背景换成输入2」。主体掩码来自 DAVIS 真值;背景来自 Places365 Places365_val_00015062.jpg

prompt.txt把画面主体(dog)身后的背景替换成给定的背景图 condition_bg.jpg(树林小径),主体的形状、位置、动作逐帧保持不变。

样本 2 · camel 骆驼 → 新背景「干旱山坡」 48 帧 · 640x360

🎬 两个输入 → 一个答案
输入 1 — 原视频(主体+老背景)
输入 2 — 给定的新背景(condition_bg.jpg)
答案 — 主体贴到给定背景上

↑ 模型看输入1 的主体输入2 那张背景,输出「主体原样保留、背景换成输入2」。主体掩码来自 DAVIS 真值;背景来自 Places365 Places365_val_00018645.jpg

prompt.txt把画面主体(camel)身后的背景替换成给定的背景图 condition_bg.jpg(干旱山坡),主体的形状、位置、动作逐帧保持不变。

4还没定的两件小事

来源:主体 DAVIS-2017(已入湖,掩码真值) · 背景 Places365 val(场景照片,internal-use 按 Rule 4 记档;本次只流式抽了前 24 张做样品,未整包入湖——批量前再决定入湖范围)。 样本在 winnie-task15-a2(us-east-2,用后已 terminate)合成。未入 final_v1,待你确认。