按 Winnie 拍板的 A2 方向重做:新背景直接作为第二个输入给模型(不再靠文字脑补),背景素材换成真实场景库 Places365。3 条真实样本,含完整 5 文件盒子结构。未批量、未入 final_v1。
上一版(A)是:给原视频 + 一句话说"换成湖边",模型自己脑补湖边长啥样。
这一版(A2)是:给原视频 + 直接塞一张背景图,模型只要把主体抠出来贴上去。→ 任务明确、答案干净。
sample_00/ ├── input.mp4 ← 输入1:原视频(主体 + 老背景) ├── condition_bg.jpg ← 输入2:给定的新背景 ← 图打进盒子里,不靠外部路径 ├── target.mp4 ← 答案:主体保留、背景已换 ├── prompt.txt ← 文字说明 └── metadata.json ← 记录两个输入 + 两边出处(DAVIS 序列 / Places365 文件+原始地址)
你提的 reference 也留了:metadata.background_source.origin 里记着背景的原始下载地址,
好溯源;但真图仍自带在盒子里,所以不会因为外部文件夹搬家而断链。
| 字段 | 值(样本 0) |
|---|---|
| method | A2_background_given |
| inputs | source_video(input.mp4) + condition_background(condition_bg.jpg) |
| subject_source | DAVIS-2017 / blackswan / ground-truth 逐帧分割 |
| background_source | Places365 / Places365_val_00006382.jpg / +origin 地址 |
| composite | target = subject*mask + bg*(1-mask),feather 0.8px,背景静止 |
↑ 模型看输入1 的主体和输入2 那张背景,输出「主体原样保留、背景换成输入2」。主体掩码来自 DAVIS 真值;背景来自 Places365 Places365_val_00006382.jpg。
prompt.txt:把画面主体(blackswan)身后的背景替换成给定的背景图 condition_bg.jpg(湖边/河面),主体的形状、位置、动作逐帧保持不变。
↑ 模型看输入1 的主体和输入2 那张背景,输出「主体原样保留、背景换成输入2」。主体掩码来自 DAVIS 真值;背景来自 Places365 Places365_val_00015062.jpg。
prompt.txt:把画面主体(dog)身后的背景替换成给定的背景图 condition_bg.jpg(树林小径),主体的形状、位置、动作逐帧保持不变。
↑ 模型看输入1 的主体和输入2 那张背景,输出「主体原样保留、背景换成输入2」。主体掩码来自 DAVIS 真值;背景来自 Places365 Places365_val_00018645.jpg。
prompt.txt:把画面主体(camel)身后的背景替换成给定的背景图 condition_bg.jpg(干旱山坡),主体的形状、位置、动作逐帧保持不变。
winnie-task15-a2(us-east-2,用后已 terminate)合成。未入 final_v1,待你确认。