其实i2v也非常需要人脸一致性保持
比如要基于一张人物照片,生成30秒跳舞视频,因为wan只能5秒5秒的拼接,导致15秒后或者一旦转身背对镜头,人物的下一段5秒就无法保持一致性
我期望
stand-in可以: 识别第一张照片中的人脸,然后在I2V的30秒内,完全让视频全程保持这张脸,
注意:这不是换脸,而是保持第一张照片的脸,然后生成长视频,可以让人物做各种转身等动作.
如果这个实现了,那将是革命性的,比T2V厉害多了
T2V太依赖wan的底模了,缺乏创造性,i2v才是无限想象
i2v的一致性问题一旦解决,国漫就不需要3d引擎了,直接生成各种帧图片,然后用wan来做动作就行了,不敢想下去了~
其实i2v也非常需要人脸一致性保持
比如要基于一张人物照片,生成30秒跳舞视频,因为wan只能5秒5秒的拼接,导致15秒后或者一旦转身背对镜头,人物的下一段5秒就无法保持一致性
我期望
stand-in可以: 识别第一张照片中的人脸,然后在I2V的30秒内,完全让视频全程保持这张脸,
注意:这不是换脸,而是保持第一张照片的脸,然后生成长视频,可以让人物做各种转身等动作.
如果这个实现了,那将是革命性的,比T2V厉害多了
T2V太依赖wan的底模了,缺乏创造性,i2v才是无限想象
i2v的一致性问题一旦解决,国漫就不需要3d引擎了,直接生成各种帧图片,然后用wan来做动作就行了,不敢想下去了~