AI 视觉预演实验室 AI Visual Previs Lab

从研究到实作:白模与视觉案例方法复盘

结论已经怎样改变

早期只有可播放白模时,能够判断的是场景与摄影机执行,不能判断正式视频模型是否会保留这些约束。现在赛车已有真实生成结果,创作者反馈控制镜头有效、画面更稳定,但参考生成成本较高,更倾向用提示词完成通常的镜头设计。

这个新反馈支持“复杂镜头按需使用白模”的方向,不支持所有镜头都必须走白模,也不构成统计性成功率提升。白模原片15秒,生成时误选约30秒,模型自行延展了中段。这是一次带明确混杂因素的实践,不能作为严格同条件A/B。

三条工作的关系

  1. 空间与摄影预演。 让人物、道具、摄影机和切点在同一世界与时间轴中运行,查看可见关系是否成立。借鉴的是空间/轨迹/取景的比较方式,三个原创场景并非外部示例的复制。
  2. 视觉案例转化。 从适合当前问题的案例提取构图、固定项、变量和材质关系,写出针对当前任务的实际输入,再看结果修订。使用结构化资料便于找到经验,不保证模型更听话。
  3. 生成与剪辑验证。 保留输入、生成设置中已知的信息、实际输出和对照映射。既不裁去失配段伪造忠实,也不把成片观感完全归因于白模。

做成的内容

  • 15秒6镜高速追击:逼近、抢位、窄口退让、贴地通过、弯道接力、尾部威胁。
  • 30秒8镜多人博弈:六人固定座位,翻票、四比二结果、钥匙交割与新命令执行。
  • 15秒7镜持棍交锋:格挡、滑移卸力、触柱、短端反击、下潜、肩胸施力与落膝。
  • 每个场景在这次测试中只配一张统一参考图,外观与整段运动分别控制。
  • 12张原创视觉测试,保留12条首次实际提示词及5条实际编辑提示词,旧失败不冒称成功。
  • 将场景专用执行代码整理成统一重放入口;它覆盖这三个固定案例,不表示任意陌生提示词已能自动执行。

暴露的问题与这次如何转化

观察到的问题 失效原因 本次落实
参考图扩成逐镜多图 未在生成前锁定交付数量与参考职责 Skill和案例先声明本次输入合同;当前三条共三图,不推广为所有任务永久限一图
钥匙仍在正确手上,画面却看不到握点 数据正确被误当作关键动作可读 增加事件前/中/后查看,实际对照保留修复与自然遮挡的边界
鞋底最低点接地仍显悬空 单个点没有证明可见支撑面积 使用最终几何检查与平底支撑;复核又发现负高度漏判,加入穿地/悬空/缺演员/NaN反例
固定双握、冻结被推广到所有打斗 旧持械碰撞样例影响了通用说明 把旧后端限制写清;新案例单独执行,不把徒手、单手或纯闪避伪装成已支持
只在作者电脑能运行 私有路径、缓存搜索和输出路径固定 显式依赖参数、隔离输出、源码复制重放与陌生目录测试
把内部检查当成最终验收 数值、解码、看图、听感与用户判断被混用 记录每层实际做过什么,不自动递增用户接受次数

复核没有重新渲染三条完整高清影片;可下载影片保留原作,新的可移植入口用低清指定帧进行真实运行与解码验证。它们的证据对象不同,分别记录。

图片实验的边界

历史检查记为11张主要要求通过、1张仙侠部分通过;本次公开整理时的独立抽查进一步发现个别人物比例与脚部裁切不满足全部原词。历史统计保留为历史,新问题写在对应案例中。没有输入参考图,因此不能用本批证明跨次人物身份锁定;没有旧方法同题对照,因此不能宣称学习上游方法后成功率提高。

成本与下一次值得做的实验

白模可以降低某些镜头设计的不确定性,却增加建场、修图、渲染和参考生成的成本。当前费用陈述只是一次用户体验,不换算成固定人民币报价或产品排名。

有价值的后续实验是:同一内容、同一张外观图、相同时长和模型设置,对比有无白模,重复若干次;记录可用镜头、关键空间错误、可用秒数、重试次数和实际支出。先判断增加的控制能否抵消增加的成本,再决定适用场景。

现阶段保留两个角色:白模作为本地预演与诊断工具;在复杂空间、连续镜头或明确动作交接中作为可选视频参考。未经实际成片验证的控制项继续标为不可靠或待验证。