AI Visual Previs Lab · AI 视觉预演实验室
把视觉想法和镜头设计变成可检查的三维空间、白模预演与生成对照。
这里有可以直接观看的案例、可以重放的场景,以及从参考到提示词、从失败首图到定向修订的完整过程。你可以先看机位、走位和画面关系是否成立,再决定如何生成、哪里需要修改。
先看:赛车白模 → 生成片
同一个追逐设计,进入视频模型后保留了什么,又增加了什么?下面的上下对照把生成片与原白模放在一起,并加入中文讲解。
播放/下载讲解对照 MP4 · 完整原生成片 · 查看对应关系
原白模是 15 秒,生成时误选了约 30 秒。对照保留完整结果,并标出没有白模对应的延展段。创作者本次感受是控镜更稳,但生成成本高:其 LibTV 使用体验为 15 秒参考生成约 900 积分、480P,因此更倾向先用提示词设计镜头。这是本次体验,不是平台统一报价或效果统计。
三组原白模
每组都附完整白模、一张外观参考图和实际母提示词,可以沿着同一份设计查看空间、摄影机与最终生成输入。
高速追击 · 15 秒 / 6 镜
看追逐轨迹、车辆相对位置、机位变化和切镜如何共同组织速度感。
播放/下载白模 MP4 · 外观参考图 · 完整母提示词
权力博弈 · 30 秒 / 8 镜
看人物站位、空间距离和摄影机安排如何改变同一场景中的关系。
播放/下载白模 MP4 · 外观参考图 · 完整母提示词
棍术打戏 · 15 秒 / 7 镜
看动作与接触点如何落到可逐帧检查的空间里,再对照镜头里的可见结果。
播放/下载白模 MP4 · 外观参考图 · 完整母提示词
12 张视觉实验:从要求到可见结果
如何保住角色细节、让巨构有尺度、让人物关系进入画面?下面三张来自现有实验,都是待用户审阅的原创候选。
| 黏土狐狸邮差 · 人物身份 | 山谷巨闸 · 行动与尺度 | 隔窗离别 · 距离与关系 |
|---|---|---|
实验覆盖人物、场景、道具与多种类型画面。除了 12 张最终候选,也公开了 5 张失败首图:孔位多了一倍、背景多出人物、脚印越过终点等问题,都能直接查看当时的图片、实际编辑词和修订结果。
查看 12 张完整画廊 · 失败首图 → 编辑词 → 最终候选 · 完整首次提示词
三类工具,按需要使用
| 工具 | 现在可以做什么 | 入口 |
|---|---|---|
| 白模执行器 | 重放追逐、博弈、棍术三个固定场景,渲染预演、抽帧或生成可编辑工程。 | Skill 与运行说明 |
| 视觉案例转化 | 按当前视觉问题选择案例,区分固定项与可变项,读出完整提示词与实际修订记录。 | Visual Case Adapter |
| 本地交互预演台 | 在双视窗里播放和编辑空间、人物走位、摄影机与时间轴,保存场景并导出无声视频。 | 预演台原型 |
提示词或参考图自动建立场景尚未接入。 当前可以重放已有案例、手动编辑预演台;它还不是输入任意想法就能自动完成预演与成片的完整产品。预演台与 Blender 案例目前也不能互相导入动作工程。
快速开始
只想看结果,可以直接打开上面的图像与视频;运行工具需要 Python 3.10+。
按问题找视觉案例,无需模型或外部 API:
python skills/visual-case-adapter/scripts/select_case.py --category 道具
python skills/visual-case-adapter/scripts/select_case.py --problem "光源 魔法"
重放一个白模: 需要已安装的 Blender,以及含 libx264 的 FFmpeg/FFprobe。
python experimental/whitebox-previs-executor/scripts/run_case.py --list
python experimental/whitebox-previs-executor/scripts/run_case.py --case chase --blender blender --ffmpeg ffmpeg --output-dir outputs/chase-preview --mode preview
在仓库根目录执行。依赖未加入 PATH 时,换成自己的可执行文件路径;输出目录须新建或为空,并放在技能包外。默认预览保留完整时长;查看高清渲染、抽帧和工程导出。
打开交互预演台: 需要支持 WebGL 的现代浏览器,导出 MP4 时还需要 FFmpeg。
python -B experimental/whitebox-workbench/server.py --data-dir "<你选择的数据目录>" --open
把数据目录占位符替换为自己的路径,场景与导出视频保存在那里。没有 FFmpeg 时仍可播放、编辑与保存;启动与操作说明包含图形启动方式。
工作方法与研究记录
先确定这次画面需要让人看懂什么,再借参考中的关系;保留必要事实,写成完整实际输入,用结果决定下一步修改。白模适合需要检查复杂空间、轨迹和接触的镜头,也会增加建场景、渲染与验收成本,不必用于每次创作。
证据、实验局限与当前验证状态
- 三组原白模共 60 秒、21 镜。每组一张参考图是本轮约定,不是所有任务的固定要求;固定模板能重放不代表任意自然语言能被自动理解。
- 赛车对照完整保留约 30 秒生成结果。生成片的 12.5–27.375 秒没有对应的原白模镜头,不能算白模成功控制的证据。时长不同,且没有控制变量或多次重复,本次不是严格 A/B。逐段对应与原始记录
- 12 张视觉候选来自 12 次首次生成和 5 次定向修订。历史内部记录为 11 张主要要求通过、1 张部分通过;发布前抽检另发现武侠裁脚、仙侠人物比例偏大的局限,均保留。用户逐图审美接受仍待定。逐图复核
- 视觉实验首次生成没有参考图;5 次编辑使用各自的 v1 首图,现已完整附上。模型构建标识和 seed 未归档,重用同图同词不保证相同像素,也不能据此证明跨图身份一致性或成功率提高。
- 本次移植完成了引擎与本地后端测试;浏览器工具初始化受阻,交互预演台尚未完成本轮界面实际观看。视频解码、帧数或文件校验不能替代实际试听、观看与用户接受。
- 本轮白模运行环境为 Blender 5.2.1 LTS、FFmpeg 8.1.2;工具不自动安装软件、连接视频模型或读取账户凭据。
运行选项与开发检查
白模执行模式:
preview:完整 480×270 预演,保留原时长与动作。render:完整 1920×1080 视频。frames --frames 29:31,186:提取指定原时间线帧,输出明确标识的抽帧样本短片。build:生成可编辑工程和审计,不做光栅渲染。--dry-run:检查参数和路径,不创建输出。
相机、几何、走位和切点来自同一套场景执行。输出包含工程、验证结果及可复制到另一位置的 replay 源码。
python scripts/validate_publication.py
python -m unittest discover -s tests -v
Blender 集成检查默认跳过;设置 WHITEBOX_CASE_BLENDER、WHITEBOX_CASE_FFMPEG 后再运行对应测试。交互预演台的引擎测试需要 Node.js,导出测试需要 FFmpeg。测试生成文件应放在仓库外的临时目录。
公开站点由本仓库文档生成:python3 scripts/build_site.py --out <部署目录> 把 Markdown 渲染为页面、按原路径镜像媒体并生成缩略图。页面不加载外部字体、脚本或统计服务;重新构建会删除上一次生成的页面,不触碰其他文件。
原创范围、素材来源与许可
原创代码采用 Apache-2.0,第三方依赖保留原许可。案例转化使用原创机制摘要,没有把第三方完整提示词、图库或外部仙侠技能源码包装成本库原创。
媒体按来源和用途单独说明。赛车讲解视频包含第三方服务的公共音色与目录配乐;这里只分享最终合成案例,不单独分发这些音色或音乐素材,也不把其权利并入代码许可。
研究来源 · 图像案例的原作者链接 · 代码和媒体许可范围