AI 视觉预演实验室 AI Visual Previs Lab

AI Visual Previs Lab · AI 视觉预演实验室

把视觉想法和镜头设计变成可检查的三维空间、白模预演与生成对照。

这里有可以直接观看的案例、可以重放的场景,以及从参考到提示词、从失败首图到定向修订的完整过程。你可以先看机位、走位和画面关系是否成立,再决定如何生成、哪里需要修改。

先看:赛车白模 → 生成片

同一个追逐设计,进入视频模型后保留了什么,又增加了什么?下面的上下对照把生成片与原白模放在一起,并加入中文讲解。

上:原生成片(约 30 秒,721 帧);下:15 秒原白模。12.5–27.375 秒没有对应白模镜头,对照在该段保持上一参考画面并标注,不用循环或变速制造对应。

播放/下载讲解对照 MP4 · 完整原生成片 · 查看对应关系

原白模是 15 秒,生成时误选了约 30 秒。对照保留完整结果,并标出没有白模对应的延展段。创作者本次感受是控镜更稳,但生成成本高:其 LibTV 使用体验为 15 秒参考生成约 900 积分、480P,因此更倾向先用提示词设计镜头。这是本次体验,不是平台统一报价或效果统计。

三组原白模

每组都附完整白模、一张外观参考图和实际母提示词,可以沿着同一份设计查看空间、摄影机与最终生成输入。

高速追击 · 15 秒 / 6 镜

看追逐轨迹、车辆相对位置、机位变化和切镜如何共同组织速度感。

高速追击:15 秒 / 6 镜 / 360 帧,1920×1080,24 fps,无音轨。

播放/下载白模 MP4 · 外观参考图 · 完整母提示词

权力博弈 · 30 秒 / 8 镜

看人物站位、空间距离和摄影机安排如何改变同一场景中的关系。

权力博弈:30 秒 / 8 镜 / 720 帧,1920×1080,24 fps,无音轨。

播放/下载白模 MP4 · 外观参考图 · 完整母提示词

棍术打戏 · 15 秒 / 7 镜

看动作与接触点如何落到可逐帧检查的空间里,再对照镜头里的可见结果。

棍术打戏:15 秒 / 7 镜 / 360 帧,1920×1080,24 fps,无音轨。

播放/下载白模 MP4 · 外观参考图 · 完整母提示词

浏览完整白模案例与制作记录 →

12 张视觉实验:从要求到可见结果

如何保住角色细节、让巨构有尺度、让人物关系进入画面?下面三张来自现有实验,都是待用户审阅的原创候选。

黏土狐狸邮差 · 人物身份 山谷巨闸 · 行动与尺度 隔窗离别 · 距离与关系
黏土狐狸邮差侧面全身候选 山谷巨闸抢修候选 隔着车窗的离别候选

实验覆盖人物、场景、道具与多种类型画面。除了 12 张最终候选,也公开了 5 张失败首图:孔位多了一倍、背景多出人物、脚印越过终点等问题,都能直接查看当时的图片、实际编辑词和修订结果。

查看 12 张完整画廊 · 失败首图 → 编辑词 → 最终候选 · 完整首次提示词

三类工具,按需要使用

工具 现在可以做什么 入口
白模执行器 重放追逐、博弈、棍术三个固定场景,渲染预演、抽帧或生成可编辑工程。 Skill 与运行说明
视觉案例转化 按当前视觉问题选择案例,区分固定项与可变项,读出完整提示词与实际修订记录。 Visual Case Adapter
本地交互预演台 在双视窗里播放和编辑空间、人物走位、摄影机与时间轴,保存场景并导出无声视频。 预演台原型

提示词或参考图自动建立场景尚未接入。 当前可以重放已有案例、手动编辑预演台;它还不是输入任意想法就能自动完成预演与成片的完整产品。预演台与 Blender 案例目前也不能互相导入动作工程。

快速开始

只想看结果,可以直接打开上面的图像与视频;运行工具需要 Python 3.10+。

按问题找视觉案例,无需模型或外部 API:

python skills/visual-case-adapter/scripts/select_case.py --category 道具
python skills/visual-case-adapter/scripts/select_case.py --problem "光源 魔法"

重放一个白模: 需要已安装的 Blender,以及含 libx264 的 FFmpeg/FFprobe。

python experimental/whitebox-previs-executor/scripts/run_case.py --list
python experimental/whitebox-previs-executor/scripts/run_case.py --case chase --blender blender --ffmpeg ffmpeg --output-dir outputs/chase-preview --mode preview

在仓库根目录执行。依赖未加入 PATH 时,换成自己的可执行文件路径;输出目录须新建或为空,并放在技能包外。默认预览保留完整时长;查看高清渲染、抽帧和工程导出

打开交互预演台: 需要支持 WebGL 的现代浏览器,导出 MP4 时还需要 FFmpeg。

python -B experimental/whitebox-workbench/server.py --data-dir "<你选择的数据目录>" --open

把数据目录占位符替换为自己的路径,场景与导出视频保存在那里。没有 FFmpeg 时仍可播放、编辑与保存;启动与操作说明包含图形启动方式。

工作方法与研究记录

先确定这次画面需要让人看懂什么,再借参考中的关系;保留必要事实,写成完整实际输入,用结果决定下一步修改。白模适合需要检查复杂空间、轨迹和接触的镜头,也会增加建场景、渲染与验收成本,不必用于每次创作。

从研究到自己的方法 · 这次实操的复盘 · 来源与采用范围

证据、实验局限与当前验证状态
  • 三组原白模共 60 秒、21 镜。每组一张参考图是本轮约定,不是所有任务的固定要求;固定模板能重放不代表任意自然语言能被自动理解。
  • 赛车对照完整保留约 30 秒生成结果。生成片的 12.5–27.375 秒没有对应的原白模镜头,不能算白模成功控制的证据。时长不同,且没有控制变量或多次重复,本次不是严格 A/B。逐段对应与原始记录
  • 12 张视觉候选来自 12 次首次生成和 5 次定向修订。历史内部记录为 11 张主要要求通过、1 张部分通过;发布前抽检另发现武侠裁脚、仙侠人物比例偏大的局限,均保留。用户逐图审美接受仍待定。逐图复核
  • 视觉实验首次生成没有参考图;5 次编辑使用各自的 v1 首图,现已完整附上。模型构建标识和 seed 未归档,重用同图同词不保证相同像素,也不能据此证明跨图身份一致性或成功率提高。
  • 本次移植完成了引擎与本地后端测试;浏览器工具初始化受阻,交互预演台尚未完成本轮界面实际观看。视频解码、帧数或文件校验不能替代实际试听、观看与用户接受。
  • 本轮白模运行环境为 Blender 5.2.1 LTS、FFmpeg 8.1.2;工具不自动安装软件、连接视频模型或读取账户凭据。

白模执行验证 · 公开媒体校验 · 视觉图片清单

运行选项与开发检查

白模执行模式:

  • preview:完整 480×270 预演,保留原时长与动作。
  • render:完整 1920×1080 视频。
  • frames --frames 29:31,186:提取指定原时间线帧,输出明确标识的抽帧样本短片。
  • build:生成可编辑工程和审计,不做光栅渲染。
  • --dry-run:检查参数和路径,不创建输出。

相机、几何、走位和切点来自同一套场景执行。输出包含工程、验证结果及可复制到另一位置的 replay 源码。

python scripts/validate_publication.py
python -m unittest discover -s tests -v

Blender 集成检查默认跳过;设置 WHITEBOX_CASE_BLENDERWHITEBOX_CASE_FFMPEG 后再运行对应测试。交互预演台的引擎测试需要 Node.js,导出测试需要 FFmpeg。测试生成文件应放在仓库外的临时目录。

公开站点由本仓库文档生成:python3 scripts/build_site.py --out <部署目录> 把 Markdown 渲染为页面、按原路径镜像媒体并生成缩略图。页面不加载外部字体、脚本或统计服务;重新构建会删除上一次生成的页面,不触碰其他文件。

原创范围、素材来源与许可

原创代码采用 Apache-2.0,第三方依赖保留原许可。案例转化使用原创机制摘要,没有把第三方完整提示词、图库或外部仙侠技能源码包装成本库原创。

媒体按来源和用途单独说明。赛车讲解视频包含第三方服务的公共音色与目录配乐;这里只分享最终合成案例,不单独分发这些音色或音乐素材,也不把其权利并入代码许可。

研究来源 · 图像案例的原作者链接 · 代码和媒体许可范围