文本转视频:脚本、旁白与画面的自动组装
文本转视频(Text to Video)是生成器最常用的入口。官方的概括是:"输入文字,AI 自动补上画面、配音和音乐。"

提示词的四个要素
一条好用的视频提示词通常包含:
- 主体:谁/什么在画面里("一位穿蓝毛衣的女孩")
- 动作:正在发生什么("走过一条洒满阳光的街道")
- 环境:地点与光线("黄昏,暖色调,街道两旁有棕榈树")
- 镜头:机位与运动("低角度,缓慢推进")
官方示例的写法可以参考生成器页面上的真实样例——每条样例下方都附了可直接复制的原始提示词。
从一句话到成片的补齐链
生成不是只出一块素材。平台会在生成画面之后自动补齐:
- 旁白:按脚本内容生成语音,语言与音色在生成时可选
- 音乐:从内置曲库匹配情绪相符的背景乐
- 字幕/标题:脚本里的关键句转成文字镜头
自动补齐的部分都可以在时间线操作里替换或删除——生成的只是"初稿",剪辑权在用户手里。
长视频提示
官方口径支持最长约 12 分钟的生成时长,适合完整叙事与教学片。长片建议分段写脚本逐段生成,再进编辑器拼合,比一次生成整片更可控。分段后的音画同步问题见音乐与音轨。