第 13 讲 视频与音频生成

模块 E · 生成篇 能力主线:会创作 2 学时(90 分钟) 第 13 / 16 讲

生成篇第三站:让画面动起来,让声音响起来。本讲把第 11 讲的文本、第 12 讲的图像,与新登场的文生视频(Text-to-Video)与配音串成一条完整"流水线",为期末项目产出约 3 分钟的科普短视频。

一、本讲学习目标

完成本讲后,你应该能够:

  1. 说出文生视频当前能做什么、不能做什么,并为每个镜头选对生成方式(实拍、屏幕录制、图表动画、AI 生成);
  2. "主体 + 场景 + 运动"公式(或图生视频的"运动 + 运镜")写出可用的视频提示词(Prompt)
  3. 用 AI 产出五栏分镜(Storyboard)脚本并人工修订,完成片段生成与 TTS(语音合成)配音;
  4. 在剪映中完成字幕校对、配音对齐与转场,合成短视频初版;
  5. 在工具额度受限时启用轻量备选方案,达成同一教学目标。

二、课前准备

三、核心概念精讲

1. 文生视频:能做什么,不能做什么

前两站我们生成过文字与图像,这一站进入多模态(Multimodal)版图里最年轻、也最"烧额度"的一块:文生视频——输入一段文字描述,得到一段会动的画面。机制上可以先借第 12 讲的直觉:图像由扩散模型(Diffusion Model)"从噪点中显影",不少视频生成模型沿用同一思路,把"逐张去噪"扩展到"逐帧去噪"、再让帧与帧连贯起来。这不是严格的机制描述,但足以解释它继承的老脾气:按"像"生成,不按"对"生成——画面好看,但不保证物理上正确。

所以动手之前,先给这项能力画一张边界地图:

适合交给 AI 视频别交给 AI 视频
氛围片段与空镜头(实验室晨光、仪器微光、星空与云雾);片头与转场素材;难以实拍场景的示意画面(行星尺度、微观尺度) 精确科学演示(摆长与周期的定量关系、光路角度、受力方向——不受提示词精确控制);长片连贯叙事(单次只生成几秒的片段,跨镜头的人物与场景难以保持一致);精确文字、刻度与图表(画面里出现的文字常是"乱码",数据图表必须自己做)

一句话记住分工原则:科学结论交给实拍与图表,氛围与引入交给 AI 视频。这不是委屈 AI 视频——就像实验报告里,示意图负责"让人看懂装置",数据表负责"让人相信结论",各司其职。也像仪器屏幕上一张"看起来对"的波形截图:曲线光滑漂亮,但横纵坐标与刻度是否准确,必须由你自己校准——画面质感从来不能替代物理正确。

2. 提示词公式:主体 + 场景 + 运动

第 12 讲文生图的公式是"主体 + 场景 + 风格";到了视频,多出一维时间,运动成了提示词的灵魂。基础公式三元如下(参考阿里云官方文生视频指南改写):

要素回答的问题示例
主体画面里"谁 / 什么"?铁架台上悬着细线与小钢球的单摆装置
场景在哪里、什么环境?物理实验室的木质桌面,背景虚化,窗外晨光
运动发生什么变化、怎么动?摆球被轻轻释放,以慢动作开始来回摆动,镜头缓慢推近

如果你已经有了一张图(第 12 讲生成的插画,或实拍截图),可以走图生视频:图像已经锁定了主体与风格,提示词只需要写"运动 + 运镜"。这很像实验里"初始条件已固定,只需描述过程如何演化"——再重复一遍主体描述,反而会和图像"打架",让画面出现诡异的形变。

想让画面更有"导演感",再叠加电影美学控制四要素:光源(顺光 / 侧光 / 逆光 / 自然光)、景别(特写 / 近景 / 中景 / 全景 / 远景)、构图(三分法 / 中心对称 / 引导线)、色调(冷暖、饱和度)。常用词汇摘选如下:

类别常用词汇摘选
风格化写实纪录片、胶片质感、水墨风、3D 渲染、定格动画、微缩景观
运镜推(靠近主体)、拉(远离)、摇(原地转动)、移(平移)、跟(跟随主体)、环绕、俯拍 / 仰拍、延时摄影
⚠️ 以官方指南为准,各平台能力有差异

以上公式与词汇摘选改写自阿里云官方指南,各平台对提示词的解析能力、支持的时长与分辨率上限差异很大、迭代也快,本讲不写死任何数字。写提示词前,先看看所用工具自带的示例库;拿不准的能力,以当期功能与官方文档为准。

3. 声音三类与 TTS 配音

一条短视频的声音分三类,各司其职:①人声(口播解说——科普视频的主声道,负责传信息);②音效(点状强调:摆球碰撞声、秒表滴答、图表出现时一声"叮",负责抓注意);③环境音乐(连续铺底,负责定情绪基调)。混在一起时,口播永远在最前面,音乐音量主动让路。用实验的视角看很直观:口播是要读取的"信号",音效是打点的"脉冲",环境音乐则是"背景本底"——本底太强,信号就被淹没了。

口播的上限由口播稿决定,就像测量精度的上限由仪器决定,不靠后期补救。写稿要点:一句话只装一个信息点;口语化,短句优先;动笔前先想清楚术语读音("周期""振幅""摆角")。稿子定稿后,用 TTS(语音合成)把文字转成语音。配音指令里可以指定音色(男 / 女、音色风格)、语速情绪(亲切讲解 / 沉稳播报)与停顿位置(具体可选项以当期功能为准);生成后必须试听,重点听术语读音对不对。

4. 分镜脚本方法:从脚本到分镜表

想清楚了一件事:约 3 分钟的科普短视频,不是"一个提示词"能生成的——它是一部微型影片。正确的打开方式是两步:先写脚本(说什么——按口播把内容写成一段解说词),再把脚本拆成分镜(怎么拍)。分镜(Storyboard)表就是影片的"拍摄计划表",固定五栏:镜号 / 画面 / 口播 / 时长 / 生成方式(模板见下一节案例演示,可直接抄用)。

特别注意"生成方式"这一栏——它就是你的额度预算表:实拍(手机就能拍,科学画面首选)、屏幕录制(数据与软件演示)、图表动画(结果图表——必须用你们自己算出的真实数据绘制,这是第 9 讲"对拍"老规矩的延续)、AI 文生视频 / 图生视频(氛围镜头)。提前把每一行分配好,就不会课上烧光额度才发现关键镜头还没着落。这张表和第 7 讲的任务卡一脉相承:每一行就是一张任务卡——画面说清输入,生成方式定下分工,时长就是验收约束。写完分镜表,你的 3 分钟视频就从一个模糊愿望,变成了四五个可独立完成、可逐条验收的小任务。至于"整条片子自动生成"长什么样,下一节的教师演示会给你看一条完整的"文档 → 成片"流水线。

四、物理场景案例演示

下面以"单摆周期实验"30 秒科普短视频为例,走一遍完整流程:脚本 → 分镜表 → 逐镜头生成 → 配音 → 合成。期末项目换汤不换药:主题换成你们第 8 讲立项的内容,流程一模一样。演示①–③的提示词均为 ZCode + GLM 实测迭代后的版本,框底折叠区附真实运行结果,并诚实标注了哪些环节已实测、哪些需课堂实机执行。

🧪 演示① 用 AI 产出脚本与分镜表(师生共同)
我是物理学院本科生,正在为课程项目制作一条约 30 秒的科普短视频,
主题:用单摆测量重力加速度。受众:高中学力的科普观众。
请先写一段口播脚本(口语化、术语正确),再把脚本拆成分镜表,
用五栏输出:镜号 / 画面 / 口播 / 时长 / 生成方式。
要求:
1. 总时长约 30 秒,拆成 5–6 个镜头;写明各镜时长之和,与总时长对得上;
2. "口播"栏逐字写出口播词:与口播脚本逐字一致、标点完整,
   数字与符号按读音改写(如"五度""三十个周期""周期的平方"),
   可直接复制给 TTS 使用,不要转述或缩写;
3. "生成方式"从这些选项中选:实拍、屏幕录制、图表动画、AI 文生视频、AI 图生视频;
   每镜后用一句话注明取舍理由;
4. 科学性优先:含公式与数值结论的镜头,生成方式必须标注为实拍、
   屏幕录制或图表动画;
5. 表格外附一句说明:"哪些镜头必须实拍,为什么"。

这是实测迭代后的第 2 版提示词(第 1 轮按旧版首跑暴露的问题与改动记录,见下方折叠区)。把 AI 的输出人工修订后,得到这样的分镜表(示例即模板,可直接抄用;本次实测 AI 原始输出为 6 镜,修订时砍掉纯氛围开场镜、把图表与结论两镜合一,收成 4 镜——修订也是任务①的必做步骤):

镜号画面口播时长生成方式
1实验装置特写:铁架台悬着细线与小钢球,刻度尺测量摆长"摆长越长,摆得越慢吗?我们用单摆测一测重力加速度。"6 秒实拍(手机固定拍摄)
2释放瞬间:摆球被拉离平衡位置一个小角度,松手开始摆动"把摆角控制在很小,从同一位置静止释放。"5 秒实拍为主;可另用 AI 图生视频做慢动作氛围版
3周期计时:秒表累计测量 30 个全振动,记录总时间"用秒表测 30 个周期取平均,计时的误差就缩小到三十分之一。"8 秒屏幕录制 + 实拍(秒表特写)
4结果图表:T²–L 直线,由斜率求出 g"T² 与 L 成正比,从直线斜率算出 g ≈ 9.8 m/s²,与公认值符合得很好。"9 秒图表动画(用你们自己处理的真实数据)

这条表为什么"专业":四个镜头里没有一个定量结论依赖 AI 生成——单摆在小摆角下满足 T = 2π√(L/g),T²–L 图是过原点的直线,这些科学内容由实拍与图表承担;"生成方式"一栏提前分好了额度的账;口播每句只装一个信息点,正好逐镜配音。

🧪 查看运行结果(ZCode + GLM 实测)· 分镜脚本两轮实录

本环境无文生图工具:此处为 AI Agent 生成的 SVG 矢量示意图替代演示(执行环境:GLM+ZCode)。课堂请在实际生图工具中执行同款提示词并对比。

第 1 轮 · 旧版提示词首跑(只换主题,其余一字不动——要求"拆成 4 个镜头",未约束口播写法):

口播脚本(30 秒版)
摆长越长,摆得越慢吗?我们用单摆测一测重力加速度。先把摆长量出来:
从悬点到摆球中心。把摆角控制得很小,从同一位置静止释放。计时从摆球
经过最低点开始,累计测量 30 个全振动,取平均,单次按表的误差就缩小
到三十分之一。最后作 T²–L 图,由斜率算出 g ≈ 9.8 m/s²。

分镜表
镜号 | 画面 | 口播 | 时长 | 生成方式
1 | 单摆装置特写,摆球静止悬垂 | "摆长越长,摆得越慢吗?我们用单摆测一测重力加速度。" | 6 秒 | AI 文生视频
2 | 刻度尺测量摆长,镜头给到读数 | "先量出摆长,从悬点到摆球中心。" | 6 秒 | 实拍
3 | 小角度释放;秒表累计计时 30 个全振动 | "控制摆角,静止释放;累计测量 30 个全振动,取平均。" | 9 秒 | 实拍
4 | T²–L 直线图,标注斜率求出 g | "T² 与 L 成正比,由斜率算出 g ≈ 9.8 m/s²。" | 9 秒 | 图表动画

(表格外说明:镜 2、3、4 必须实拍或自制图表——它们承载定量数据,
AI 画面无法保证读数与数值正确。)

AI Agent 真实执行并生成上述结果(执行环境:GLM+ZCode)。

第 2 轮 · 微调 3 处后复跑(改动就地记录)

改动①镜头数改为"5–6 个",并要求"写明各镜时长之和,与总时长对得上";改动②新增逐字条款:"口播"栏逐字写出口播词——与脚本逐字一致、标点完整、数字与符号按读音改写,可直接复制给 TTS;改动③新增理由条款:每镜"生成方式"后用一句话注明取舍理由。以下为第 2 轮真实输出:

口播脚本(约 30 秒 · 逐字稿,数字按读音书写)
摆长越长,摆得越慢吗?用一只单摆测一测。
第一步,测摆长:从悬点量到摆球中心,记作 L。
把摆角控制在五度以内,从同一位置静止释放。
从最低点开始计时,连测三十个全振动;总时间除以三十,就是一个周期
——单次按表的误差,也缩小到三十分之一。
换几组摆长重测:周期的平方与摆长成正比,图线过原点。
由直线斜率算出 g,约九点八米每秒平方。

分镜表(6 镜,时长合计 32 秒——"约 30 秒"±3 秒内达标)
镜号 | 画面 | 口播 | 时长 | 生成方式(附取舍理由)
1 | 实验室晨光中的单摆装置特写,摆球静止悬垂 | 摆长越长,摆得越慢吗?用一只单摆测一测。 | 5 秒 | AI 图生视频(底图用实拍截图或第 12 讲装置图)——纯氛围引入、不承担数据,AI 出错代价最小;额度不足改实拍空镜
2 | 刻度尺特写:从悬点量到摆球中心,读数清晰入画 | 第一步,测摆长:从悬点量到摆球中心,记作 L。 | 5 秒 | 实拍——摆长 L 是后续计算的定量输入,必须真实可查;AI 画刻度必翻车
3 | 摆球拉离平衡位置一个小角度(约 5°),松手瞬间 | 把摆角控制在五度以内,从同一位置静止释放。 | 5 秒 | 实拍——"小角度"是周期公式成立的前提,AI 生成无法保证角度准确
4 | 秒表特写 + 屏幕录制:摆球经过最低点起表,数到第 30 个全振动停表 | 从最低点开始计时,连测三十个全振动;总时间除以三十,就是一个周期——单次按表的误差,也缩小到三十分之一。 | 8 秒 | 屏幕录制(读数)+ 实拍(秒表特写)——数字读数交给录屏,AI 画面里的文字常是乱码
5 | T²–L 散点逐个落下、连成过原点的直线(用本组真实数据绘制) | 换几组摆长重测:周期的平方与摆长成正比,图线过原点。 | 5 秒 | 图表动画(剪映关键帧或图表工具)——图表必须用本组真实数据,AI 视频不承担数据图
6 | 直线上标出斜率 k,屏幕显示 g = 4π²/k ≈ 9.8 m/s² | 由直线斜率算出 g,约九点八米每秒平方。 | 4 秒 | 图表动画 / 屏幕录制——结论数值必须与本组计算一致,不由 AI 画面给出

(表格外说明:镜 2、3、4 必须实拍 / 录屏——它们承载定量输入与读数
(摆长、摆角、计时),AI 画面无法保证数字与角度正确;AI 生成只负责
镜 1 的氛围引入,不承担任何科学结论。)

AI Agent 完成了两轮分镜脚本迭代,第 2 版为定稿(执行环境:GLM+ZCode)。

🧪 演示② 为镜号 2 写一条"图生视频"提示词

先上传镜号 1 的实拍截图(或第 12 讲生成的装置图),再输入——注意只写"运动 + 运镜",主体与风格已由图像锁定:

摆球被轻轻释放,开始小幅来回摆动,节奏均匀;
固定机位微仰视,镜头缓慢推近;
保持画面主体与背景不变,不新增物体,画面不出现文字。

第一句写运动,第二句写运镜,第三句是"不添乱"守则——主体与风格已由底图锁定,不重新描述,避免与图像"打架"(坑③);"画面不出现文字"防 AI 自加乱码字幕。还要补一句科学性检查:AI 生成的摆动节奏未必满足 T = 2π√(L/g) 的真实周期——这个镜头只作氛围,不承担定量结论。

🧪 查看运行结果(ZCode + GLM 实测 · 提示词成品)· 视频生成需课堂实机执行

本环境无文生图工具:此处为 AI Agent 生成的 SVG 矢量示意图替代演示(执行环境:GLM+ZCode)。课堂请在实际生图工具中执行同款提示词并对比。

底图:镜号 1 的实拍截图(或第 12 讲生成的装置图)
提示词只写"运动 + 运镜",主体与风格交给底图锁定。

【版本 A · 稳妥版(推荐首选)】
摆球被轻轻释放,开始小幅来回摆动,节奏均匀;
固定机位微仰视,镜头缓慢推近;
保持画面主体与背景不变,不新增物体,画面不出现文字。

【版本 B · 慢动作氛围版】
摆球小幅摆动,慢动作呈现,摆动幅度缓慢减小;
镜头极缓慢拉远,机位保持不动;
画面稳定不抖动,不新增物体,画面不出现文字。

【版本 C · 小角度环绕版】
摆球持续小幅摆动;
镜头围绕装置缓慢环绕一小段弧线后回到原位;
背景虚化程度保持不变,不新增物体,画面不出现文字。

【使用说明】
1. 三条都只含"运动 + 运镜 + 不添乱守则":不重新描述主体与风格
   (避免与底图"打架",坑③);"画面不出现文字"防 AI 自加乱码字幕;
2. 从版本 A 起试:固定机位 + 缓慢推近对生成最友好;环绕类运镜
   (版本 C)更容易出现主体形变,翻车就退回版本 A;
3. 电影美学词(光源 / 景别 / 色调)主要供文生视频从零造景时使用;
   图生视频里底图已含风格信息,重写易"打架"——确需微调光线时用
   "轻微"类措辞(如"侧逆光轻微勾边"),并以实际生成效果为准;
4. 生成后做科学性检查:AI 的摆动节奏未必满足 T = 2π√(L/g)
   ——本镜头只作氛围,不承担定量结论;
5. 即梦 / 可灵的时长档位、运镜强度、首尾帧等选项以当期功能为准。
🧪 演示③ 为镜号 1 的口播写一条 TTS 配音指令
请把下面的口播稿转成语音,用作科普短视频配音(镜 1;
逐镜分段生成,音频按镜号命名,存入小组素材文件夹):
"摆长越长,摆得越慢吗?(停顿约半秒)我们用单摆测一测重力加速度。"
要求:青年女声,语速平稳偏慢(约每秒 4 字),亲切的科普讲解语气;
输出音频文件(格式以平台支持为准)。
生成后我会逐句试听:重点听本镜术语"单摆""重力加速度"的读音;
整条片还需重点检查"周期""摆角""摆长"以及数字、字母的读法。
🧪 查看运行结果(ZCode + GLM 实测 · 口播稿定稿)· 语音生成需课堂实机执行

本环境无文生图工具:此处为 AI Agent 生成的 SVG 矢量示意图替代演示(执行环境:GLM+ZCode)。课堂请在实际生图工具中执行同款提示词并对比。

【TTS 参数指令(逐镜分段生成,音频按镜号命名存入小组素材文件夹)】
音色:青年女声;情绪:亲切科普讲解;语速:平稳偏慢(约每秒 4 字,
平台无字速选项时选"稍慢"档);停顿按稿内"(停顿 X 秒)"执行。

【镜 1 · 约 5 秒】
摆长越长,摆得越慢吗?(停顿 0.5 秒)用一只单摆测一测。

【镜 2 · 约 5 秒】
第一步,测摆长:(停顿 0.3 秒)从悬点量到摆球中心,记作 L。

【镜 3 · 约 5 秒】
把摆角控制在五度以内,(停顿 0.3 秒)从同一位置静止释放。

【镜 4 · 约 8 秒】
从最低点开始计时,(停顿 0.3 秒)连测三十个全振动;(停顿 0.5 秒)
总时间除以三十,就是一个周期——单次按表的误差,也缩小到三十分之一。

【镜 5 · 约 5 秒】
换几组摆长重测:(停顿 0.3 秒)周期的平方与摆长成正比,图线过原点。

【镜 6 · 约 4 秒】
由直线斜率算出 g,(停顿 0.5 秒)约九点八米每秒平方。

【生成后逐句试听清单】
1. 术语读音:单摆、摆长、摆角、周期、重力加速度——读错整句重录;
2. 字母与数字:"L"应读"艾勒";数字应按汉字读音播出(三十、九点八);
3. 停顿是否执行、各镜语气是否衔接;
4. 本环境无 TTS 工具,以上为可直接粘贴的定稿文本,语音以课堂
   实际 TTS 工具(剪映等)为准。
🧪 演示④ 教师演示:"文档 → 成片"自动化流水线(看懂流程即可,不要求复现)

最后看一件"调度"味道更浓的事:把一份写好的讲义文档,自动转成一条带画面、配音与字幕的讲解视频(参考阿里云官方教程,以官方文档为准)。整条流水线五道工序:

工序做什么产出
① 文档切片把文档按标题与语义切成小段一段一个"画面单元"
② 图文渲染为每一段生成画面(图文页 / 配图)成片的画面素材
③ 语音合成TTS 逐段朗读成片的配音轨
④ 字幕配音与文字逐句对齐成片的字幕轨
⑤ 剪辑合成按时间线拼装画面、配音、字幕导出成片

看懂三件事就够了:这是"流水线思维"——把大任务拆成五道固定工序,每道输入输出明确,交给不同工具接力完成(第 7 讲任务卡、第 10 讲多工具协同的同款思想);人把守两端——入料前审定文档内容,出片后逐段核对画面、读音与字幕;具体实现与工具能力以官方教程为准,课程不要求复现代码。

五、课堂实操任务单

本讲工具依赖最重,先确认额度与账号,再动手。按课程的保底任务 / 进阶挑战两层推进,每完成一项就勾选保存进度。

⚠️ 轻量备选方案:额度不足时的"正解"

视频工具额度不足或排队过长时,改用"AI 图片(第 12 讲)+ 剪映动态化(图片加运镜 / 关键帧)+ TTS 配音 + AI 字幕"——分镜表原样不动,只是"生成方式"一栏换写法,教学目标(分镜、生成、配音、字幕、合成)完全一致,不必强求文生视频。"生成方式"这一栏本来就是给你留的备胎位。

📋 保底任务(人人完成)
📋 进阶挑战(学有余力)

六、常见坑与翻车案例

七、自测

✅ 五道题检验学习目标

1. 下列哪类镜头最适合交给 AI 文生视频?

  • 单摆周期与摆长关系的定量演示
  • 秒表读数的特写
  • 星空下实验楼的氛围空镜头
  • T²–L 数据图表
查看答案

C。定量演示与图表必须实拍或自制,AI 视频的长处在氛围与引入——"科学结论交给实拍与图表,氛围与引入交给 AI 视频"。

2. 图生视频的提示词只需要写什么?

  • 主体 + 场景 + 运动
  • 运动 + 运镜
  • 风格 + 色调
  • 把整张图重新描述一遍
查看答案

B。图像已经锁定了主体与风格,再描述一遍反而会和图像"打架",造成画面形变。类比实验:初始条件已固定,只需描述过程如何演化。

3. 分镜表的五栏是?其中哪一栏相当于"额度预算表"?

  • 镜号 / 画面 / 口播 / 时长 / 生成方式——"生成方式"栏
  • 片名 / 导演 / 演员 / 音乐 / 字幕——"音乐"栏
  • 开头 / 发展 / 高潮 / 结尾 / 彩蛋——"彩蛋"栏
  • 镜号 / 光圈 / 快门 / 感光度 / 焦距——"光圈"栏
查看答案

A。"生成方式"一栏提前决定每个镜头用实拍、屏幕录制、图表动画还是 AI 生成——先把额度的账分好,就不会课上烧光额度才发现关键镜头没着落。

4. 判断题:"AI 生成的摆动视频很流畅,摆球 2 秒摆了 3 个来回,画面质感很好,可以直接用作定量演示。"

查看答案与解析

不能。AI 视频按"像"生成、不按"对"生成:小摆角下单摆周期应满足 T = 2π√(L/g),"2 秒 3 个来回"即周期约 0.67 秒,对应的摆长只有约 11 厘米——与多数课堂装置不符,画面流畅不等于物理正确。定量结论必须来自实拍测量与真实数据图表。

5. 简答:视频工具额度不足时,如何用轻量方案达成同一教学目标?请列出四个环节。

参考答案

四个环节:①AI 图片(第 12 讲生成画面);②剪映动态化(给图片加运镜 / 关键帧,让画面动起来);③TTS 配音(口播稿转语音);④AI 字幕(生成后逐条校对)。分镜表原样不动,只是"生成方式"一栏换写法——分镜、生成、配音、字幕、合成的教学目标全部达成,不必强求文生视频。

八、课后作业

📋 《科普短视频(组)》——约 3 分钟初版(含字幕与配音)

以小组为单位,把期末项目的科普内容做成约 3 分钟短视频初版。提交物四件:

  1. 成片:约 3 分钟,含字幕与配音;口径、画面与第 11 讲核心文本、第 12 讲图像素材保持一致;
  2. 分镜表:五栏定稿版,附人工修订标记;
  3. 素材与提示词记录:每个 AI 生成镜头的提示词与迭代记录、每段配音的口播稿;
  4. 《AI 使用声明》:工具 / 用途 / 核查方式(含每项素材的来源)。

✅ 自查标准:含公式与数值的镜头全部来自实拍 / 图表,AI 镜头只作氛围;字幕逐条校对过;术语读音正确;组内每人都完成了至少一个镜头的完整工序并留有记录。

关于提交时间:按课程安排,视频工具额度紧张时,本作业可延至第 14 讲一并提交;需要延期的组请课上向教师报备,并先用轻量方案完成分镜表与口播稿——这两样不依赖视频额度,现在就能做完。

⚠️ 学术诚信与素材合规提醒

按课程《学术诚信与 AI 使用规范》,本作业需附《AI 使用声明》。特别提醒:AI 生成语音的署名与使用范围以平台条款为准;背景音乐与视频素材优先用平台素材库或 AI 生成,来源全部写入声明。"AI 产出,人工把关。"

九、进阶拓展(选学)

🎓 把分镜表沉淀为"可复用资产",再看一眼流水线的延伸

本讲的三样东西——分镜表模板、口播稿写法、提示词公式——完全可以打包成一张提示词卡(第 5 讲的方法):给卡片加上"名称 / 描述",下次再做科普视频,AI 一轮就能产出接近可用的分镜表,你们只做修订与验收。这就是"把一次性的提示词沉淀为可复用方法"的最小案例,第 16 讲总结"从指令到资产"时你会再遇到这个思想。

想进一步了解"文档 → 成片"流水线的完整做法,可参考阿里云官方教程《借助大模型将文档转换为视频》(以官方文档为准);课程不要求复现代码,重点是看懂五道工序如何接力、人把守哪两端。课堂演示的录屏可向教师索取,课后复看。

更多 AIGC 使用技巧可浏览课程推荐的自学站(如 waytoagi 知识库,内容以当期为准)——对其中内容保持第 2 讲的核查习惯。

🕸图谱