⌂ 课程首页
口述影像入门 · 第 4 / 7 课

什么时候说:
在声音缝隙中安排口述

好文案还要在正确的时刻出现。本课学习辨认对白、音效与静默的功能,估算句子时长,并在有限空隙中决定说什么、何时停。

⏱ 约 50 分钟 ◎ 零基础 ✦ 3 个互动实验 ✓ 4 道测验
整套课程进度:第四课

0 快速回顾

第 3 课解决“怎么说”。进入时间安排前,先确认两条写作原则。

问题 1

为什么“他很可疑”通常不如“四下张望”适合作为口述?

“四下张望”是可核验动作,既具体又保留观众判断空间;“可疑”是描述者的评价。
问题 2

句子已经准确,为什么还不能直接塞进任何空白?

口述与对白、音效、音乐共同占用听觉通道。时机不当会遮挡原声、抢先剧透或让信息离画面太远。

1 先听原声,再找“可用的空隙”

口述影像不是把视觉信息填满所有沉默,而是在作品原声允许时补上关键视觉信息。所谓“声音缝隙”,不是波形变平的每一秒;它必须同时满足两个条件:原声没有正在传递更重要的信息,而且口述能与画面动作保持可理解的时间关系。

一个常见误判

走廊突然安静了,可以立刻说吗?

镜头里保安屏住呼吸,远处传来钥匙轻响。表面上没有对白,但这段“安静”正在制造悬念,钥匙声还提示某人靠近。如果口述者连续说满,听者会失去与明眼观众相同的紧张节奏。静默也可能是叙事内容。

第一层对白

通常优先保护;除非制作规范明确允许,否则不要覆盖。

第二层叙事性原声

关键音效、人物喘息、电话铃、门锁声都可能推进剧情。

第三层可用空间

在不损害前两层时,安排与画面同步、长度合适的口述。

空白不等于空闲:先问“此刻原声在做什么”,再问“我能不能说”。
对照专业规范:DCMP 明确提醒,不要试图填满每一处停顿,并应让氛围与背景声自然呈现。阅读 Description Key:How to Describe

2 互动时间轴:选择真正合适的插入口

下面是一段 15 秒场景。待插入的口述是:“女人捡起钥匙,塞进口袋。”预计需要约 4 秒。点击三个候选位置,判断哪个最合适。

互动 01 · 声音缝隙选择
0–3 秒
对白
3–6 秒
环境声
6–7.5 秒
钥匙落地
7.5–10.5 秒
对白
10.5–15 秒
动作+轻音乐
请选择一个时段。

A 会覆盖对白;B 虽有一段环境声,却会压住钥匙落地这一关键提示;C 避开对白与关键音效,并与女人捡钥匙的动作接近。实际制作中还要试听音乐、表演停顿和语速,因此时间轴选择是起点,不是最终答案。

3 同步:让听者知道“现在发生了什么”

口述与画面的距离会改变理解。动作发生很久之后才描述,听者可能已经把后续对白归因给错误的人;动作发生前就透露结果,则可能形成剧透。理想状态是让描述尽量贴近动作,同时不盖住更重要的声音。

贴近而不抢先

男人伸手碰门把时说“他握住门把”,随后保留开锁声。听觉和动作在同一事件里汇合。

过早或过晚

门还未打开就说“屋里空无一人”,会提前揭示镜头;等下一句对白开始后再补门的动作,又会造成时序混乱。

有时必须略微提前或延后。例如一个动作只有半秒,而前后对白紧密,可以把描述放在动作前的短空隙,只要不会泄露悬念;也可以在动作后立刻补说,只要听者仍能把语言与事件对应起来。同步不是机械追求同一帧,而是维护叙事因果。

4 字数与时长:先估算,再朗读

中文口述的速度会随说话人、句式、情绪和录音要求变化。初稿阶段可以用“字数 ÷ 每秒字数”粗估,再加入起止缓冲;最终必须用实际朗读计时。初学时可先以每秒 3.5 个非空白字符作为中速参考,并用较慢、较快三档观察风险。

文本量非空白字符数
÷
朗读速度字符 / 秒
安全余量约 0.3 秒
互动 02 · 字数时长估算器

输入一句口述,选择参考语速,并设置可用声音空隙。

13 个字符 4.0 预计秒数(含 0.3 秒余量)

可用空隙:

估算器不应该成为“把句子说得越来越快”的借口。语速过快会降低清晰度,也可能破坏作品节奏。若一句话放不下,优先处理信息优先级和句子结构,而不是无限加速。

同步并非只有一种答案:ADLAB 指南讨论了提前描述、同步描述和延后描述如何分别影响理解、悬念与喜剧效果。阅读 ADLAB Audio Description Guidelines

5 信息密度:一个空隙只承担一个主要任务

空隙越短,越需要区分“理解这一刻必须知道什么”和“有时间才补充什么”。动作结果、人物身份变化、关键物件通常优先;服饰纹理、背景摆设或镜头质感要看它们是否承担叙事和风格功能。

层级优先考虑可以压缩或后移
必须谁做了什么、关键结果、影响后续理解的物件通常不删,但可以换更短的准确动词
重要表情姿态、进入或离开、必要的空间关系根据空隙合并或移到邻近空档
增色服装细节、布景质感、摄影风格不能影响必须信息,适合更长或低负荷段落
互动 03 · 四秒信息打包

画面:女人蹲下捡钥匙,同时警察在走廊尽头出现。可用空隙 4 秒。点击你想保留的信息,观察是否装得下。

当前口述请先选择信息。
预计 0.0 秒尚未覆盖关键动作

如果三条必须信息无法在四秒内清楚说完,可以先压缩为“女人捡起钥匙塞进口袋。走廊尽头,警察出现。”也可以把警察出现安排到紧邻的下一处空隙。不要为了保留风衣和挂画而挤掉动作结果。

6 节奏:口述也需要呼吸

同样长度的空隙,在喜剧、动作片和沉思性纪录片里承担的功能不同。快速剪辑可以容纳短促、动词明确的句子;长镜头并不意味着必须写成长句,它可能需要留白,让环境声、音乐和表演自然展开。

动作密集

拆成短句,优先结果和方向,避免在高潮时补背景资料。

对白密集

寻找句间呼吸或相邻空隙,必要时合并、后移或放弃次要细节。

悬念静默

保护关键细微声音,不要把所有安静都视为可占用空间。

抒情长镜头

选择少量有质感的视觉信息,匹配作品速度,主动留下停顿。

口述不是第二条不停播放的对白轨。它要进入作品的节拍,也要知道何时退出。

7 四步安排法:听、标、写、读

面对一段新视频,不要一开始就逐字写稿。先建立声音地图,再决定信息如何落位。这个顺序能减少反复删改,也能更早发现“根本没有足够空隙”的段落。

01 听

先闭眼听一遍,标出对白、关键音效、音乐转折和有功能的静默。

02 标

记录可用空隙的起止,并注明动作发生点和不可覆盖声音。

03 写

按优先级写入,先保证必须信息,再决定是否加入质感。

04 读

用目标声音实际朗读,检查起止余量、清晰度和作品节奏。

复核时至少播放三次:第一次只检查有没有盖住原声;第二次闭眼听,确认句子能否一次理解;第三次连着前后场景播放,检查人物、物件和因果是否连续。单独听一句合格,不代表放进整段后仍然合格。

8 本课小结

保护原声

对白、关键音效和有功能的静默都可能比口述更优先。

贴近动作

避免过早剧透和过晚补说,维护事件的时间与因果关系。

估算后实读

字数公式只用于初筛,最终以目标声音朗读和完整试听为准。

密度服从理解

先保必须信息;放不下时删、改、移,不靠无限加速硬塞。

理解测验

每题作答后会立即显示解析。

1. 一段没有对白的静默,可以直接视为口述空隙吗?
正确。空隙的判断看声音功能,不只看有没有对白。
“没有对白”只是第一步;静默、音乐和音效也可能很重要。
2. 估算出的句子时长比空隙长 1 秒,优先怎么处理?
正确。先改信息和句式,再考虑小幅语速调整。
清晰度和原声不能为了保住字数而牺牲。
3. 为什么最终不能只依赖“字数 ÷ 语速”的计算?
正确。估算用于筛查,目标声音的实际朗读才是最终依据。
时长没有统一固定值;公式能粗估,但不能代替实读。
4. 动作发生后很久才补说,最大的风险是什么?
正确。同步服务于理解,不只是技术上的时间码整齐。
核心问题是叙事对应关系会被打乱。

延伸阅读

以下资料从行业、教育和国际标准三个角度补充本课的时间安排原则。

配套实操

答案会自动保存在当前浏览器。练习时建议拿秒表朗读,不要只看字数。

《机器人之梦》原声练习 · 约 12 分钟

给保龄球声效留位置

这段 28 秒梦境包含准备、滚动、撞击、反应和回球等连续节拍。先做声音地图,再决定哪里需要口述、哪里必须留白;可用时间并不等于必须说满。

  1. 只听原声,用大约时间标出三个最重要的声音落点。
  2. 恢复画面,找出原声无法确认、却影响笑点或因果的视觉信息。
  3. 写一条不超过 18 个汉字的口述,并注明它应放在哪个窗口。
片段来源与使用说明

来源:用户本地提供的《机器人之梦》视频,原片约 00:48:58—00:49:26。

处理:保留原始同步音轨,仅做精确截取、等比缩放和网页兼容转码;没有另加或替换音效。

使用范围:课程发布者已确认拥有在本课程及其公开网站使用本片段的版权授权。影片及片段不得脱离课程单独转载或二次分发。

时间不必一次就很精确,但要标出不可覆盖的声音。
说明为什么音乐、撞击或反应本身比口述更重要。
不超过 18 个汉字;朗读两遍,记录实际时长。
重点试听球状物滚动、撞击和观众反应出现的位置。不要把句尾压在关键声效上。
原声可能让人知道“有人打保龄球”,但未必能确认被当作球滚出去的是什么,以及它如何回到雪人身上。
完成后再看:一种时间安排
00:00—00:05 候选口述:“雪人摘下自己的头,助跑。”
00:06—00:18 建议保护滚动、撞击和现场反应,不在关键落点上继续解释。
00:23—00:28 候选口述:“圆头从回球机升起,落回它肩上。”

取舍说明:这里只提供安排思路,不是唯一答案。真正的入点和出点应以实际朗读及原声试听为准;如果两句放不下,宁可保留第一次视觉反差,删去第二句,也不要用过快语速挤满片段。

提交前自检
已完成 0 / 4 项自检

练习 1:制作声音地图

15 秒片段:0–3 秒母亲说话;3–5 秒孩子低头,钟表滴答;5–7 秒杯子落地碎裂;7–10 秒母亲惊呼;10–15 秒孩子蹲下捡碎片,只有轻音乐。

任务:标出不可覆盖的声音、候选空隙,以及你打算描述的动作发生点。

对白与惊呼优先保护;杯子碎裂是关键叙事音效。10–15 秒可能是候选空隙,但仍要试听轻音乐和动作节奏。
本地自动保存,不会上传。

练习 2:四秒压缩

初稿:“穿着沾有雨水的深蓝色长风衣的女人弯下腰,从带花纹的地毯上迅速捡起一把银色钥匙,然后塞进自己的右侧口袋里。”

任务:为 4 秒空隙写一个版本,保留推动情节的动作和物件;朗读并记录实际时长。

先试“女人捡起钥匙,塞进口袋”。如果风衣用于人物识别,再把稳定标签加回去。
本地自动保存,不会上传。

练习 3:比较三个插入方案

画面:男人看见照片后沉默两秒,吸气,随后说:“原来是你。”

任务:分别考虑在沉默前、沉默中、对白后描述“他认出照片里的人”,写出你的选择和理由。注意这句话是否越过可见证据,以及是否破坏停顿。

先把句子改回证据,例如“他盯着照片,吸了口气”。再比较放置位置是否提前解释对白,或盖住有意义的吸气和停顿。
本地自动保存,不会上传。
← 上一课:客观、准确又好懂 下一课:人物、动作与情绪 →