⌂ 课程首页
口述影像入门 · 第 1 / 7 课

把“看见”
变成“听懂”

口述影像不是把画面逐字念一遍,而是在合适的声音空隙里,补上观众仅靠原声无法获得、却对理解作品重要的视觉信息。

⏱ 约 50 分钟 ◎ 零基础 ✦ 2 个互动实验 ✓ 4 道测验
整套课程进度:第一课

1 先感受一个“信息缺口”

理解口述影像,最好的起点不是背定义,而是先体会:当视觉通道不可用时,原声能告诉我们什么,又遗漏了什么。

想象这个片段

餐桌旁,只有三种声音

你听见杯子轻轻碰到木桌;一个人长长地呼出一口气;窗外有鸟鸣。没有对白。几秒后,门被关上。

只听这些声音,你知道“发生了一些事”,却很难确定:谁在场?那声叹气是在无奈、放松,还是等待?关门的是同一个人吗?桌上的杯子是否被推给了别人?这些答案可能已经清楚地出现在画面里。

这就是本课程会反复使用的概念:视觉信息缺口。它不是“画面里一切看不见的东西”,而是仅靠对白、音乐和环境声无法可靠获得,同时又影响理解、情绪或审美体验的视觉信息

第一条核心认知:口述影像的任务不是把画面塞满声音,而是判断哪里存在重要的信息缺口,并用尽量自然、清楚的语言把它补上。

2 什么是口述影像?

口述影像(Audio Description,常简称 AD)是一种媒体无障碍服务。它通常在影视、戏剧、展览、体育赛事等内容原有的对白和关键声音之间,加入对重要视觉元素的语言描述。

一句话定义:口述影像是在不遮盖原作关键声音的前提下,用语言补充理解作品所需的重要视觉信息

这个定义包含三个限制。第一,口述必须尊重原作的声音空间,不能为了多说而盖住对白或关键音效。第二,它描述的是“重要信息”,不是逐像素盘点。第三,描述要帮助使用者形成自己的理解,而不是替使用者下结论。

📖 想核对国际无障碍标准中的定义?→ W3C:理解预录制媒体的口述影像(说明口述影像要补充仅靠主声轨无法理解的重要视觉细节)
👤

人物

新人物出现、外貌识别线索、服装变化,以及谁正在做动作。

动作

对白没有说出的移动、手势、交换物件、视线和反应。

场景

地点、时间、空间关系,以及场景突然发生的关键变化。

画面文字

片名、时间地点字幕、短信、标识,或推动情节的书面信息。

不过,“人物、动作、场景、文字”只是一张观察清单,不是命令。一个人物衬衫上有七颗纽扣,通常不重要;但如果少了一颗纽扣正是侦探识别嫌疑人的线索,它就可能非常重要。重要性总是由作品语境决定。

3 谁会使用口述影像?

口述影像首先服务于盲人和低视力观众,但“看不清”或“不方便持续看屏幕”有许多不同状态。理解这种差异,会帮助创作者避免把使用者想成单一群体。

互动 01 · 切换使用情境

盲人观众

有些人从未拥有视觉经验,有些人后来失明;他们对颜色、透视、镜头术语或人物外貌的理解方式可能不同。口述需要清楚,但不必假设所有盲人都无法理解视觉词汇。

同一句口述对不同使用者可能有不同价值。低视力观众也许能看见人物轮廓,却看不清手中物件;后来失明的观众可能熟悉颜色和镜头语言;先天盲人观众同样可以通过生活经验和语言理解丰富的视觉概念。

不要替使用者预设能力。好的口述影像不是“把内容变简单”,而是提供公平进入作品的通道,同时保留作品本身的复杂度、节奏和风格。

4 互动实验:只听原声,你漏掉了什么?

先选择“仅听原声”,再从下方信息中挑出最值得补充的内容。重点不是越多越好,而是找出能改变理解的视觉线索。

互动 02 · 信息缺口模拟器
🔊 杯底划过木桌
🔊 一声轻轻的叹息
没有对白

单凭这些声音,你能确定杯子是被拿走、放下,还是推给别人吗?

请选择一项或多项,再观察哪些信息真正改变了你对动作的理解。

“杯子被推向桌子对面”弥补了关键动作缺口;“阳光照进来”可能帮助建立氛围,但是否值得说,要看声音空隙和作品风格;叶片数量与杯口形状通常不会改变理解。口述者必须持续做这种取舍。

5 口述者的四步工作

口述影像写作不是看见什么就立刻说什么。成熟的工作过程至少包含观察、选择、措辞和插入四步;任何一步出错,都可能让描述变得冗余、误导或干扰原作。

STEP 01

观察

准确辨认人物、动作、物件、场景变化和画面文字。

STEP 02

选择

判断哪些信息仅靠原声得不到,且对当前理解最重要。

STEP 03

措辞

用具体、可朗读、与作品风格协调的语言表达。

STEP 04

插入

把话放进合适的声音空隙,不遮盖对白和关键原声。

例如,画面中一个女人缓慢把杯子推到对面,原声只有杯底摩擦桌面的声音。观察得到的事实可能很多:她穿灰衣、右手戴戒指、杯子红白相间、阳光照进来。选择之后,当前最重要的信息也许只有“她把杯子推给对面的人”。措辞还要考虑可朗读性,而插入时机则要避开接下来响起的对白。

快速判断:哪一句更像合格的起点?

画面中,男孩盯着地上的碎花瓶,双手藏到身后。母亲走进房间。

第二句先给出可观察的动作,让观众自己判断“心虚”与否。第一句的解释未必错,但它把推断说成事实,也提前替观众完成了表演解读。后面的课程会专门练习如何处理情绪、意图和不确定性。

6 职责与边界:补充,但不接管

口述影像要在两个风险之间保持平衡:一边是信息不足,使用者无法跟上人物、动作或情节;另一边是信息过载,口述遮住原声、破坏节奏,甚至替作品解释一切。

口述者应该做

补足关键视觉信息;尽量准确地区分观察和推断;尊重对白、音乐与音效;让语言风格与作品相协调;为观众保留理解空间。

口述者需要警惕

把所有可见细节都念出来;用口述覆盖关键声音;提前泄露尚未揭示的信息;把个人评价包装成事实;为追求“好听”而改变动作含义。

“客观”并不等于没有选择。口述者必然会选择说什么、何时说、用什么词。专业性来自承认这些选择,并让它们服务于信息可及、作品完整和使用者自主理解。

此外,口述影像不是单纯的写作任务。它涉及脚本、时间码、录音、混音和使用者反馈。优秀作品往往来自团队协作,并通过盲人或低视力使用者的审听不断修订。口述者不是替使用者发言的人,而是无障碍内容制作链条中的一名协作者。

📖 想看看行业如何处理信息取舍?→ Netflix 口述影像风格指南(包含动作、人物、画面文字、声音优先级等制作原则)

7 本课小结

1

从缺口出发

先问“只听原声会漏掉什么”,再决定是否需要描述。

2

服务多样使用者

盲人和低视力观众不是单一群体,不应被预设为能力相同。

3

遵循四步

观察、选择、措辞、插入,比“看见什么说什么”更可靠。

4

保留理解空间

描述可观察的证据,不轻易把推断或评价当成事实。

理解测验

每题作答后会立即显示解析。答错也没关系,重点是把判断理由弄清楚。

1. 下列哪一句最准确地概括了口述影像?
正确。口述影像的关键是“重要视觉信息”与“尊重原声”,不是穷举画面或改写剧情。
再想想:口述既要补足视觉信息,也不能接管作品原有的对白、声音和解释空间。
2. 什么最符合“视觉信息缺口”的含义?
正确。“缺口”由原声、画面与语境共同决定,不等于所有未说出的细节。
“信息缺口”有重要性门槛:没有被说出,并不自动意味着值得口述。
3. 面对“女孩皱眉,把信揉成一团”,哪种写法更稳妥?
正确。动作和表情是画面证据;“坏消息”“愤怒”“绝望”需要更多语境支持。
这句话加入了画面未必能确认的原因或情绪结论。先准确描述可观察证据更稳妥。
4. 下列哪项不属于口述者的基本工作步骤?
正确。人物动机可能是作品刻意保留的悬念,口述者不应擅自给出答案。
观察、选择、措辞和插入都是基本流程;替观众断定人物动机不是。

延伸阅读

如果你想从定义走向更完整的行业实践,以下资料都适合作为下一步入口:

台湾文化主管部门 · 中文手册
以中文介绍影视口述影像的服务方式、观看情境和推广实践,适合零基础学习者建立整体印象。
W3C Web Accessibility Initiative · 无障碍指南
解释哪些视频需要描述、口述影像与描述性文本的关系,以及标准口述和扩展口述的区别。
American Council of the Blind · 使用者倡议与资源
由美国盲人委员会推动的口述影像项目,介绍服务对象、应用场景和高质量口述影像的倡议工作。
Described and Captioned Media Program · 快速参考
简洁列出“描述所见”、尊重原声、匹配作品语气和准确研究术语等入门提醒。
Netflix Partner Help Center · 行业制作指南
提供人物、动作、场景、画面文字、音乐和沉默等具体处理原则,可在后续课中反复查阅。

配套实操

答案会自动保存在当前浏览器中。这里不追求“唯一正确”,而是练习发现信息缺口和区分观察与推断。

电影原声练习 · 约 12 分钟

先听,再看:门外送来了什么?

这段 30 秒片段截取自用户提供的《机器人之梦》视频,保留影片原始声画。你会先关掉画面,只凭门锁、纸张、纸箱和车辆等声音建立理解;再恢复画面,找出声音无法确认的人物与物件信息。

  1. 点“只听原声”,从头播放一次,不要偷看画面。
  2. 记录你能确认的信息;再点“正常观看”,重新播放。
  3. 比较两次理解,写一句最值得补充的口述。
片段来源与使用说明

来源:用户本地提供的《机器人之梦》视频,原片约 00:04:20—00:04:50。

处理:保留原始同步音轨,仅做精确截取、画面等比缩放和网页兼容转码;没有另加脚步、纸张或环境音效。

使用范围:课程发布者已确认拥有在本课程及其公开网站使用本片段的版权授权。影片及片段不得脱离课程单独转载或二次分发。

只写声音直接支持的信息,不猜人物身份。
重点找“改变故事理解”的视觉动作。
尽量控制在 20—35 个字,先说动作,再考虑衣着或场景细节。
比较 0—17 秒:门外是谁?收件人是谁?纸箱外观透露了什么,仅凭声音能确认这些信息吗?
若只能说一句,优先交代“谁送来了什么、谁签收”,而不是房间摆设、制服颜色或门锁数量。
完成后再看:参考口述与取舍说明
00:00—00:08 透过猫眼,一名高大的牛头快递员抱着纸箱等在门外;小狗打开层层门锁。
00:08—00:17 小狗开门签收,快递员把印有机器人图案的大纸箱递给它。
00:18—00:30 快递员下楼离开;送货车驶走,小狗把纸箱拖进屋。

为什么这样写:门锁、写字、纸箱移动和汽车声已经提示“有人收货”,口述应补上原声无法确认的角色身份、机器人包装图案和交付关系。门锁数量、制服颜色与房间摆设虽可见,却不是这段因果关系的第一优先级。

一种更紧凑的写法:“一名牛头快递员送来机器人包装箱;小狗签收后,把箱子拖进屋。”

提交前自检
已完成 0 / 4 项自检
文字答案和自检状态只保存在当前浏览器,不会上传。

练习 1:找出信息缺口

原声:雨声。一把钥匙掉在地上。女人说:“你怎么会有这个?”男人没有回答。

画面:女人捡起一把刻有酒店房号的钥匙。男人悄悄把左手上的戒指摘下,放进口袋。

任务:如果声音空隙只能容纳一句短口述,你会优先补充哪条视觉信息?为什么?

先区分“原声已经告诉我们的”与“只有画面告诉我们的”。再判断酒店房号和摘戒指,哪一项对当前悬念更关键;如果都重要,能否用一句话建立先后关系?
本地自动保存,不会上传。

练习 2:把推断改成观察

原句:“老人孤独地望着空椅子,想念已经离开的妻子。”

已知画面只呈现:老人坐在餐桌旁,望着对面的空椅子,手指摩挲一张合照。

任务:保留画面的情感力量,但删去无法确认的心理和背景结论。

“孤独”“想念”“妻子已经离开”都可能是合理推断,但画面证据是空椅子、凝视、手指摩挲合照。让这些证据自己传递情绪。
本地自动保存,不会上传。

练习 3:建立你的第一张检查卡

任务:用自己的话写下,在决定“要不要说”之前,你准备问自己的三个问题。

可以围绕三个方向:原声是否已经传达?它是否影响理解或体验?说出来会不会遮盖更重要的声音或过度解释?
本地自动保存,不会上传。
← 这是第一课 下一课:建立结构化观察方法 →