朗读与 AI 语音
同步高亮如何让阅读变得更好
听书和读书通常被当成二选一。而两件事同时做、并把正在朗读的句子标在页面上,其实是第三种东西;对不少读者来说,它比前两者都更管用。
它是什么:应用把文字念出来,同时标出它当前所在的句子,于是你的眼睛始终知道声音走到了哪里。没有比这更复杂的机制,而它的效果远超这份简单。
它为什么有效
当文字与音频对齐时,有三件事同时发生:
- 解码变轻松了。把字母变成声音,是很多人阅读中最吃力的一环。这一步由声音代劳,而你的眼睛留在词上,于是意义抵达时不再有那道瓶颈。
- “我读到哪了”不再是问题。跟丢行,正是小屏幕上、行驶途中或疲惫时读不下去的原因。一个被标出的句子给了眼睛一个可以回来的锚点。
- 节奏来自外部。声音会一直往前。你没法在一个段落上卡五分钟,而很多阅读时段正是这样悄悄结束的。
边听边读作为识字与语言学习的支持手段已相当成熟,在课堂上使用了几十年。它不是魔法,也不能替代独立阅读的练习,但作为辅助手段,它的证据基础异常扎实。
谁受益最大
- 阅读障碍读者。音频加文本是这一领域的常规做法,恰恰因为它把解码和理解分开了。细节见最适合阅读障碍的应用。
- 语言学习者。看到一个词的同时听到它,把拼写和发音接了起来,而这正是新语言里缺失的那条线。见用读书来学一门语言。
- 低视力读者。大字号加声音再加可见的位置,比任何单项都更好用。
- 注意力有困难的人。移动的标记给眼睛一个可追随的对象,而节奏是在你脑子之外设定的。
- 任何在疲惫时读书的人。夜深时,能不能跟着读下去,往往就是“再读一章”和“合上书”的分界。
技术上怎么实现
应用有两种方式知道该高亮什么。
由文字转语音驱动。语音是应用自己生成的,所以它精确知道读到哪一句,也就能把它标出来。这对任何书、任何受支持的语言都有效,无需事先准备。质量取决于声音:Piper 与 Kokoro 这类设备本地的神经引擎,音质足以连听数小时;当“别停下来”本身就是目的时,这一点很关键。
EPUB3 Media Overlays。有些出版社会连同文本一起提供真人录音,并附上把两者对应起来的时间数据。有这个的时候,它就是最好的版本:专业朗读加精确同步。它也很稀少,因为制作起来是要真金白银的。
Lectern 两者都支持:对任何书都提供带逐句高亮的设备本地神经朗读,以及出版社提供时的 Media Overlays。
按句还是按词?
逐词高亮看着很唬人,读起来往往更差。标记一直在动,会把你的眼睛拽到理解之前,让阅读变成追踪一个目标。
按句标记更安静。它给出的信息足以让你不迷路,又不会自己抢走注意力,而且能容忍任何合成语音都会有的细微时间偏差。如果两种都有,先从句子开始。
怎样设置得好
- 先定语速。从 0.9 左右起步再微调。太慢和太快一样糟:眼睛冲到前面,联系就断了。
- 让屏幕保持常亮。读到一半就变暗的应用,会把整件事的意义抹掉。为此而做的阅读应用会在朗读时保持屏幕唤醒。
- 把高亮调弱,而不是调强。柔和的底色比强烈的色块更好读;你要的是找到那一行,而不是盯着标记看。
- 字号比平时大一点。你在同时读和听,就让眼睛每行少费点力。
- 分两遍用。第一遍配音频把这一章过完,第二遍关掉音频再读真正要紧的部分。对学习材料尤其有用。
它做不到什么
单靠它并不会让你读得更快;对于状态良好、精力充沛的熟练读者,它甚至可能比默读还慢。这没问题。它是一件关于可及性和耐力的工具,而不是效率技巧;它的价值恰恰显现在无辅助阅读最艰难的地方:一门新语言、一个漫长的白天、一段难啃的文本,或者一个让解码变得昂贵的诊断。
用在那里,它把合上的书变成打开的书。这个结果,比任何关于阅读速度的说法都更大。
常见问题
同步高亮是什么?
一边听朗读一边读,同时把正在朗读的句子标在页面上。它让你的位置始终可见,眼睛和音频不会走散。
边听边读真的有用吗?
这是证据较为扎实的阅读支持手段之一,在阅读障碍支持和语言教学中被广泛使用。它降低了解码的负担、稳住了节奏,因此人们用它读完了更多书。
逐词比逐句更好吗?
通常不是。每个词都跳一次的标记,会把眼睛拽到理解前面。按句高亮既能让你不迷路,又不会变成你盯着看的东西。
这需要特别的书吗?
由文字转语音驱动的高亮不需要,任何应用能读的书都行。而把文本与真人录音配对的 EPUB3 Media Overlays,需要出版社随书提供,这类版本并不常见。
继续阅读