読み上げと AI 音声
オフラインの AI 音声が重要な理由
長いあいだ、よい合成音声とは自分の文章を誰かのサーバーに送ることでした。1 段落なら妥当な取引です。しかし 3 週間かけて読む 1 冊となると別の取引になります。そして小さな技術的変化が、それを静かに不要にしました。
長編小説は 8〜12 時間の音声、およそ 50 万文字です。この数字がすべての論拠なので、まずここに腰を据えるだけの価値があります。
1. 費用が見えないものではなくなる
クラウドの読み上げは文字単位の課金です。本の規模ではこれは端数ではありません。だからこそ、それを基盤にしたサービスはどれも買い切りではなくサブスクを売ります。読み続けるかぎり毎月払うか、すでに持っているハードでモデルを動かして 1 時間あたり 0 円にするか、という選択です。
これはサブスクが悪いという主張ではありません。数ある行為のなかで読書にだけはメーターを付けるべきではない、という主張です。
2. あなたの本は匿名のデータではない
文章を発話するには、クラウドサービスがその文章を受け取らねばなりません。記事 1 本なら些細なことです。しかし蔵書となれば、何を、どの順に、1 日のいつ、どこまで読んだかの記録になります。読書履歴は異様なほど雄弁です。健康、信仰、政治、喪失、先月そっと調べていた何か。
しかも本だけではありません。人は契約書や医療の書類、未発表の原稿まで読み上げツールに通します。端末内の朗読なら、その中身は端末を出ません。どんなプライバシーポリシーにも並べない保証です。
3. 実際に読む場所で動く
地下鉄、飛行機、田舎道、90 分ごとに再ログインを求めるホテルの Wi-Fi。端末に住む音声は、電波が 5 本でもゼロでも同じ秒に始まります。クラウドの音声はバッファし、圏外の縁でつっかえ、上空 1 万メートルでは完全に止まります。
もっと細かい話もあります。端末内エンジンは次の数段落を先に生成できるので、章の切り替わりが無料になります。うまくいっているときは誰も気づかず、うまくいかないときは全員が気づきます。
4. バッテリーと通信量、ただし細部込みで
正直に書くと、音声をローカルで作ればプロセッサを、配信を受ければ無線を使います。どちらも無料ではありません。実際には、継続的な通信のほうが小さく効率的なモデルよりバッテリーを食う傾向があり、端末内の朗読はモバイル通信をまったく使いません。長く聴くならこちらのほうが大きい数字です。
モデルの重さはここで効きます。Piper のような軽いエンジンはほとんど目立ちませんが、Kokoro のような重いものはチップに負荷をかけ、古い端末では駆動時間に表れます。どちらを選ぶかは実際の判断で、Piper と Kokoro で扱っています。
5. 動き続ける
クラウドサービスは変わります。値上げ、無料枠の終了、API の廃止、企業の買収。アプリのストレージに収まった音声モデルには、そのどれも起きません。5 年後も今日とまったく同じように読んでくれます。そのきっかけになったサービスを誰かが今も保守しているかどうかとは無関係に。
何年も使い続ける読書アプリにとって、その安定性は音質と同じだけの価値があります。
技術的に何が変わったのか
これらは少し前まで不可能でした。理由は正確に述べる価値があります。ニューラル音声モデルはかつてデータセンターを必要としました。それを解いたのは 2 つです。はるかに少ないパラメータで良い音声を作れるアーキテクチャと、この種の処理が本当に速くなったスマートフォンのチップです。
Piper はオープンソースの音声アシスタント界隈から生まれ、音声ごとのモデルが小さく、速度と対応言語の広さを重視します。Kokoro は逆方向に進み、人間らしさに容量を多く割きながら、スマートフォンで動く程度に小さく収めました。この 2 つで読者に必要なものの大半が埋まり、しかも両方ともオープンです。だからこそ独立系のアプリが搭載できるのです。
正直な反論
- 最良のクラウド音声はいまも上。表現力、キャラクターの演じ分け、感情の幅では大規模なホスト型モデルが勝ちます。端末内は差の大半を埋めましたが、全部ではありません。
- 対応言語には偏りがある。端末内に優れた音声がある言語もあれば、まったくない言語もあります。資源の多いクラウドのほうが広く覆えます。
- モデルは容量を食う。ダウンロードした音声はストレージを占めます。64 GB の端末では実際のコストです。
結論はこうです。単発の記事なら、いちばん良く聞こえるものを使えばよい。しかし蔵書については、音声は本と同じ場所に住むべきです。
実際にはどうなるか
Lectern は両方のエンジンを搭載し、開いた本の言語を判定し、合う音声を提案し、一度ダウンロードすれば以後ネットワークを必要としません。読み上げ中の文はハイライトされて目で追え、朗読中は画面が点いたままで、この流れのどこにもアカウントは登場しません。
要点は、オフラインが機能だということではありません。自分のものである本を、自分の端末で動く声が読み、誰も記録を残さない。それが、読書がサービスになる前の姿だということです。
よくある質問
オフライン音声はクラウド音声と同等ですか。
近いですが同一ではありません。最良のホスト型モデルは今も表現力で上です。ただ何時間も続く朗読という用途では、Kokoro のような現在の端末内ニューラル音声は十分快適で、多くの人は違いを気にしなくなります。
音声 1 つにどれくらいの容量が必要ですか。
軽いエンジンなら 1 音声あたり数十メガバイト程度、重いものはもっと必要です。読む言語の分だけを、一度ダウンロードするだけです。
端末内の朗読はバッテリーを消耗しますか。
無線ではなくプロセッサを使います。長時間ではストリーミングと同等かそれ以上に有利なことが多く、モバイル通信も使いません。気をつけるべきは、古い端末で重いモデルを使う場合です。
なぜ多くのアプリは今もクラウドなのですか。
そのほうが簡単だからです。API を 1 回呼べばどの端末でも同じ音声が出ます。端末上で動くモデルを配るには、梱包し、更新し、多数のハードウェアで試験する必要があります。
続けて読む