AI 语音服务端教程:本地模型、音色克隆与航司绑定
AI 语音服务端(在主程序里叫 Advanced TTS,订阅功能)是一个独立的本地程序:它把 AI 语音模型跑在你自己的电脑上,为客舱广播实时合成任意航司、任意语言的语音,并支持用一段 5–30 秒的参考音频克隆音色。全程本地推理,不调用云端 API,广播文本不会离开你的局域网。
1. 它是怎么工作的
- 服务端内置 Fish Audio S2 Pro 系列模型,通过纯 C++ 推理引擎运行,模型是单文件 GGUF 权重——不需要 Python 环境,开箱即用。
- 它以 HTTP 服务的形式常驻(默认端口
17150),主程序通过局域网请求语音;带结果缓存,同一段广播只合成一次,之后直接取用。
- AI 推理吃 CPU 和 GPU。建议装在另一台闲置电脑上,通过局域网调用,免得跟模拟器抢资源。装在本机也可以,但飞行中合成时可能感到卡顿。
- 提供 Windows 与 macOS 版本;界面支持中文、日本語、English;同一台机器只允许运行一个实例,关窗默认收进托盘。
2. 下载模型
首次启动后,在「服务」页可以一键下载推荐模型(q6_k,4.53 GB);想自己选档位就到「模型」页,按显存大小挑:
| 量化档 | 体积 | 适合 |
| q2_k | 2.58 GB | 最小体积,质量明显下降,仅救急 |
| q3_k | 3.03 GB | 低显存过渡选择 |
| q4_k_m | 3.57 GB | 3–4 GB 显存或纯 CPU 的首选 |
| q5_k_m | 4.03 GB | 4–6 GB 显存 |
| q6_k(推荐) | 4.53 GB | 6–8 GB 显存 |
| q8_0 | 5.63 GB | 8 GB 以上显存 |
| f16 | 9.91 GB | 10 GB 以上显存,最高精度 |
- 分词器会自动一起下载;下载源默认走
hf-mirror.com(大陆网络友好),可切换官方 huggingface.co。
- 支持断点续传:下到一半可以中断,临时文件保留在 models 目录,下次接着下。
- 下载完成后在「使用哪个模型」下拉里选中它,点「应用并重启引擎」。
3. 选择计算后端
在「设置」页选计算后端:自动 / CPU / CUDA / Vulkan。
- NVIDIA 显卡走 CUDA——点旁边的按钮把 CUDA 引擎下载下来。
- AMD 显卡和核显走 Vulkan,随安装包自带,无需额外下载。
- 机器上有多块显卡时,可在「显卡」里指定用哪一块;显存不够时程序会自动把部分组件放回 CPU 运行,牺牲速度保住可用性。
4. 克隆音色
在「音色」页点「从音频克隆」,选一段你喜欢的嗓音:
- 格式:WAV / MP3 / Ogg Vorbis(Opus 编码的 .ogg 会被识别并提示换格式)。
- 时长:每段建议 5–30 秒的干净人声;太短会直接报错。
- 可以给多段:程序会把它们拼成一条(段间垫 0.3 秒静音),总长超过 30 秒的部分会被截掉。
- 每段都必须配上对应的转写文本——参考音频和它的文字内容是成对使用的,文本越准,克隆效果越好。
5. 把音色绑定给航司
「广播」页是一张 航司 × 语言 × 性别 → 音色 的绑定表,航司用 ICAO 三字码(ANA / CCA / CES……)。选好航司、语言和性别,点「新增」即可绑定;同页支持删除、复制和试听。
- 语言选「自动」= 这家航司的兜底音色:请求的语言没有单独绑定时,就用这一条。
- 绑定是严格按航司隔离的:A 航司没绑过的语言不会去借 B 航司的音色;连兜底都没有时,主程序会自动回落到普通 TTS。
- 某语言首次没有任何音色时,服务端会自动生成一条该语言的默认音色并绑上,保证装好就能出声。
- 做好的音色可以导出成 .cln 克隆包(含参考音频与航司绑定信息),换电脑或分享给朋友时导入即可,重复项会自动跳过。
6. 连接主程序
回到 iAnnouncer Pro 的 SETTINGS → Broadcast,把广播 TTS 引擎切成 Advanced TTS,填上服务端那台电脑的 IP 和端口 17150,点 Test——显示测试通过就全通了。
- 连不通时,在主程序那台电脑的浏览器里打开
http://服务端IP:17150/v1/selftest?format=text 做自检,能区分是网络不通还是服务未就绪。
- 回落机制:客舱广播优先走 AI 语音;没有对应音色或 30 秒内没出结果时,自动回落到普通 TTS,飞行不会被打断。
- 载入 SimBrief 计划时,主程序会把本次航班的全部动态广播提前送去合成(预生成),飞行中基本都是取缓存、零等待。
- GSX 语音、RAAS 语音和副驾驶语音不走 AI 服务端,始终由本地引擎负责。
安全提醒:服务端不做身份校验,请只在可信的家庭局域网内使用。若只在本机使用,可在「设置 → 高级设置」把监听地址从 0.0.0.0 改成 127.0.0.1,彻底不对外。
7. 常见问题
- 某家航司没声音?检查「广播」页:这家航司有没有绑定所请求的语言;没有的话,有没有「语言=自动」的兜底行。
- 报「参考音频太短」?换一段 5 秒以上的音频,或多给几段让程序拼接。
- 下载太慢?默认镜像源已对大陆网络优化;也可中断后改天续传,进度不会丢。
- 克隆别人的声音合法吗?用作克隆的参考音频必须由你自行确保已获授权,不得用于冒充他人或任何违法用途。
AI Voice Server Guide: Local Models, Voice Cloning and Airline Binding
The AI voice server (called Advanced TTS in the main app; a subscription feature) is a standalone local program: it runs an AI speech model on your own hardware, synthesises cabin announcements for any airline in any language in real time, and can clone a voice from a 5–30 second reference clip. All inference is local — no cloud API, and your announcement text never leaves your LAN.
1. How it works
- The server ships with the Fish Audio S2 Pro model family running on a pure C++ inference engine with single-file GGUF weights — no Python environment needed.
- It runs as a resident HTTP service (default port
17150); the main app requests speech over the LAN. Results are cached, so each announcement is synthesised only once.
- AI inference is CPU/GPU heavy. Installing it on a second, idle PC on your LAN is recommended so it never competes with the simulator. Same-PC use works too, but you may feel stutters during synthesis.
- Windows and macOS builds are available; the UI speaks English, 中文 and 日本語; one instance per machine, and closing the window minimises to the tray.
2. Downloading a model
After first launch, the Services page offers a one-click download of the recommended model (q6_k, 4.53 GB). To choose yourself, open the Models page and pick by VRAM:
| Quantisation | Size | Best for |
| q2_k | 2.58 GB | Smallest; clearly degraded quality, last resort |
| q3_k | 3.03 GB | Low-VRAM stopgap |
| q4_k_m | 3.57 GB | First choice for 3–4 GB VRAM or CPU-only |
| q5_k_m | 4.03 GB | 4–6 GB VRAM |
| q6_k (recommended) | 4.53 GB | 6–8 GB VRAM |
| q8_0 | 5.63 GB | 8 GB+ VRAM |
| f16 | 9.91 GB | 10 GB+ VRAM, highest fidelity |
- The tokenizer downloads automatically alongside; the default mirror is
hf-mirror.com, switchable to the official huggingface.co.
- Resumable downloads: you can interrupt at any point — the partial file stays in the models folder and continues next time.
- When done, select the model in the "active model" dropdown and click "Apply and restart engine".
3. Choosing a compute backend
On the Settings page pick a backend: Auto / CPU / CUDA / Vulkan.
- NVIDIA GPUs use CUDA — click the button next to it to download the CUDA engine.
- AMD GPUs and integrated graphics use Vulkan, which ships with the installer.
- With multiple GPUs, pick one under "GPU"; if VRAM runs short, the server automatically moves parts of the pipeline back to the CPU — slower, but it keeps working.
4. Cloning a voice
On the Voices page click "Clone from audio" and feed it a voice you like:
- Formats: WAV / MP3 / Ogg Vorbis (Opus inside .ogg is detected and rejected with a hint to convert).
- Length: 5–30 seconds of clean speech per clip is the recommended range; clips that are too short are refused outright.
- Multiple clips are fine: they are concatenated with 0.3 s of silence between segments, capped at 30 s total.
- Every clip needs its transcript — reference audio and its text are used as a pair, and an accurate transcript directly improves cloning quality.
5. Binding voices to airlines
The Broadcast page is a binding table of airline × language × gender → voice, with airlines keyed by ICAO code (ANA / CCA / CES…). Pick the airline, language and gender, then click "Add"; the same page supports delete, copy and audition.
- Language "Auto" is that airline's fallback voice — used whenever the requested language has no dedicated binding.
- Bindings are strictly per airline: a language airline A never bound will not borrow airline B's voice. If not even a fallback exists, the main app quietly falls back to standard TTS.
- The first time a language has no voice at all, the server bootstraps a default voice for that language automatically, so it can speak out of the box.
- Finished voices can be exported as a .cln clone package (reference audio plus airline bindings included) — import it on another PC or share it; duplicates are skipped on import.
6. Connecting the main app
Back in iAnnouncer Pro, open SETTINGS → Broadcast, switch the broadcast TTS engine to Advanced TTS, enter the server machine's IP and port 17150, and click Test — a passing test means the whole chain is up.
- If the test fails, open
http://<server-ip>:17150/v1/selftest?format=text in a browser on the main-app machine — it tells you whether the problem is the network or the service.
- Fallback: cabin announcements prefer the AI voice; if no matching voice exists or no result arrives within 30 seconds, playback falls back to standard TTS and your flight is never interrupted.
- Loading a SimBrief plan pre-generates every dynamic announcement for the flight, so in-flight playback is mostly cache hits with zero wait.
- GSX voices, RAAS voices and the First Officer voice do not use the AI server — they always run on the local engine.
Security note: the server performs no authentication — use it only on a trusted home LAN. For single-machine use, change the listen address from 0.0.0.0 to 127.0.0.1 under Settings → Advanced to keep it fully private.
7. FAQ
- One airline stays silent? Check the Broadcast page: is the requested language bound for that airline — and if not, does a "language = Auto" fallback row exist?
- "Reference audio too short"? Use a clip over 5 seconds, or provide several clips and let the server concatenate them.
- Slow downloads? The default mirror favours mainland-China networks; you can also interrupt and resume later without losing progress.
- Is cloning someone's voice legal? You are responsible for ensuring the reference audio is properly licensed; impersonation and any unlawful use are prohibited.
AI 音声サーバーガイド:ローカルモデル・ボイスクローン・航空会社バインド
AI 音声サーバー(本体では Advanced TTS。サブスクリプション機能)は独立したローカルプログラムです。AI 音声モデルを自分のマシンで動かし、任意の航空会社・任意の言語の機内アナウンスをリアルタイム合成し、5〜30 秒の参照音声からボイスクローンもできます。推論は完全ローカル。クラウド API は使わず、アナウンス文面が LAN の外に出ることはありません。
1. 仕組み
- Fish Audio S2 Pro 系モデルを純 C++ 推論エンジンで実行。モデルは単一ファイルの GGUF 形式で、Python 環境は不要です。
- 常駐 HTTP サービスとして動作(デフォルトポート
17150)し、本体が LAN 越しに音声を要求します。結果はキャッシュされ、同じアナウンスは一度しか合成しません。
- AI 推論は CPU / GPU を消費します。シミュレーターとリソースを取り合わないよう、LAN 内の別の空きマシンへの導入がおすすめです。同一マシンでも動きますが、合成時にカクつくことがあります。
- Windows 版と macOS 版があり、UI は日本語・中文・English 対応。1 台につき 1 インスタンスのみで、ウィンドウを閉じるとトレイに常駐します。
2. モデルのダウンロード
初回起動後、「サービス」ページのワンクリックダウンロードで推奨モデル(q6_k、4.53 GB)を導入できます。自分で選ぶ場合は「モデル」ページで VRAM に合わせて:
| 量子化 | サイズ | 目安 |
| q2_k | 2.58 GB | 最小。品質は明確に低下、非常用 |
| q3_k | 3.03 GB | 低 VRAM のつなぎ |
| q4_k_m | 3.57 GB | VRAM 3–4 GB または CPU のみの第一候補 |
| q5_k_m | 4.03 GB | VRAM 4–6 GB |
| q6_k(推奨) | 4.53 GB | VRAM 6–8 GB |
| q8_0 | 5.63 GB | VRAM 8 GB 以上 |
| f16 | 9.91 GB | VRAM 10 GB 以上、最高品質 |
- トークナイザーは自動で一緒にダウンロード。ミラーはデフォルトで
hf-mirror.com、公式 huggingface.co にも切り替え可能。
- レジューム対応:途中で中断してもファイルは models フォルダーに残り、次回続きから再開します。
- 完了後、「使用モデル」で選択して「適用してエンジンを再起動」。
3. 計算バックエンドの選択
「設定」ページでバックエンドを選びます:自動 / CPU / CUDA / Vulkan。
- NVIDIA GPU は CUDA。横のボタンで CUDA エンジンをダウンロードします。
- AMD GPU・内蔵グラフィックスは Vulkan。インストーラーに同梱済みで追加ダウンロード不要。
- 複数 GPU がある場合は「GPU」で使用する 1 枚を指定。VRAM が足りないときは一部処理を自動的に CPU へ退避します(速度は落ちますが動作は継続)。
4. ボイスクローン
「音色」ページで「音声からクローン」をクリックし、好みの声を読み込ませます:
- 形式:WAV / MP3 / Ogg Vorbis(.ogg 内の Opus は検出され、変換を促されます)。
- 長さ:1 クリップにつき5〜30 秒のクリーンな人声を推奨。短すぎるとエラーになります。
- 複数クリップ可:各クリップの間に 0.3 秒の無音を挟んで連結され、合計 30 秒で打ち切られます。
- 各クリップに必ず書き起こしテキストを添付——参照音声とテキストはペアで使われ、正確なほどクローン品質が上がります。
5. 音色を航空会社にバインド
「ブロードキャスト」ページは航空会社 × 言語 × 性別 → 音色のバインド表で、航空会社は ICAO 3 レターコード(ANA / CCA / CES…)で指定します。航空会社・言語・性別を選んで「追加」。削除・コピー・試聴も同じページでできます。
- 言語「自動」=その航空会社のフォールバック音色。個別バインドのない言語はこの行が使われます。
- バインドは航空会社ごとに厳密に分離:A 社で未設定の言語が B 社の音色を借りることはありません。フォールバックすらない場合、本体は通常 TTS に切り替えます。
- ある言語に音色がひとつもない初回は、サーバーがその言語のデフォルト音色を自動生成してバインドします(導入直後から発声可能)。
- 作った音色は .cln クローンパッケージとしてエクスポート可能(参照音声と航空会社バインドを含む)。別 PC への移行や共有はインポートするだけ。重複は自動でスキップされます。
6. 本体との接続
iAnnouncer Pro の SETTINGS → Broadcast で TTS エンジンを Advanced TTS に切り替え、サーバー機の IP とポート 17150 を入力して Test。テストが通れば全経路開通です。
- つながらない場合は、本体側のマシンのブラウザで
http://サーバーIP:17150/v1/selftest?format=text を開いてセルフテスト。ネットワークの問題かサービス未起動かを切り分けられます。
- フォールバック:機内アナウンスは AI 音声を優先し、対応音色がない・30 秒以内に結果が来ない場合は通常 TTS に自動で切り替わります。フライトは中断されません。
- SimBrief プランの読み込み時に、そのフライトの動的アナウンスを全件先行合成(プリジェネレート)。飛行中はほぼキャッシュヒットで待ちゼロです。
- GSX 音声・RAAS 音声・副操縦士ボイスは AI サーバーを使わず、常にローカルエンジンで動きます。
セキュリティ:サーバーは認証を行いません。信頼できる家庭内 LAN でのみ使用してください。同一マシンのみで使う場合は「設定 → 詳細設定」で待ち受けアドレスを 0.0.0.0 から 127.0.0.1 に変更すると完全に非公開にできます。
7. よくある質問
- 特定の航空会社だけ無音?「ブロードキャスト」ページで、その航空会社に要求言語のバインドがあるか、なければ「言語=自動」のフォールバック行があるかを確認。
- 「参照音声が短すぎる」エラー?5 秒以上のクリップを使うか、複数クリップを渡して連結させてください。
- ダウンロードが遅い?ミラーの切り替えを試すか、中断して後日レジュームできます(進捗は失われません)。
- 他人の声のクローンは合法?参照音声の権利確保は利用者の責任です。なりすましや違法用途は禁止されています。