TOOL FIELD NOTE

讓 ESP32-S3 開口說話:Lokutor 推出 4.9MB 邊緣串流語音模型 Ito

Lokutor 針對 ESP32-S3 微控制器推出串流語音合成模型 Ito,以約 440 萬參數與 4.9MB 的 int8 模型規格,嘗試在不依賴雲端連線的低成本晶片上輸出 24kHz 語音。本文整理 Ito 的架構設計、QEMU 模擬測試現況,以及 GPLv3 程式碼與非商業授權權重的具體差異。 在邊緣硬體上運行神經網路語音合成,受限於晶片記憶體與運算效能,多數應用仍依賴雲端 API。Lokutor 團隊近期釋出名為 Ito 的文字轉語音專案,嘗試將串流語音模型塞入售價約五美元的 ESP32-S3 微控制器。 …

PUBLISHED 2026.10.05
READING TIME 1 MIN
UPDATED 2026.10.05
01

COMMUNEIFY
INSIGHTS

把複雜的技術趨勢,整理成值得慢慢讀完的深度內容。

Lokutor 針對 ESP32-S3 微控制器推出串流語音合成模型 Ito,以約 440 萬參數與 4.9MB 的 int8 模型規格,嘗試在不依賴雲端連線的低成本晶片上輸出 24kHz 語音。本文整理 Ito 的架構設計、QEMU 模擬測試現況,以及 GPLv3 程式碼與非商業授權權重的具體差異。

在邊緣硬體上運行神經網路語音合成,受限於晶片記憶體與運算效能,多數應用仍依賴雲端 API。Lokutor 團隊近期釋出名為 Ito 的文字轉語音專案,嘗試將串流語音模型塞入售價約五美元的 ESP32-S3 微控制器。這項專案引起了嵌入式開發者與自造者社群的關注,但其運作細節、測試進度與授權限制,仍有幾項關鍵條件需要仔細檢視。

專為微控制器打造的輕量串流架構

模型規格與音訊配置

根據專案釋出的資料,Ito 包含約 440 萬個參數,在經過 int8 量化處理後,單一聲音的模型大小約為 4.89MB 至 4.9MB。模型目前提供兩組英文語音(一男一女),支援 24kHz 音訊輸出。訓練流程參考 StyleTTS 2 架構,並以 LibriTTS-R 資料集中的 4970 號女性講者與 5105 號男性講者為條件進行調整。

對於有興趣評估聲音質感的開發者,可以前往 Ito 線上展示頁面 試聽目前的合成成果。

鎖定無 NPU 的運算環境

ESP32-S3 晶片搭載 240MHz 的雙核心 CPU,並未內建專門處理神經網路的 NPU 硬體單元。在這樣的運算限制下,多數文字轉語音模型難以維持流暢播放。Ito 透過模型剪裁與量化壓縮,讓模型體積縮小至 5MB 以下,使其有機會放入具備 PSRAM 的 ESP32-S3 開發板中執行。

模擬環境驗證與實體硬體測試現況

以 QEMU 模擬器完成運算比對

Lokutor 團隊在技術說明中表明,目前公布的效能數據主要來自 Espressif 官方的 QEMU 模擬器。模擬測試確認了模型推論過程能與主機端運算達到完全一致的位元精度(bit-exact)。

關於首個音訊區塊約 25 毫秒的產出延遲,以及相關的即時推論速度指標,目前均屬於依據運算指令次數推估的理論數值,尚未在實體矽晶片上取得實際運作數據。

文字轉音素的前處理依賴

現階段 Ito 的運作流程並未完全獨立於單一微控制器上。文字轉音素(text-to-phoneme)的語言前處理步驟,目前依然依賴主機端程式運行,晶片端主要負責將音素特徵轉換為音訊波形。

團隊已表示後續將針對實體硬體板卡進行實際測試,並補齊晶片端的量測數據與後續工具鏈。

開源程式碼與受限權重的雙軌授權

GPLv3 授權的推論引擎與韌體

在軟體實作層面,Ito 的推論引擎、韌體程式碼與配套 Python 工具已公開於 GitHub 專案儲存庫。這部分程式碼採用 GPLv3 條款釋出,允許開發者查閱程式碼、修改架構與進行衍生開發。

附帶商業限制的 CC BY-NC-SA 4.0 模型權重

與完全開放的程式碼不同,存放在 Hugging Face 模型庫 上的模型權重採用門控下載機制。使用者必須同意授權條款後方可取得檔案。

這批權重採用 CC BY-NC-SA 4.0 授權,並額外附加 Lokutor 的使用條款。這意味著:

  • 權重僅供業餘愛好、學術研究、教育或個人非商業用途。
  • 未取得 Lokutor 書面許可前,不得將權重、衍生權重或產生的音訊用於商業產品與收費服務。
  • 明確禁止將 Ito 產生的語音資料用於訓練其他商業語音合成模型。

Lokutor 說明,採取此授權規範是為了保護團隊技術不被大型企業無償轉作商用。針對個人自造者、小型新創團隊與教育機構,官方提供書面聯絡窗口,評估發放免授權費的合作許可。

微控制器語音合成的定位差異

在邊緣語音領域,Ito 並非第一個嘗試在微控制器上運行的模型,例如過去已有 sanoTTS 等專案探索極小體積的發聲方案。

Ito 的定位更偏向在五美元等級晶片的有限預算內,提供接近自然口語的語音合成品質。對於想為智慧裝置或離線互動裝置加入語音回饋的開發者來說,這項專案提供了介於傳統機械語音晶片與昂貴邊緣運算板之間的另一種選擇。

常見問題

Ito 能夠完全離線在 ESP32-S3 開發板上獨立發聲嗎?

目前尚未完全達成。雖然推論模型已透過 QEMU 模擬驗證,但文字轉音素的預處理仍需在主機端完成,實體開發板的即時推論效能也仍在測試階段。

開發者可以自由下載模型權重並放入商業硬體販售嗎?

不行。模型權重採用 CC BY-NC-SA 4.0 加上專屬條款,任何商業銷售或付費服務都必須取得 Lokutor 的正式書面授權。

為什麼官方宣稱程式碼開源,權重卻有非商業限制?

專案採用了雙軌授權模式。GPLv3 確保了推論架構與演算法程式碼的透明度,而對權重施加非商業限制則是為了防止商業公司直接取用模型進行商業競爭。

結語

Ito 驗證了將串流神經網路語音模型壓縮至 5MB 以內的工程可行性。雖然目前仍依賴主機端完成文字轉音素,且實體硬體的實際功耗與延遲數據尚待公布,但其架構設計已為低成本微控制器的語音應用提供了具體的參考範例。

分享至:
Featured Partners

© 2026 Communeify. All rights reserved.