<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Diarization</title><link>https://www.communeify.com/tw/tag/diarization/</link><description>Communeify - Your Community Platform</description><generator>Hugo</generator><atom:link href="https://www.communeify.com/tw/tag/diarization/" rel="self" type="application/rss+xml"/><item><title>Nemotron 3 Diarization：支援最多 8 位說話者的開放權重模型</title><link>https://www.communeify.com/tw/blog/nemotron-3-diarization/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/nemotron-3-diarization/</guid><pubDate>Fri, 25 Sep 2026 17:30:00 +0800</pubDate><description>Nemotron 3 Diarization：支援最多 8 位說話者的開放權重模型 語音轉文字（ASR）可以把錄音變成文字，但多人會議還有另一個問題：每一句話是誰說的？Speaker diarization 會將音訊切成不同時間區段，並為每個區段標記匿名的說話者，例如 speaker_0、speaker_1。這些時間軸再與 ASR 的逐字時間戳結合，才能產生帶有說話者標籤的逐字稿。
NVIDIA 的 Nemotron 3 Diarization 就是用來處理這項工作的開放權重模型。它支援離線與串流推論，最多處理 8 位說話者，也能表示重疊語音。模型只會輸出匿名頻道與時間資訊，不會判斷 speaker_0 實際是哪一個人。
模型輸入與輸出 模型接受 16 kHz、單聲道的 .wav、.flac、.opus 或 .mp3 音訊。輸出可以是每個時間框的說話者活動機率，也可以後處理成開始時間、結束時間與說話者標籤。
它最多提供 8 個說話者頻道，頻道順序依照說話者首次出現的時間排列。這個設計讓串流處理時可以沿用前面區塊的頻道順序，但它仍不是身分辨識系統；若需要對應到真實姓名，還要由應用程式結合會議名單、使用者資料或其他驗證方式處理。
如何處理串流音訊 Nemotron 3 Diarization 採用 31 層 Transformer 編碼器，搭配 RoPE 位置編碼。輸入的 Mel 頻譜以 10 ms 為步長，再透過特徵堆疊形成 80 ms 的編碼器幀率，最後由 Conv1D 層將預測結果轉回 10 ms 的輸出解析度。模型大小約為 99.2M 參數。
在串流模式中，模型使用 Arrival-Order Speaker Cache（AOSC）保存較早出現的說話者資訊，並以 FIFO queue 提供近期音訊上下文。兩者分工不同：前者協助跨區塊維持說話者順序，後者提供目前區塊附近的聲音資訊。這有助於降低串流過程中的頻道切換，但實際效果仍會受到噪音、混響與錄音環境影響。
延遲設定 官方提供同一個 checkpoint 的多組推論設定。輸入緩衝延遲的計算方式是：
(CHUNK_LEN + RIGHT_CONTEXT) × 80 ms 模式輸入緩衝延遲FIFO區塊長度右側上下文 離線風格30.4 秒4034040低延遲1.04 秒26494極低延遲0.64 秒26462超低延遲0.32 秒26431 這裡的延遲只代表模型開始推論前需要累積的音訊，不包含模型運算、網路傳輸、ASR 或應用程式處理時間。模型技術上可以使用更短的輸入緩衝，但官方建議的最低設定是 0.32 秒；選擇設定時仍需要在自己的資料上測試準確率與端到端延遲。</description></item></channel></rss>