
AuK:用編輯文字的方式處理音訊
想像一下,如果修改錄音檔能像改 Word 文件一樣簡單——調整語調、替換字詞、甚至改變說話者的情緒與聲線。過去,這些操作往往需要昂貴的器材與複雜的音效軟體。由上海交通大學、騰訊混元(Tencent Hunyuan)與上海創智學院聯合推出的開源基礎模型 AuK,成功將這些繁瑣的音訊處理流程轉化為直觀的自然語言互動。
AuK 的運作邏輯非常明確:將語音生成與多維度的音訊編輯技術統一在同一個框架中,讓使用者能直接透過文字指令與參考音訊,精確控制音訊的每一個細節。
AuK 的核心技術與架構設計
AuK 是一個擁有 15 億參數(1.5B) 的多模態語音基礎模型。為了涵蓋多樣化的語音任務,開發團隊構建了約 30.3 億條指令-音訊實例(Instruction-Audio Instances),以及高達 195 萬小時 的有效監督數據進行訓練。
在系統架構上,AuK 融合了三大核心模組:
- 多模態大語言模型(Multimodal LLM): 負責理解使用者的自然語言指令與語意條件。
- 50 Hz 音訊 VAE: 聯合語音、通用音訊與音樂進行訓練,提供高品質的聲學表徵(Acoustic Latents)。
- 混合整流流(Rectified-Flow)Transformer: 結合雙流 MMDiT 區塊與單流 DiT 區塊,完成高保真的音訊擴散生成與編輯。
模型訓練經歷了「生成暖身」與「生成-編輯聯合預訓練」,並在 Post-training 階段引入人類反饋偏好最佳化與強化學習,大幅減少幻覺並強化複雜編輯邏輯。
五大核心音訊任務
AuK 完整涵蓋了五大音訊處理任務家族:
- 語音生成(Speech Generation): 包含 Instruct TTS(指令控音)與 Zero-Shot TTS(零樣本語音克隆)。
- 內容編輯(Content Editing): 精準進行語音字詞的插入(Add)、刪除(Delete)與替換(Replace),甚至支援演唱歌詞(Vocal Edit)的修改。
- 增強與分離(Enhancement and Separation): 提供降噪、超高解析度畫質修復(Super-resolution)、人聲與伴奏分離(Extract Vocals),以及多說話者分離(Separate Speech)。
- 副語言編輯(Paralinguistic Editing): 調整情緒(Emotion)、音色(Timbre)、移除/添加非語言事件(如呼吸聲、笑聲、咳嗽、嘆氣)、切換低語風格(Whisper)與方言去口音化(Deaccent)。
- 聲學編輯(Acoustic Editing): 支援音速(Speed,0.5x–2.0x)、音量能量(Energy,-15dB–+15dB)與音高(Pitch,-3–+3 半音)的連續滑動調節。
常見問答
- Q: AuK 能分離多人音訊嗎? 可以。它具備強大的說話者分離功能,能依據說話者的發言內容或說話順序進行隔離拆分(如「僅保留說出『警隊規矩』的說話者」),非常適合應用於會議錄音整理與多軌剪輯。
- Q: 修改字詞會破壞背景與語音連貫性嗎? 不會。AuK 在訓練時考量了聲學背景與韻律的連貫性。在插入或替換字詞時,模型能在保留原始錄音音色、背景噪音與整體韻律的前提下完成無縫補錄。
- Q: 處理速度如何?有輕量化版本嗎? 為了大幅降低推論延遲,開發團隊推出了蒸餾版本 AuK-Flash。透過軌跡級一致性初始化與任務路由解耦 DMD(Decoupled DMD)蒸餾技術,AuK-Flash 僅需 4 步推論且無需 CFG,在同等條件下達到近乎教師模型的音質,且推論速度提高了 4.5 倍。
語音生成應用:Instruct 與 Zero-Shot
AuK 的語音生成能力分為兩種模式:
- Instruct TTS: 允許使用者純粹透過自由文字敘述來定義聲音。例如要求模型以「一位雄才大略、略顯沙啞卻極有穿透力的中年男聲」或「沙啞、干澀並傾訴三十年恨意的中年女性」口吻進行語音合成。
- Zero-Shot TTS: 用於零樣本聲音克隆,只需提供短短數秒的參考音訊,模型即可精準捕捉該說話者的聲音特徵並生成新文本。
像修改文件一樣編輯音訊
對於 Podcast、影音創作者與音樂製作人而言,內容編輯(Content Editing)功能極具實用價值。當錄音內容有錯別字或需要修改台詞時,無須召回配音員重新錄製,只需輸入指令(如「在『不得相見』後加入『在下輾轉反側,夢寐以求』」),AuK 便能精準在指定時間軸插入新語音,並完美銜接前後的聲音氣場。
此外,在音訊增強方面,模型能將人聲從背景伴奏或環境雜訊中完美提取出來,並進行頻寬擴展(Super-resolution),使普通手機錄音快速提升至錄音室等級。
調整副語言與聲學細節
語音的感染力往往來自於「怎麼說」而非「說什麼」。AuK 的副語言編輯(Paralinguistic Editing)功能允許使用者在不更改語意文字的前提下:
- 情緒切換: 滑動切換喜悅、悲傷、憤怒、恐懼或中立語氣。
- 音色轉換: 保持文本內容,將聲音替換為新聞播報員或特定腔調(如英式口音)。
- 非語言事件控制: 在語句中間精準插入或移除喘息、笑聲、咳嗽或嘆氣聲。
若想親自試聽音訊範例,可前往 AuK 官方網站 體驗線上 Demo。
總結
AuK 將複雜的語音擴散演算法轉化為直觀的語言指令,徹底降低了專業音訊處理與後期製作的門檻。這款開放原始碼與模型權重的 1.5B 基礎模型,讓創作者能將更多精力放在內容表達與藝術創作上,大幅提升了音訊工作流的效率。

