<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Open-Source</title><link>https://www.communeify.com/tw/tag/open-source/</link><description>Communeify - Your Community Platform</description><generator>Hugo</generator><atom:link href="https://www.communeify.com/tw/tag/open-source/" rel="self" type="application/rss+xml"/><item><title>GLM-5.3-Flash：320B 總參數、18B 活躍的原生多模態開放模型</title><link>https://www.communeify.com/tw/blog/glm-5-3-flash-open-weight-multimodal/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/glm-5-3-flash-open-weight-multimodal/</guid><pubDate>Fri, 25 Sep 2026 08:25:00 +0800</pubDate><description> GLM-5.3-Flash 的核心突破在於，透過混合注意力機制與稀疏 MoE 架構，在維持極高推理效率與低算力成本的同時，實現了強大的原生多模態與長上下文能力。
模型架構與設計特點 GLM-5.3-Flash 是 zai-org（Z.ai）推出的 GLM-5 系列首款原生多模態模型（Natively Multimodal Model）。其模型規模與運算架構設計如下：
參數規模：模型擁有 320B（3,200 億）總參數，前向傳播時僅激活 18B（180 億）活躍參數，採用稀疏混合專家（Sparse MoE）機制，大幅降低單次 Token 的算力開銷。 混合注意力機制（Hybrid Sparse and Linear Attention）：首度導入線性注意力（Linear Attention）與稀疏注意力（Sparse Attention）相結合的架構，前者負責區域狀態建模，後者透過輕量化索引器進行全域檢索，並搭配 IndexPool 技術壓縮向量，有效降低長上下文下的注意力計算量與 KV Cache 記憶體佔用。 超連接與預訓練：採用流形約束超連接（Manifold-Constrained Hyper-Connections, mHC）以提升模型擴展效率，並基於 30T 多模態語料進行預訓練。 輸入模態與語言：原生支援文字與圖片（Text &amp;amp;amp; Image）輸入，語言覆蓋中文（Chinese）與英文（English）。 長上下文規格：支援最高 1,000,000 tokens（1M context） 的上下文處理。 需要注意的是，18B 活躍參數（Active Parameters）僅代表單次運算時的 FLOPs 負擔，並不等於部署時所需的記憶體。在實際硬體部署時，320B 的完整權重、KV Cache 以及執行框架仍需準備充足的系統記憶體與顯存空間。
官方支援框架與推理參數設置 根據官方模型卡資料，GLM-5.3-Flash 已獲得多個 mainstream 推理框架支援，開發者可參考本機服務說明進行部署測試：
支援框架：包含 SGLang、vLLM、TokenSpeed、Transformers、KTransformers 與 Unsloth。 思考預算控制 (reasoning_effort)：模型支援透過 reasoning_effort 參數控制思考深度，可填入 low、high 或 max（未傳送時預設為 max）。若需複現官方基準測試或 Leaderboard 數據，建議維持預設的 max。 對話範本設定 (clear_thinking)：在模型的 Chat Template 中，clear_thinking 預設為 false；若應用於互動對話情境，建議顯式傳遞 clear_thinking=true。 評測實務與多模態安全邊界 官方公布的 Benchmark 數據呈現了模型在特定測試集上的基準表現，但在實際業務落地上，建議團隊仍需以自身的真實工作流進行驗證，重點測試：</description></item><item><title>Sopro V2：120M 也能做到串流與零樣本聲音複製的開源 TTS</title><link>https://www.communeify.com/tw/blog/sopro-v2-120m-voice-cloning-tts/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/sopro-v2-120m-voice-cloning-tts/</guid><pubDate>Fri, 25 Sep 2026 08:20:00 +0800</pubDate><description> 在輕量級語音合成領域，兼顧低延遲、極小模型體積與高品質聲音複製一直是個巨大挑戰。Sopro V2 Turbo 證明了僅靠 120M 參數，也能在地端 CPU 上實現高可讀性與流暢串流。
什麼是 Sopro V2 Turbo？模型規模與語言支援 Sopro V2 是由 Samuel Vitorino 與 Halo Research 開發的輕量化開源語音合成模型家族。其公開釋出的旗艦輕量模型 sopro-v2-turbo 具備以下核心特性：
模型規模：僅 120M 參數（1.2 億參數），由 0.5B 教師模型經過 DPO（直接偏好優化）與 Self-Distillation 自蒸餾，並結合 2-step Reflow 技術進行 16 倍加速優化。 授權條款：採用 Apache-2.0 自由開源授權。 多語言支援：原生支援 英語（English）、歐洲葡萄牙語（European Portuguese）、法語（French）與德語（German） 共 4 種語言。特別是它是少數原生針對歐洲葡萄牙語（而非巴西葡萄牙語）進行深度調校與對齊的開源語音模型。 零樣本聲音複製（Zero-Shot Voice Cloning）：僅需 5 至 20 秒的參考音訊，且無需提供參考音訊的文字逐字稿（ASR-free prompt），即可捕捉目標聲音的音色、麥克風環境與說話風格。 速度與本機 CPU / 裝置端適用性 Sopro V2 Turbo 的設計初衷在於讓任何人都能在地端設備上順暢執行語音生成，擺脫對雲端 API 的依賴與高昂延遲。
推論效能數據（RTF 與首音延遲） 在官方特定測試環境下，推論表現如下：
Apple M3 CPU (MacBook 筆電)： 非串流模式（Offline）：實時率（RTF）為 0.24（生成速度約為即時播放的 4.1 倍）。 串流模式（Streaming）：RTF 為 0.21，首音時間（Time-to-first-audio, TTFA）僅約 300 毫秒。 NVIDIA H100 GPU： 非串流 RTF 為 0.07，串流模式首音時間約 200 毫秒。 本機與瀏覽器端部署 由於參數規模僅 120M，Sopro V2 Turbo 適合直接於筆電或邊緣設備的 CPU 上運行。此外，官方亦提供了基於 ONNX Runtime（WebGPU / WASM）的純瀏覽器前端實現，使用者無需設定後端伺服器，即可在網頁端直接進行地端語音推理。</description></item><item><title>Horus Cyber Nano 1.0：面向資安分析的 16B 多模態 MoE 模型</title><link>https://www.communeify.com/tw/blog/horus-cyber-nano-1-0-multimodal-security-model/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/horus-cyber-nano-1-0-multimodal-security-model/</guid><pubDate>Fri, 25 Sep 2026 08:05:00 +0800</pubDate><description> Horus Cyber Nano 1.0 的「Nano」指的是相對小的資安專用模型，不是低到可以忽略硬體需求的桌面小模型。它有 16B 總參數、文字與視覺輸入，主要要處理的是授權範圍內的安全分析工作。
它不是一般聊天模型換一個名字 Horus Cyber Nano 1.0 由 TokenAI 研發（由 Assem Sabry 創立），定位為 TokenAI 首款採用混合專家架構（Mixture of Experts, MoE）的原生多模態資安推理模型，發表於 2026 年 9 月。其目標應用場景聚焦於四大防禦性技術工作流：安全程式碼審查（Secure Code Review）、紅隊任務推理（Red Team Task Reasoning）、終端機與工具工作流（Terminal and Tool Workflows）以及資安視覺理解（Cybersecurity Vision Understanding）。
模型的輸入支援文字、圖片與影片，輸出則為文字分析結果。這樣的定位很重要：資安工作不只是一段程式碼找漏洞，還可能需要同時看錯誤訊息、網路拓撲、螢幕截圖、錄製的操作過程，以及一串工具執行結果。多模態輸入可以縮短「先把畫面描述成文字，再交給模型」的中間步驟，但它仍然不能替代實際掃描器、沙箱或人工確認。
16B 總參數與 MoE 架構技術規格 Horus Cyber Nano 1.0 採用原生多模態視覺語言架構搭配因果語言解碼器，整體層數與 MoE 結構設計如下：
語言解碼器層數與維度：採用 27 層 Transformer，隱藏維度為 2048，配置 16 個 Attention Heads、16 個 KV Heads，激活函數為 SiLU，RoPE Theta 為 800,000。 MoE 專家配置：每一層均為 MoE 層，包含 64 個 Routed Experts 與 2 個 Shared Experts。每個 Token 運算時會選擇 6 個 Routed Experts 參與計算。這代表 16B 總容量與單次推理的活躍計算量（Active Parameters）是兩件事，不能只看「16B」估算顯存或運算速度。 視覺編碼器規格：包含 27 層 Vision Encoder、隱藏維度 1152、16 個 Vision Attention Heads、Patch Size 為 14。每張圖片最高支援約 320 萬像素（3.2M pixels）總解析度，並支援影片輸入。 高解析度圖片與影片會增加上下文與記憶體負擔，實際部署時應依工作流進行切片，而不是把整段長影片一次塞進模型。</description></item><item><title>TontaubeV1：把長篇語音生成搬回本機的 2.9B 開放權重 TTS 模型</title><link>https://www.communeify.com/tw/blog/tontaube-v1-open-tts-long-form-local-inference/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/tontaube-v1-open-tts-long-form-local-inference/</guid><pubDate>Fri, 25 Sep 2026 08:00:00 +0800</pubDate><description> 如果你想把一段文章直接念成十幾分鐘的旁白，TontaubeV1 的重點不是「聲音像不像真人」這一句宣傳，而是它試圖把長篇、串流與本機推理同時處理好。
先看結論：它解決的是長篇語音的工程問題 TontaubeV1 是 Tontaube AI（由 Fritz Cremer 與 Jonathan Cremer 開發）發布的 2.9B（約 28.7 億參數）開放權重文字轉語音模型，定位在富有表達力的長篇語音、低延遲回傳與本機部署。模型主要針對英語和德語進行調校，並支援西班牙語、法語、義大利語、荷蘭語與葡萄牙語等共 7 種語言，同時能使用 5 至 60 秒（上限約 1 分鐘）的參考音檔進行零樣本聲音複製（Zero-Shot Voice Cloning）。
這個定位和只產生一句廣告口號的 TTS 不太一樣。長篇內容會遇到更多實際問題：段落之間的語氣是否連得起來、生成時能不能一邊播放一邊繼續合成、文字很長時上下文會不會失控，以及一次處理多個請求時 GPU 是否浪費在等待上。TontaubeV1 的設計幾乎都圍繞這些問題展開。
在授權方面需特別注意：推理服務程式碼採用 Apache License 2.0 開源授權，但模型權重本身採用的是 Tontaube Community Model License 1.0，屬於允許研究與符合條件之商業用途的開放權重（Open-weight）授權，而非純粹的 OSI 開源授權。
架構重點：四個自回歸模型接力產生聲音 官方技術報告把 TontaubeV1 描述成由四個自回歸模型（CB0 至 CB3）組成的分層語音生成系統。它採用 DualCodec（12.5 Hz，總位元率約 625 bit/s）作為語音表徵，將語音拆解為 1 個語意碼本與 3 個聲學精鍊碼本：
CB0（語意與時長預測）：基於 Qwen3-1.7B 骨幹（約 18.3 億參數，28 個 Transformer 區塊），負責從文字生成語意音訊碼本並決定語音時長與韻律。 CB1（聲學精鍊一）：基於 Qwen3-0.6B 骨幹（約 4.49 億參數，16 個 Transformer 區塊），補上第一層聲學細節。 CB2（聲學精鍊二）：基於 Qwen3-0.6B 骨幹（約 3.27 億參數，8 個 Transformer 區塊），進一步擴充聲學殘差。 CB3（聲學精鍊三）：基於 Qwen3-0.6B 骨幹（約 2.69 億參數，4 個 Transformer 區塊），完成最後一層聲學修飾。 四個模型總計 56 個 Transformer 區塊、約 28.7 億參數。這種設計有兩個直接好處：</description></item></channel></rss>