Horus Cyber Nano 1.0 的「Nano」指的是相對小的資安專用模型,不是低到可以忽略硬體需求的桌面小模型。它有 16B 總參數、文字與視覺輸入,主要要處理的是授權範圍內的安全分析工作。
它不是一般聊天模型換一個名字
Horus Cyber Nano 1.0 由 TokenAI 研發(由 Assem Sabry 創立),定位為 TokenAI 首款採用混合專家架構(Mixture of Experts, MoE)的原生多模態資安推理模型,發表於 2026 年 9 月。其目標應用場景聚焦於四大防禦性技術工作流:安全程式碼審查(Secure Code Review)、紅隊任務推理(Red Team Task Reasoning)、終端機與工具工作流(Terminal and Tool Workflows)以及資安視覺理解(Cybersecurity Vision Understanding)。
模型的輸入支援文字、圖片與影片,輸出則為文字分析結果。這樣的定位很重要:資安工作不只是一段程式碼找漏洞,還可能需要同時看錯誤訊息、網路拓撲、螢幕截圖、錄製的操作過程,以及一串工具執行結果。多模態輸入可以縮短「先把畫面描述成文字,再交給模型」的中間步驟,但它仍然不能替代實際掃描器、沙箱或人工確認。
16B 總參數與 MoE 架構技術規格
Horus Cyber Nano 1.0 採用原生多模態視覺語言架構搭配因果語言解碼器,整體層數與 MoE 結構設計如下:
- 語言解碼器層數與維度:採用 27 層 Transformer,隱藏維度為 2048,配置 16 個 Attention Heads、16 個 KV Heads,激活函數為 SiLU,RoPE Theta 為 800,000。
- MoE 專家配置:每一層均為 MoE 層,包含 64 個 Routed Experts 與 2 個 Shared Experts。每個 Token 運算時會選擇 6 個 Routed Experts 參與計算。這代表 16B 總容量與單次推理的活躍計算量(Active Parameters)是兩件事,不能只看「16B」估算顯存或運算速度。
- 視覺編碼器規格:包含 27 層 Vision Encoder、隱藏維度 1152、16 個 Vision Attention Heads、Patch Size 為 14。每張圖片最高支援約 320 萬像素(3.2M pixels)總解析度,並支援影片輸入。
高解析度圖片與影片會增加上下文與記憶體負擔,實際部署時應依工作流進行切片,而不是把整段長影片一次塞進模型。
官方基準測試結果與相關模型對比
根據 TokenAI 官方公布的基準測試,Horus Cyber Nano 1.0 在通用推理、代碼、終端工具及多模態任務上的表現,與其他主流模型(包括通用大模型與專用模型)的對比如下:
1. 通用與代碼推理基準
- MMLU:得分 82.0%(對比 OpenAI o1 為 91.8%、GPT-4.5 90.8%、GPT-4.1 90.2%、Grok-2 87.5%、DeepSeek V3.2 Thinking 85.0%)。
- GPQA Diamond:得分 45.2%(對比 Mistral 3.1 24B 45.96%、GPT-4.1 66.3%、gpt-oss-120b 67.1%、DeepSeek-V3.2 82.4%)。
- Terminal-Bench 2.0:得分 46.2%(對比 GPT-5.5 82.7%、GPT-5.4 75.1%、Gemini 3.1 Pro Thinking 68.5%、GPT-5.2 Thinking 62.2%、Claude Sonnet 4.6 59.1%)。
- AIME 2025:得分 76.4%(對比 GPT-5.2 Thinking 100%、Claude Sonnet 4.6 95.6%、GPT-5 94.6%、Gemini 3 Flash 95.2%、DeepSeek-R1-0528 87.5%)。
- SWE-Bench Verified:得分 61.7%(對比 Gemini 3.1 Pro Thinking 80.6%、GPT-5.2 Thinking 80.0%、Claude Sonnet 4.6 79.6%、GPT-5 74.9%、Claude Opus 4 72.5%)。
2. 多模態視覺基準
在多模態測試中,Horus Cyber Nano 1.0 展現出優於部分大型開源與商業模型的視覺推理能力:
- MATH-Vision:56.9%(超越 GPT-4o 的 30.4%、Qwen2.5-VL-72B 的 38.1%、Qwen2.5-VL-32B 的 38.4% 與 Gemma 3 27B 的 35.4%)。
- MathVista MINI:80.1%(超越 GPT-4o 的 63.8%、Qwen2.5-VL-72B 的 74.8% 與 Gemma 3 27B 的 59.8%)。
- MMBench-EN-v1.1:84.4%(對比 GPT-4o 為 83.1%、Qwen2.5-VL-72B 為 88.3%)。
- MMStar:70.4%(超越 GPT-4o 的 64.7% 與 Qwen2.5-VL-32B 的 69.5%)。
- VideoMMMU:65.2%(超越 GPT-4o 的 61.2% 與 Qwen2.5-VL-72B 的 60.2%)。
這些官方數據呈現了團隊對模型的訓練方向(著重終端工具、代碼與視覺理解)。但測試 Prompt、取樣設定與工具 scaffolding 皆會影響結果,評估時仍需獨立驗證,切勿直接讓模型自動執行高風險指令。
部署路徑與硬體需求
模型權重發布於 Hugging Face 的 Horus Cyber Nano 1.0 頁面,完整規格說明見 TokenAI 官方模型頁。模型支援透過 transformers(需設定 trust_remote_code=True)、vLLM、SGLang、NeuralNode(import neuralnode as nn)、Ollama、LM Studio、Unsloth、Docker Model Runner(docker model run hf.co/tokenaii/Horus-Cyber-Nano-1.0)及微軟 Foundry 部署。
對於地端硬體部署,官方提供了多種量化格式(GGUF 儲存庫:tokenaii/Horus-Cyber-Nano-1.0-GGUF)與預估記憶體(RAM + VRAM)需求:
| 量化版本 | 檔案大小 | 預估記憶體需求 (RAM + VRAM) | 推薦用途 |
|---|---|---|---|
| F16 | 31.93 GB | ~59.71 GiB | 全精度地端推理 |
| Q8_0 | 16.97 GB | ~32.18 GiB | 近乎無損品質推論 |
| Q6_K | 14.28 GB | ~27.24 GiB | 高品質量化推理 |
| Q5_K_M | 12.04 GB | ~23.11 GiB | 品質與記憶體平衡 |
| Q4_K_M | 10.54 GB | ~20.84 GiB | 低記憶體地端推理 |
建議的第一個測試不是「讓它幫我攻擊一台主機」,而是使用沒有敏感資料的安全程式碼與測試圖片,要求它:
- 先列出觀察到的證據,再提出風險判斷。
- 把確定、推測和需要工具驗證的部分分開。
- 提供修補建議,但不自動執行修改或網路操作。
這樣可以先檢查模型的分析品質和幻覺率,也能讓它在實際工具鏈中扮演「解讀結果」而不是不受控的執行者。
適合的場景與不能忽略的邊界
如果你的團隊需要把程式碼、截圖和工具輸出交給同一個模型分析,Horus 的多模態資安定位有一定吸引力。它也適合用來製作安全事件摘要、協助撰寫修補建議、整理測試證據,或在內部靶場中協助初步判讀。
但資安模型的錯誤成本比一般問答高。它可能漏掉真正的漏洞,也可能把正常行為判成攻擊;如果接上終端機或網路工具,還會多出權限提升、資料外洩和提示注入的風險。官方頁面標示模型採用 TokenAI Custom License,採用前應閱讀授權條款,並確認是否符合你的商用與部署方式。
Horus Cyber Nano 1.0 值得購註的地方,是它把資安推理和視覺、影片輸入放在同一個模型裡;真正能否取代現有工具,仍要用自己的程式庫、事件資料和權限模型做驗證。
一個安全的試用順序
如果要在內部靶場試用,可以採用由低到高的權限順序:先做離線程式碼審查,再加入沒有機密資料的截圖,接著讓模型讀取已完成的掃描報告,最後才考慮讓它產生工具命令。每一階段都保留人工確認,不要因為模型能理解終端機輸出,就直接授予寫入檔案或連線外部主機的權限。
圖片與影片也要注意提示注入。畫面中的文字可能包含「忽略前面規則」之類的內容,模型應該把它當作待分析資料,而不是新的系統指令。部署層可以把使用者提示、附件內容和工具回傳值分開標記,並在工具層設定允許的命令白名單。這樣即使模型判斷錯誤,影響範圍也會被限制在測試環境內。
最後,評估模型時要記錄 false positive 和 false negative,而不只是收集它成功找出的案例。資安分析真正有價值的指標,通常包括漏報率、證據引用是否正確、修補建議是否可執行,以及模型是否會在證據不足時明確說不知道。
可以用這樣的測試提示建立基準:要求模型只根據附上的程式碼指出風險,對每個判斷標出檔名、行號和觸發條件;如果需要執行測試,必須先列出命令和預期觀察結果,不得假裝已經執行。這會比單純問「這段程式安全嗎」更容易比較不同版本模型,也更接近實際 code review 工作。
對影片理解則應注意時間範圍。模型說「畫面中出現了某個操作」時,最好要求它附上大約的時間點和可見證據;若影片解析度不足或片段沒有提供關鍵畫面,它應該明確回答無法判斷。這種證據格式能減少安全團隊把一段流暢的描述誤當成已驗證的事件記錄。

