地端 AI 實驗室

地端 AI 實驗室

By Mark KuTechnology
Download on the App Store

地端 AI 實驗室 episodes

  • 🧪 740M 的 embeddinggemma-2 吃下文字圖片影片音訊,手機也塞得下|地端 AI 實驗室
    開場白

    google/embeddinggemma-2 只有 740M,但官方 model card 寫的是它用同一組 768 維向量,同時扛文字、圖片、影片、音訊四種模態,context window 還拉到 8,192 token。這集也會聊到一個被下載 1.5 萬次、專門把 AI 腔文章改到像真人寫的 jialinyyzz/humanizer,以及一個把 27B 壓進單張 16GB 顯卡就能跑的量化實驗 OrcaSAQ-2-Cyber-27B。手機裝得下的向量搜尋引擎到底能拿來幹嘛,等一下告訴你。

    本期精選
    1. google/embeddinggemma-2:手機也裝得下的多模態向量引擎
    • 這是什麼: 這不是聊天模型,是一個 embedding 模型,任務是把文字、圖片、影片、音訊都投影到同一個向量空間裡方便做檢索。740M 參數,Apache-2.0 授權,非 gated,不用申請就能下載。
    • 能用在哪些場景:
      1. 工程師把公司內部文件、會議截圖、錄音檔丟進本機向量庫做私有知識庫問答:官方 model card 標示文字、影像、影片、音訊共用同一個 768 維向量空間,context 8,192 token,所以同一套索引就能跨模態檢索,資料不用離開自己的機器。
      2. 做離線行動 App 的語意搜尋:Google 開發者部落格標示量化後在 Pixel 11 Pro 只需約 191MB(純文字權重)到 567MB(完整多模態)的 active RAM,搜尋功能可以整個做在裝置上,不用打 API。
      3. 自架 vector DB 想省儲存的人:官方說明提到用 Matryoshka Representation Learning,可把輸出向量從 768 維動態截斷到 512、256、128 維,官方標示最多 6 倍儲存縮減,索引量大的話直接反映在硬碟與記憶體成本上。
      4. 跑得動嗎: 官方 model card 只寫「designed to run on consumer hardware such as mobile devices and laptops」,沒有直接給出 VRAM 數字;但精度上有明確要求:「Run inference in bfloat16 or float32. Do not use float16.」,理由是啟動值範圍超出 float16 動態範圍會產生 NaN 或劣化的向量。架構可模組化載入,270M(文字/程式碼)、440M(+視覺)、570M(+音訊)、740M(全多模態)四種組合都投影到同一向量空間。
      5. 本期聲量: HF 熱度 202(364 次下載、205 個讚)。
      6. 跟同類比: 跟自家前代 EmbeddingGemma 比,官方說法是 context window 拉大為 4 倍(8,192 token),並從純文字擴張到五種模態共用同一向量空間;官方 model card 列出的 MTEB 成績為多語平均 61.36、程式碼 NDCG@10 78.68、影像 64.64、影片 Hit@1 50.67、音訊 MRR@10 69.54。
      7. 怎麼取得: README 給兩條路,sentence-transformers 的 SentenceTransformer("google/embeddinggemma-2"),或 transformers 的 AutoProcessor 搭配 AutoModel.from_pretrained();model card 註明部署需遵守 Gemma Prohibited Use Policy。
      8. 連結: huggingface.co/google/embeddinggemma-2
      9. 2. jialinyyzz/humanizer:把 AI 腔改成人話,但數字一個都不准改
        • 這是什麼: 基底是 google/gemma-4-12B 的 12B 微調模型,中英雙語,任務非常專一,就是把 AI 寫的草稿改寫成像真人手寫的文字。權重以 GGUF、safetensors、MLX 三種格式提供,授權 Apache 2.0。
        • 能用在哪些場景:
          1. 工程師寫技術文件或週報:先讓大模型打草稿,再用本機 humanizer 把 AI 腔改掉,model card 強調的約束是「Every fact, number, unit, date, name and quotation must survive unchanged」,所以版本號、效能數據、日期不會在改寫中被動到。
          2. 稿子不能上雲端的場合:內部報告、客戶提案含敏感資訊時,用 GGUF 在自己筆電完全離線跑,README 直接給了 llama-server 的啟動指令。
          3. Mac 使用者想在 Apple Silicon 上用:README 附了 mlx_lm.convert --hf-path jialinyyzz/humanizer 的轉檔指令,model card 並標示在 Apple M 系列晶片上峰值記憶體約 6.2GB(2-bit)到 13.7GB(Q8_0)。
          4. 跑得動嗎: model card 逐檔列出量化版本與記憶體需求,Q8_0(檔案 12.7GB)標「32 GB of memory or more. Recommended.」、Q6_K(10.0GB)標「16 GB of memory」、Q4_K_M(7.6GB)標「About 14 GB of memory」、Q3-QAT(5.6GB)標「12 GB of memory」、IQ2_XS-QAT(3.9GB)標「8 GB of memory, the smallest」。原始 BF16 權重約 24GB。
          5. 本期聲量: HF 熱度 370(15.1k 次下載、378 個讚)。
          6. 跟同類比: 作者在 Hugging Face 部落格〈We built an AI humanizer and never let it see a detector〉說明訓練全程沒有把任何 AI 偵測器當成 reward,人類側用未經加工的真人文章,AI 側則讓大模型從該篇人類文章反推出草稿。model card 標示在 Originality.ai 最嚴格設定下有 95% 的改寫被判為人類(前一版為 88%),英文改寫 420 篇中有 376 篇通過事實查核。
          7. 怎麼取得: README 給 llama.cpp 的 llama-server -m humanizer-12b-Q8_0.gguf -c 8192 -np 1 -ngl 99,也列了 vllm serve "jialinyyzz/humanizer" 與 transformers 直接載入兩種方式。
          8. 連結: huggingface.co/jialinyyzz/humanizer
          9. 3. orcarouter/OrcaSAQ-2-Cyber-27B-Uncensored-GGUF:27B 塞進單張 16GB 顯卡
            • 這是什麼: 27B 參數的量化模型,血緣是 Qwen/Qwen3.8-27B(經作者自己的 orcarouter/Qwen3.8-27B-Uncensored 再量化),GGUF 格式,Apache-2.0。model card 明寫定位是「local deployment · coding · tool use · reasoning · defensive red teaming · vulnerability research · authorized security testing」,也就是給授權情境下的資安研究與紅隊演練用。
            • 能用在哪些場景:
              1. 做授權滲透測試或紅隊演練的工程師在隔離環境自架助手:本機跑代表目標系統資訊不必送進雲端 API。
              2. 想在單張 16GB 顯卡上跑 27B 的人:Ollama 一行 ollama run hf.co/orcarouter/OrcaSAQ-2-Cyber-27B-Uncensored-GGUF 就能起,model card 的 llama-cli 範例開到 32K context,可以當離線的寫程式、工具呼叫助手。
              3. 研究量化極限的人:這包是「BF16 54.7GB 壓到 15.7GB」的實際案例,model card 附了 perplexity、token agreement、KLD 等指標可以對照壓縮後的劣化程度。
              4. 跑得動嗎: 單一量化檔 15.7GB(原始 BF16 為 54.7GB)。model card 表格標示 llama.cpp 峰值 VRAM 為「14.9 GB」(DFlash2 off)與「18.1 GB」(DFlash2 on),吞吐分別為 20.5 tok/s 與 27.6 tok/s;作者註明測試條件是「Single stream, greedy, measured in the official llama.cpp CUDA container」,但頁面上沒有寫測試所用的顯卡型號。
              5. 本期聲量: HF 熱度 215(18.1k 次下載、415 個讚)。
              6. 跟同類比: 跟一般 llama.cpp 常見的 Q4_K_M 這類人人可複現的量化不同,作者把 SAQ-2 描述為「proprietary sensitivity-aware mixed-precision quantization system」,並明講「Detailed quantization methodology, calibration strategy, precision allocation and packing techniques are not currently disclosed」,壓縮率漂亮但方法不公開。作者自己也掛了警語「This model is uncensored.」,模型衍生自 abliterated checkpoint,且「Guardrails, filtering and policy enforcement are the deployer's responsibility.」,部署前務必確認自己的使用情境屬於授權範圍。
              7. 怎麼取得: README 給 llama.cpp 的 llama-cli -m ./OrcaSAQ-2-27B-Uncensored-GGUF/OrcaSAQ-2-27B-Uncensored.gguf -ngl 99 -c 32768,或 Ollama 的 ollama run hf.co/orcarouter/OrcaSAQ-2-Cyber-27B-Uncensored-GGUF。
              8. 連結: huggingface.co/orcarouter/OrcaSAQ-2-Cyber-27B-Uncensored-GGUF
              9. 結尾段落

                三個選題其實指向同一件事,模型不再只拚參數量,而是拚「怎麼塞進一般人的機器裡」,不管是 740M 的多模態 embedding、12B 的任務型微調,還是 27B 壓到 15.7GB 的量化實驗,省的都是同一塊 VRAM 跟記憶體。如果只能先裝一個來研究,jialinyyzz/humanizer 的量化階梯最完整,8GB 記憶體就能起步。下集再見。

                節目製作:226 Network

                團隊用 AI 自己做了小工具,想讓它穩定、好維護?看看 Vibe Coding 架構規劃與陪跑:https://www.226network.com/vibe-coding

                本節目由 AI 撰稿並以合成語音播出,主持人為虛擬角色。

                9 min
              10. 🧪 177B 模型瘦身術:GSQ-RCO 量化版 220 萬次下載打平原廠|地端 AI 實驗室
                開場白

                這週地端模型雷達上最熱門的一顆不是新模型,而是把 177B 等級 MoE 壓成 IQ3 量化的 Qwen3.8-Flash-Next-GSQ-RCO-GGUF,220 萬次下載、617 個讚,作者甚至說 IQ3_S 打平原始 BF16 模型的分數。另一顆主角是 Microsoft 的 FrogNano-4B-2609,9.3 GB 就跑出 SWE-bench 61.5%,但它是不是裝了就能用,等一下告訴你。

                本期精選
                1. Qwen3.8-Flash-Next-GSQ-RCO-GGUF:177B MoE 壓進 IQ3,分數打平原廠
                • 這是什麼:IST Austria DASLab 用自家方法做出來的 GGUF 量化版本,底層是 177B 等級的 MoE 模型。GSQ(Gumbel-Softmax Quantization)跟 RCO(Riemannian Constrained Optimization)各有一篇 arXiv 論文(2604.18556、2605.00649),不是社群隨手轉出來的量化包。提供 Q2_0、IQ2_XS、IQ3_XXS、IQ3_S 四檔,授權 Apache-2.0,承襲 base model。

                • 能用在哪些場景:

                  1. 公司程式碼與客戶資料不能送出去的團隊,想在自家開發機跑一顆 177B 等級的模型做推理與程式輔助:README 說明加上 -lm mmap --lazy-mode on,可以把 28.8 GB 的 n-gram 查表留在硬碟記憶體映射,不佔用常駐記憶體。
                  2. 要在預算與品質之間做取捨的工程師:卡上直接列出四檔對 BF16 base(task average 93.12)的回復率對照表,IQ3_XXS 是 92.57、IQ3_S 是 93.26,作者稱 IQ3_S「matches or exceeds the base model on every task」,可以照自己的 VRAM 預算挑檔,不用自己重跑評測。
                  3. 已經習慣 Ollama 或 LM Studio 的人:README 給的是 ollama run hf.co/,LM Studio 則在檔案清單裡挑 GSQ-RCO-* build,不必改動既有流程。
                  4. 跑得動嗎:README 下載表標示 Shard 1(權重)Q2_0 37.6 GB、IQ2_XS 39.2 GB、IQ3_XXS 47.0 GB、IQ3_S 54.8 GB,Shard 2(n-gram 查表)28.8 GB 可用記憶體映射留在磁碟。消費級單卡具體能不能跑,官方卡上沒有自己背書:llm-bench.io 網站寫在消費級 GPU 上最高約 36.4 tok/s,另有第三方提到透過 Strata Engine 可從 8 GB VRAM 起跑。這兩個數字都是外部獨立測試站台與第三方工具自己的說法,不是 Qwen3.8-Flash-Next-GSQ-RCO-GGUF 官方驗證過的數字,測試方法、硬體配置是否跟你的機器相同都查不到公開細節,拿來當參考就好,別當成保證。Mac 支援度官方也沒有標示。

                  5. 本期聲量:HF 熱度 234(220 萬次下載、617 個讚),本期所有候選裡下載數最高的一顆。

                  6. 跟同類比:作者主張 GSQ 是「closing most of the gap between scalar and vector quantization at 2 to 3 bits」,卻仍能存成標準 GGUF scalar 格式;RCO 則負責在總容量預算下逐 tensor 分派量化型別。要分清楚代表性的是,Hugging Face 討論區有一位使用者留言「效能不如官方版,但作為 IQ3 量化很優秀」,這只是單一使用者的個人體感、樣本數是 1,不是跑分數據,跟卡上那組有完整評測流程支撐的回復率數字不能放在同一個量級看待。

                  7. 怎麼取得:hf download --include "IQ3_XXS/*" --local-dir .,接著 llama-cli -m IQ3_XXS/Qwen3.8-Flash-Next-GSQ-RCO-IQ3_XXS-00001-of-00002.gguf -lm mmap --lazy-mode on -ngl 99 -p "...";也支援 ollama run hf.co/ 與 LM Studio 直接搜尋 repo 名稱。

                  8. 連結:Hugging Face

                    2. FrogNano-4B-2609:4B 就能跑 agent,但不是開箱即用
                    • 這是什麼:Microsoft 釋出的 46.6 億參數模型,32 層 dense,混合 Gated DeltaNet 與 gated-attention 架構,評測設定下約 131K 上下文,授權 MIT,格式 safetensors。技術報告掛在 arXiv 2609.07925,GitHub repo 是 microsoft/FrogNano。

                    • 能用在哪些場景:

                      1. 個人開發者想要不連外的本地 coding agent:model card 說明是「given an authorized repository snapshot and an English natural-language issue」,模型產生文字與結構化的 Leaf tool call,由 harness 執行,形成反覆翻檔案、搜尋、改碼、跑測試的循環。
                      2. 程式碼不能外送的企業團隊,想先讓本地模型跑一輪再由人審:卡上列的適用範圍是「bug diagnosis and repair、scoped feature implementation、regression fixing、test-driven code maintenance」,並明確定位在 human-supervised development。
                      3. 想研究小模型怎麼練成 agent 的人:技術報告走純 RL 加合成任務、不做 frontier 模型蒸餾的路線,社群貼文整理為約 1,500 個合成任務、5 輪迭代,方法本身可以照著復現。
                      4. 跑得動嗎:官方 model card 寫 BF16 檢查點「requires about 9.3 GB for model weights alone, with additional memory needed for runtime state」。但卡上同時註明確切的最低 GPU 型號與 VRAM 配置「still to be validated before release」,官方目前也沒有提供量化版本。社群已有第三方轉換(roman220220/FrogNano-4B-2609-gptq-mlx-jang),但那不是官方產物,穩定性與正確性都未經 Microsoft 驗證。

                      5. 本期聲量:HF 熱度 105(581 次下載、107 個讚)。

                      6. 跟同類比:跟同樣走 agent 路線但動輒 27B 起跳的候選(例如本期雷達上的 BAAI/AREX-2、autotrust/JEV-27B-VL)相比,FrogNano 只有 4B。官方卡自己給的對照是同一套流程下 base model 39.4% 對上訓練後 61.5%。至於拿 4B 去對比 GPT-5 mini、Grok 4、Opus 4.1 這類大得多的系統,是 daily.dev 整理與 X 上研究者(Rohan Paul、Minseon Kim)貼文的說法,不是 Microsoft 官方表述。

                      7. 怎麼取得:GitHub(microsoft/FrogNano,MIT)指令是 uv venv --python 3.12、uv pip install -e .,評測用 frognano-eval run --config frognano/configs/eval/swebench-verified.yaml。這裡有個要先知道的落差:repo 本身不附 vLLM 或本地服務指令,預期你透過 FROGNANO_MODEL_BASE_URL 自己架一個 OpenAI 相容端點,並在 Kubernetes sandbox 內執行任務。換句話說,9.3 GB 只是模型權重本身的顯示記憶體門檻,真的要把它變成「丟一個 issue、它自己改完」的 agent,還得自己兜 harness、agent loop 跟執行沙箱;沒有 K8s 環境、只想雙擊就跑的個人開發者,這段距離要先有心理準備,跟「不連外本地 agent」聽起來的輕鬆程度中間還有一段工程要補。

                      8. 連結:Hugging Face

                        結尾段落

                        這兩顆剛好是兩種取捨:Qwen3.8-Flash-Next-GSQ-RCO-GGUF 用量化把 177B 等級的模型搬到你我架得起來的規模,權重大小跟取得方式都很明確;FrogNano-4B-2609 的顯示記憶體門檻看起來低很多,但想把它接成真正能動手改程式碼的 agent,還得自己補 harness 跟沙箱,這兩件事不能劃等號。如果只是想先試試量化模型的手感,GGUF 那顆現在就能用 Ollama 跑起來;如果對 agent 訓練方法本身更有興趣,FrogNano 的技術報告值得先讀完再評估要不要動工。下週五再來看看地端模型雷達上又冒出什麼新東西。

                        節目製作:226 Network

                        團隊用 AI 自己做了小工具,想讓它穩定、好維護?看看 Vibe Coding 架構規劃與陪跑:https://www.226network.com/vibe-coding

                        本節目由 AI 撰稿並以合成語音播出,主持人為虛擬角色。

                        8 min
                      9. 🧪 164 MB、174 倍實時:Phonon-2 讓語音轉文字不必再課雲端稅|地端 AI 實驗室
                        開場白

                        Phonon-2 官方宣稱是 900 MB 以下最準的英文語音辨識模型,下載只要 164 MB,官方標示在 M5 MacBook Air 上能跑到 174 倍實時。這集也會看 Cloudflare 自己 post-train 的 9B 模型 clef-flash,以及能自己練 LoRA 的繪圖模型 Nanosaur2-670M,等一下告訴你誰最好上手。

                        本期精選
                        1. Cloudflare/clef-flash:回答機率而不是自由文字,省掉你解析 LLM 回覆的那層 regex
                        • 這是什麼:Cloudflare 自己 post-train 的 9B 模型,基底是 Qwen/Qwen3.5-9B,apache-2.0 授權。它的特色不是生成自由文字,而是直接輸出每個選項的機率,card 把工單分流、發票判讀、資安事件分類都列為 intended use。
                        • 能用在哪些場景:
                          • 後端工程師把進來的客服工單丟一組 typed questions 進去,問它屬於哪個產品線、嚴重度多高、該派給誰,拿到的是每個選項的機率,不用再寫 regex 解析 LLM 回覆、也不用設重試邏輯。
                          • 做發票與報帳系統的團隊拿它讀使用者上傳的發票圖檔並判定下一步動作,card 明確把 invoice processing 列為 intended use,輸入支援 text、JSON、影像與影片。
                          • 自架監控的人把資安事件分類交給它,card 列出 security incident classification,搭配量化版本在內網用 Ollama 跑,log 不用送出公司網段。
                          • 跑得動嗎:官方 model card 只寫測試環境是「a single H200」搭 PyTorch 2.11 與 Transformers 5.10.2,沒有標示消費級 VRAM 門檻。不過 card 另外列出 20 個量化版本,相容 llama.cpp、Ollama 與 LM Studio,是這幾個候選裡最有機會直接在自己機器上跑起來的。
                          • 本期聲量:HF 熱度 234,1.3k 次下載,235 個讚。
                          • 跟同類比:同家族的 Cloudflare/clef 是 27B,backbone 為 Qwen3.8-27B;clef-flash 的 card 自己寫明是從 Qwen/Qwen3.5-9B post-train 來的。官方數字是 median latency 38.8ms 對 clef 的 209.3ms,但 GSM8K 67.3% 低於 clef 的 80.8%,官方把它定位成「拿推論能力換速度」的取捨版本。
                          • 怎麼取得:card 給的流程是先 snapshot_download("Cloudflare/clef-flash"),再 sys.path.insert(0, path) 並 from joint_schema_model import load_release_model 取得 model 與 processor(device="cuda");想走 Ollama 或 LM Studio 則改用 card 列出的量化版本。
                          • 連結:huggingface.co/Cloudflare/clef-flash
                          • 2. FermionResearch/Phonon-2:164 MB 的語音轉文字模型,官方自稱 900 MB 以下最準
                            • 這是什麼:基底是 NVIDIA 的 parakeet-tdt-0.6b-v3,官方把它重新壓縮成一個 164 MB 的英文語音辨識模型,cc-by-4.0 授權,card 自稱是「the most accurate open speech recognition model for English under 900 MB」。
                            • 能用在哪些場景:
                              • 做內容的人把錄好的英文 podcast 或會議錄音在自己筆電上轉成逐字稿,官方標示在 M5 MacBook Air 上可達 174 倍實時,不必再付雲端 ASR API 的費用。
                              • 需要處理敏感錄音的團隊,像是法務、醫療、HR 面談,把 ASR 放進內網,card 列出 Apple silicon、Linux x86-64 與 Arm、Windows CPU,以及走 Docker 的 GPU 版本,整條流程可以在自己機器上閉環。
                              • 自架字幕流程的開發者把它接成批次服務消化整個影片庫,官方給的數字是 H100 在 batch 128 下 6,680 倍實時。
                              • 跑得動嗎:card 標示下載 164 MB,encoder「holds each weight at one of five learned levels in about 2.1 bits」;平台支援 Apple silicon、Linux(x86-64 與 Arm)、Windows CPU,GPU 走 Docker。具體 RAM 與 VRAM 數字官方沒有寫。
                              • 本期聲量:HF 熱度 144,2.1k 次下載,147 個讚。
                              • 跟同類比:它的基底是 NVIDIA 的 parakeet-tdt-0.6b-v3,作者在 card 裡聲稱 7 個英文資料集平均 WER 5.21%,達到 2.5GB teacher 模型準確度的 100.8%,體積卻小了 15 倍。要特別提醒的是 card 的訴求只限英文,中文辨識官方並沒有宣稱。
                              • 怎麼取得:README 寫的是 pip install fermion-research,再 pip install mlx mlx-lm mlx-audio soundfile scipy zstandard,然後 phonon transcribe recording.wav(或 fermion transcribe phonon-2 recording.wav);card 另外附了 Docker 的 CPU 與 GPU 版本。
                              • 連結:huggingface.co/FermionResearch/Phonon-2
                              • 3. well9472/Nanosaur2-670M:670M 的繪圖模型,repo 直接附上 train_lora.py
                                • 這是什麼:一個 670M 的 diffusion transformer 繪圖模型,MIT 授權。作者在 card 裡把架構寫得很細,像是 adaLN-single、2D RoPE、SwiGLU、QK-norm、SPRINT sparse middle blocks、x-prediction,text encoder 用凍結的 Gemma-3-270M 倒數第二層,VAE 則是 129M 的 semantic DINOv2 VAE。
                                • 能用在哪些場景:
                                  • 想練 LoRA 但手上沒有大卡的人拿它當練習場,card 給的訓練指令是 uv run python custom_nodes/nanosaur2_support/train_lora.py /path/to/images,直接指向自己的圖片資料夾。
                                  • 已經在用 ComfyUI 的人把它當輕量節點掛進現有流程,card 的安裝方式就是把 custom nodes 與模型檔複製進 ComfyUI 對應目錄。
                                  • 想搞懂 diffusion 架構的工程師把它當教材讀,官方標示 base 訓練只花了 11 個 H100-days,架構拆解得比一般 model card 細很多。
                                  • 跑得動嗎:官方沒有標示推論端的 RAM 與 VRAM 門檻,card 只給了訓練端數字,VAE 在 1xH100 上跑 12 小時、base 訓練 11 個 H100-days。這裡做個推估:670M 相對於動輒數十億參數的繪圖模型算是小很多,理論上對消費級顯卡會更友善,但這只是從參數量推敲,不是官方給的硬體數字。
                                  • 本期聲量:HF 熱度 82,0 次下載,90 個讚。
                                  • 跟同類比:作者自己在 card 裡先打了預防針:「Do not expect this to compete with fully trained models like Anima in character knowledge or fine detail. The purpose to see what is possible with minimal compute.」對照本期另一個開源繪圖候選 inclusionAI/Ming-Image-0.1-Design,其 card 標示驗證環境需要一張 80 GiB VRAM 的 CUDA GPU,Nanosaur2 的門檻明顯低得多。
                                  • 怎麼取得:依 card 說明把 custom nodes 與模型檔複製到 ComfyUI 對應目錄後使用;要訓練 LoRA 則用 card 提供的 uv run python custom_nodes/nanosaur2_support/train_lora.py /path/to/images。
                                  • 連結:huggingface.co/well9472/Nanosaur2-670M
                                  • 結尾段落

                                    這期三個模型剛好是三種不同切角:clef-flash 把 LLM 輸出收斂成機率、省掉解析層;Phonon-2 把語音辨識壓到 164 MB 塞進筆電;Nanosaur2-670M 則是小到能讓你自己動手練 LoRA。如果只能先挑一個試試看,clef-flash 的 20 個量化版本應該是門檻最低的起點。下集再見。

                                    節目製作:226 Network

                                    團隊用 AI 自己做了小工具,想讓它穩定、好維護?看看 Vibe Coding 架構規劃與陪跑:https://www.226network.com/vibe-coding

                                    本節目由 AI 撰稿並以合成語音播出,主持人為虛擬角色。

                                    9 min
                                  • 🧪 CLM-v0.1-8B 不生成文字只打分數,延遲最多砍 9 倍|地端 AI 實驗室
                                    開場白

                                    這期 Hugging Face 熱度冠軍 Contrastive-LM/CLM-v0.1-8B 不生成文字,靠打分數就讓延遲最多砍 9 倍。同場還有專攻路由審核的 LoRA interfaze-ai/lev,跟免顯卡也能跑的小模型 SupersonicLabs/Julia-1。它憑什麼撐住 52 種語言分類,等一下告訴你。

                                    本期精選
                                    1. Contrastive-LM/CLM-v0.1-8B:不寫字、只對候選打分的排序器
                                    • 這是什麼:CLM-v0.1-8B 不是用來生成文字的模型,官方說明是把兩個投影頭疊在凍結的 Qwen3-8B 上,專門對「候選項」打分數,用在重排序、動作選擇、驗證這類任務。8B 參數,Apache-2.0 授權,可自由商用。
                                    • 能用在哪些場景:
                                      • 自架 RAG 的後端工程師:向量檢索一次撈回上百段候選片段,塞進大模型前可以先用 CLM 重排序、只留前幾段;官方 README 強調 state 與 action 是分開編碼的,action 的 embedding「their embeddings are cached and reused independently」,同一批文件片段重複查詢時不用重算。
                                      • 在本機跑 tool-calling agent 的人:每一步要從十幾個工具裡挑一個,可以改成把候選動作丟給 CLM 打機率分數,不用再叫 LLM 生一段 JSON 出來解析;官方 model card 寫零樣本情況下「on par with Jev on computer-use, gaming and tool-calling tasks, with up to 9× lower latency」。
                                      • 做 coding agent 的人:拿它當驗證器,同一個問題產生多個修補方案後用來挑一個;官方標示微調成 verifier 後「SOTA on DeepSWE (81.6%) and Terminal-Bench 2.1 (87.6%), 4–6× faster than Jev」。
                                      • 跑得動嗎:官方未標示 VRAM 數字。GitHub README 提到要另外起一個 encoder:vllm serve Qwen/Qwen3-8B --runner pooling --max-model-len 2048,並寫「States longer than 2048 tokens are truncated. For longer states, raise both limits together...(needs more GPU memory)」;另外有 vector cache 會預留 GPU 記憶體保留 state/action embedding,官方稱重訪同一個 state 時「2.8x faster」。量化版本官方未標示,CPU 模式雖然有 --device cpu 旗標,但官方沒給任何效能說明。
                                      • 本期聲量:HF 熱度 543(2.4k 次下載、552 個讚),本期選題第一名。
                                      • 跟同類比:跟同類的 Jev 相比,官方 model card 自己的說法是賣點不是準確率而是延遲:零樣本表現與 Jev 相當,延遲最多低 9 倍,約 1k 候選時「13× faster than Jev」。架構上是把兩個投影頭疊在凍結的 Qwen3-8B 上,不是重新訓練一個大模型。以上皆為作者自述,尚未見第三方獨立複測。
                                      • 怎麼取得:README 寫的是 pip install contrastive-lm,先用 vLLM 把 Qwen3-8B 以 pooling 模式起在 8090 埠當編碼器,再執行 clm-serve,就會在 http://localhost:8700/ 開一個 API 供 rank、查詢使用。
                                      • 連結:Contrastive-LM/CLM-v0.1-8B
                                      • 2. interfaze-ai/lev:200 MB 的 LoRA,接手路由與審核判斷
                                        • 這是什麼:lev 是掛在 Qwen3.5-4B 上的 LoRA/adapter,主檔約 200 MB,做的是路由、審核、意圖偵測這類「從候選裡選一個」的判斷任務,不是生成長文。授權 Apache-2.0。
                                        • 能用在哪些場景:
                                          • SaaS 後端做意圖路由:使用者訊息進來要決定丟給哪一條處理管線,用它一次前向傳播就能拿到各選項機率,不必等大模型吐完一段文字再解析;官方 model card 列的用途就包含「routing, moderation, intent detection, triage, grading」。
                                          • UGC 平台的留言審核:每天大量留言要先過一層機器判斷再送人工,官方說明它回傳的是校準過的機率(calibrated probabilities)而不是生成的解釋,方便直接設閾值分流。
                                          • 檢查另一個大模型的輸出:把 LLM 產生的答案配上「有沒有回答到問題」這類是非題丟進去驗;官方把「checking LLM output」明列為設計用途,並標示在 FEVER 這類主張驗證任務上得分 0.872。
                                          • 跑得動嗎:官方 model card 寫「for real-time use, a CUDA GPU」,並標示底模下載量約 8 GB、adapter 本身約 200 MB。量化選項官方未標示。
                                          • 本期聲量:HF 熱度 94(480 次下載、98 個讚),本期唯一的 LoRA/adapter 候選。
                                          • 跟同類比:難得的是作者自己在卡片上就認輸,標示自身在 13 個 S1Bench 子集上的 macro accuracy 是 0.689,對照 Jev 的 0.761。它賣的不是最高分,而是用 200 MB adapter 去逼近體積大得多的專用模型(同期候選 Jev-Omni 是 12B,官方標示 FP32 權重約 50 GB)。分數皆為作者自述。
                                          • 怎麼取得:README 給的是標準 PEFT 兩行:AutoModelForCausalLM.from_pretrained("Qwen/Qwen3.5-4B") 之後接 PeftModel.from_pretrained(base_model, "interfaze-ai/lev");官方另外提供自家套件寫法 lev.load("interfaze-ai/lev")。授權 Apache-2.0,權重可直接下載,無需申請。
                                          • 連結:interfaze-ai/lev
                                          • 3. SupersonicLabs/Julia-1:144.3M 參數、CPU 就能跑的多語系分類器
                                            • 這是什麼:Julia-1 底層是多語系的 mmBERT-small,144.3M 參數,做的是狀態/問題/選項式的分類判斷。官方標示 FP32 權重只佔 550.5 MiB,授權 Apache 2.0。
                                            • 能用在哪些場景:
                                              • 沒有獨顯的開發者:手上只有便宜 VPS 或沒有獨顯,可以把客服工單、表單自動分類直接跑在 CPU 上;官方寫「CPU inference works with the standard PyTorch installation; no native router build is needed」,不需要為了一個分類器去租 GPU。
                                              • 多語系產品的意圖分類:官方標示在 MASSIVE 基準的「all 52 locales」上 macro accuracy 71.50%,並列出 en-US 86.75%、pt-PT 86.25% 等單語結果,適合一套模型同時吃多國語言的客服或 App 後端。
                                              • 內部工具的布林閘門:官方列出 noul 模式專做布林判斷、choice 模式支援 2 到 20 個選項,可以拿來判斷「這封信要不要升級處理」這種每天跑幾萬次、用大模型太貴的小決策。
                                              • 跑得動嗎:官方 model card 標示「The FP32 weights occupy 550.5 MiB; allow additional memory for the tokenizer and activations.」CPU 推論用標準 PyTorch 安裝即可;要用 CUDA 則需要 BF16-capable 的 GPU。輸入上限官方寫的是 8,192 token 的 state/question/options 合計長度。
                                              • 本期聲量:HF 熱度 297(2.2k 次下載、305 個讚)。
                                              • 跟同類比:同期高聲量的決策型模型多半 8B 到 12B 起跳(像本期的 CLM-8B、Jev-Omni 12B),Julia-1 的 144.3M 差了一到兩個數量級。代價作者自己也寫明了:它「cannot reliably supply missing facts, solve algebraic equations, or carry a long chain of calculations」,而且「is not a drop-in Transformers text-classification pipeline」,得照它自己的 API 接。皆為官方卡片上的自述。
                                              • 怎麼取得:官方說明是下載 repo 後 python -m pip install -e ./Julia-1,再用 load_model("Julia-1", device="cpu", max_length=8192) 載入;model card 特別提醒「Download the actual weights, not a Git LFS pointer」。授權 Apache 2.0,無需申請。
                                              • 連結:SupersonicLabs/Julia-1
                                              • 結尾段落

                                                這三個模型有個共同點:都不是拿來聊天的通用生成模型,而是幫系統做選擇、打分數、分類這種高頻小判斷,省下每次都要叫大模型出馬的成本。如果只能先挑一個動手,CLM-v0.1-8B 的 RAG 重排序場景,大概是台灣工程師最快能接上的一塊拼圖。下集見。

                                                節目製作:226 Network

                                                團隊用 AI 自己做了小工具,想讓它穩定、好維護?看看 Vibe Coding 架構規劃與陪跑:https://www.226network.com/vibe-coding

                                                本節目由 AI 撰稿並以合成語音播出,主持人為虛擬角色。

                                                8 min
                                              • 🧪 小米旗艦要8張顯卡,這顆MiMo-V2.6-Distill-Qwen-9B一行指令就能跑|地端 AI 實驗室
                                                開場白

                                                這週 Hugging Face 熱度榜被小米 MiMo V2.6 家族整個洗版,官方旗艦範例指令要 8 張顯卡起跳,但家族裡的 MiMo-V2.6-Distill-Qwen-9B 卻是唯一一般顯卡有機會跑起來的版本,MIT 授權,還有 llama.cpp 官方團隊親自出的 GGUF。這集另外挑了兩顆同樣能落地的模型:1.2B 就能把發票掃描轉成結構化表格的 TeleOCR,還有純 CPU 就能跑、加新分類不用重新訓練的 GLiNER2.5-Decide,等一下告訴你這三顆各自適合塞進哪種工作流。

                                                本期精選
                                                1. MiMo-V2.6-Distill-Qwen-9B:小米旗艦洗版週,唯一消費級顯卡跑得動的版本
                                                • 這是什麼: 小米 MiMo V2.6 家族的 9B 蒸餾版語言模型,以 Qwen3.5-9B 為基底蒸餾而成,MIT 授權,官方定位在 coding、visual coding 與 cybersecurity 三大應用方向。
                                                • 能用在哪些場景:
                                                  • 個人開發者想要一個完全離線的 coding agent 改自己的私有 repo,程式碼不用送上任何雲端。官方 model card 把 coding 列為四大訓練領域之首,Code 資料佔比 29.9%。
                                                  • ggml-org 出的 GGUF 版本附了 mmproj 視覺投影檔,可以直接丟截圖請它照畫面刻版型、抓 UI 問題,官方把這類任務稱為 visual coding,訓練資料裡 Visual 佔 27.4%。
                                                  • 資安或維運團隊想在內網做終端機操作與弱點分析的半自動化演練,官方列 cybersecurity 為四大訓練領域之一(Cyber 佔 14.2%),並自評 Terminal Bench 拿到 37.1 分。
                                                  • 跑得動嗎: 官方 model card 沒有標示 VRAM 需求,只寫可以在 llama.cpp、Ollama、LM Studio 等相容工具上瀏覽量化版本使用,列出 53 個量化選項。實際數字要看第三方量化頁面:ggml-org 的 Q8_0 版本是 9.53 GB(頁面註明含 Q8_0 mmproj 視覺編碼器),bartowski 版本則有 Q4_K_M 5.84 GB、Q5_K_M 6.88 GB、Q6_K 7.79 GB、Q8_0 9.55 GB,最小的 IQ2_M 只要 3.54 GB。bartowski 頁面給的選型原則是挑選檔案大小比你 GPU 總 VRAM 小 1 到 2 GB 的量化版本。
                                                  • 本期聲量: HF 熱度 516,8.8k 次下載,527 個讚。
                                                  • 跟同類比: 官方 model card 只拿自己跟基底 Qwen3.5-9B 比,宣稱 SWE Verified 61.1、SWE Pro 44.6、AutomationBench 30.3、Terminal Bench 37.1 全面領先,這些都是作者自評數字。真正的分水嶺其實是能不能自架,同期旗艦 MiMo-V2.6-Pro-RL 的 model card 自己寫是 Sparse MoE 架構、1.02T 總參數/42B 啟動,範例指令是 8 張卡的 tensor-parallel-size,一般人只能看熱鬧。
                                                  • 怎麼取得: ggml-org 的 GGUF 頁面給的是一行指令 ollama run hf.co/ggml-org/MiMo-V2.6-Distill-Qwen-9B-GGUF:Q8_0,或用 llama.cpp 的 llama serve -hf ggml-org/MiMo-V2.6-Distill-Qwen-9B-GGUF:Q8_0。想自架 API 的話,官方 model card 給的指令是 sglang serve --model-path XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B --reasoning-parser mimo,另外也支援 vLLM 與 Docker。
                                                  • 連結: XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B
                                                  • 2. TeleOCR:1.2B 就把發票、合約、講義轉成結構化文字
                                                    • 這是什麼: XingChen-AGI 出品的文件解析模型,約 1.2B 參數,BF16,apache-2.0 授權,同一個框架處理文字擷取、表格解析與版面/閱讀順序還原。
                                                    • 能用在哪些場景:
                                                      • 行政或會計把手機拍的發票、收據、報價單批次轉成結構化表格,model card 說表格會以 OTSL 格式輸出,另外附工具能轉成 HTML table,可以直接匯入試算表或資料庫。
                                                      • 團隊想把累積多年的 PDF 規格書、合約掃描檔轉成 markdown 灌進 RAG 知識庫,官方強調它是統一框架,同時處理文字、表格與版面還原,不用再拼好幾個工具。
                                                      • 老師或研究生要把含數學式的講義、論文 PDF 轉成可編輯文字,model card 寫公式會輸出成 LaTeX 並用 ...... 包住,不用再手動重打公式。
                                                      • 跑得動嗎: 官方 model card 沒有標示 VRAM 或硬體門檻,只列出約 1.2B 參數與 BF16 張量型別。量化是社群路線,card 上原文致謝「Thanks to Nandraj for the GGUF conversion and llama.cpp support!」,官方另外提供 vLLM、SGLang、Docker 三種部署方式。以 1.2B 這個量級推估,量化後應該塞得進消費級顯卡,但這只是從參數量推得的判斷,官方沒有給實際數字。
                                                      • 本期聲量: HF 熱度 526,27.8k 次下載,627 個讚。
                                                      • 跟同類比: 作者在 model card 與論文(arXiv 2608.12898)裡說在 OmniDocBench v1.6 上贏過 pipeline 派的 MinerU 2.5 Pro、PaddleOCR-VL 1.6、GLM-OCR,以及端到端的 OvisOCR2,官方列出的分數是 Overall 96.87、Table TEDS 97.05,這些都是作者自評數字。有兩點要據實講:model card 只掛 Chinese 與 English 語言標籤,沒特別交代繁體中文支援到什麼程度;頁面也提到「We have renamed NaviDC-OCR to TeleOCR」,同名權重在 Hugging Face 上另有 StarDoc-AI 的版本,不宜斷言哪一邊是唯一官方來源。
                                                      • 怎麼取得: model card 給的是 pip install transformers torch pillow,再用 AutoProcessor.from_pretrained(..., trust_remote_code=True) 搭配 AutoModel.from_pretrained(..., trust_remote_code=True, torch_dtype=torch.bfloat16).cuda().eval() 載入。想走純本機輕量路線,可以用 card 上連結的社群 GGUF 版本配 llama.cpp、LM Studio 或 Ollama。
                                                      • 連結: XingChen-AGI/TeleOCR
                                                      • 3. GLiNER2.5-Decide:340M、純 CPU 就能跑的決策分類器
                                                        • 這是什麼: fastino 出的小型分類模型,DeBERTa-v3-large 編碼器,340M 參數,apache-2.0 授權,一次 forward pass 同時判斷多個分類欄位,標籤在呼叫當下才傳入,不用重新訓練。
                                                        • 能用在哪些場景:
                                                          • 客服工單進來時一次判斷意圖、優先級與需不需要轉真人,model card 的範例就是飯店客訴,一次回傳 intent、priority、needs_human 與多標籤的 topics。
                                                          • 當 LLM router 的前置分類器,先用 CPU 判斷這則請求該送哪個模型、走哪條流程,把昂貴的大模型呼叫留給真正需要的案子。
                                                          • 內容或日誌的多標籤打標,因為 label set 是呼叫當下才傳入的 dict,臨時要加一個分類欄位只要改設定,不用換權重。
                                                          • 跑得動嗎: model card 原文寫「Runs on: CPU or GPU, through gliner2」,明確支援純 CPU 執行。編碼器是 DeBERTa-v3-large、340M 參數(頁面 model size 欄位標的是 0.5B)。實際磁碟大小、延遲與吞吐量官方沒有標示,頁面完全沒有速度數字。
                                                          • 本期聲量: HF 熱度 210,19.8k 次下載,212 個讚。
                                                          • 跟同類比: model card 的對照表拿它跟自家 GLiNER2.5-Decide-1B(59.6%)與 JevK5(57.6%)比,這顆 340M 版以 60.2% 平均正確率勝出,測試集是 fastino/fast-decisions,17 個領域各 300 題。作者也主動劃線:「This release is not a general-purpose model. It does not reason, explain, or answer open questions」。對台灣團隊最關鍵的限制是這顆只吃英文,頁面原文寫「The suite is English. Use GLiNER2.5-multi-Decide when the input is multilingual」,中文工單要改用 287M 的多語版。
                                                          • 怎麼取得: pip install gliner2,接著 from gliner2 import AutoExtractor、model = AutoExtractor.from_pretrained('fastino/GLiNER2.5-Decide'),再呼叫 model.classify_text(text, label_dict),label_dict 裡可以同時放多個決策欄位,並針對個別欄位設定 multi_label 與 cls_threshold。
                                                          • 連結: fastino/GLiNER2.5-Decide
                                                          • 結尾段落

                                                            這期三顆模型剛好對應三種不同的地端需求:MiMo-V2.6-Distill-Qwen-9B 是唯一擠得進消費級顯卡的小米旗艦血統,TeleOCR 用 1.2B 把文件轉結構化這件事做到能打贏大模型的分數,GLiNER2.5-Decide 則證明分類任務有時候連 GPU 都不用。想先動手裝一個的話,GLiNER2.5-Decide 門檻最低,CPU 就能跑;想省顯卡又要做 coding agent,MiMo-V2.6-Distill-Qwen-9B 值得排進待辦清單。我們下集再見。

                                                            節目製作:226 Network

                                                            團隊用 AI 自己做了小工具,想讓它穩定、好維護?看看 Vibe Coding 架構規劃與陪跑:https://www.226network.com/vibe-coding

                                                            本節目由 AI 撰稿並以合成語音播出,主持人為虛擬角色。

                                                            10 min
                                                          • 🧪 HF 熱度第一 Xing4.0-29B-A4B:29B 模型只啟用 4B,塞單卡|地端 AI 實驗室
                                                            開場白

                                                            本週 HF 熱度榜冠軍是 Xing4.0-29B-A4B,43K 次下載、1.7K 個讚,29B 參數但每個 token 只啟用 4B,官方教學說單卡就塞得下;這集另外帶了原生串流語音辨識 Audio8-ASR-Infinite,跟專門重排把關的 openjev,等一下告訴你三顆模型官方標示的硬體門檻,以及各自能解決哪些場景的問題。

                                                            本期精選
                                                            1. Xing4.0-29B-A4B:29B 總參數,MoE 只啟用 4B,官方自帶 GGUF 教學能塞單卡
                                                            • 這是什麼:XingChen-AGI 出的 Xing4.0-29B-A4B,是一顆 MoE(混合專家)架構的語言模型,總參數 29B,但推論時每個 token 只啟用 4B,走 apache-2.0 授權,safetensors 格式。官方 model card 註明整個訓練跑在 Ascend NPU 加 MindSpore 框架,出品方是中國電信旗下的人工智慧公司。
                                                            • 能用在哪些場景:
                                                              • 接手遺留專案的後端工程師,把整個 repo 連同說明文件一次餵進官方標示的 256K 原生上下文(card 說可延伸到 512K),在自己機器上做跨檔案的修改計畫,公司程式碼完全不用上傳到雲端。
                                                              • 想自架 coding agent 的人,用 llama.cpp 的 llama-server 在本機起一個服務。model card 標示它支援多步驟規劃與 tool calling,官方教學特別註明呼叫工具要加上 --jinja 參數,可以接自己寫的 CLI 或編輯器外掛。
                                                              • 內部工具團隊拿它做 card 上點名的垂直應用:意圖分類、表格理解、合約審查、知識庫問答,在自己的資料上做輕量客製化,不用把敏感文件送出公司。
                                                              • 跑得動嗎:官方 model card 沒有寫明確的 VRAM 數字,只列出跟 vLLM、SGLang、KTransformers 相容。官方的 llama.cpp 教學文件寫得比較具體:權重採 IQ4_NL 混合精度量化後,GGUF 檔案約 18 GB,教學說可以在單張消費級顯卡上跑;另外還給了 2 張 12GB 顯卡搭 Q8_0 KV cache 的餘量數字,65536 tokens 上下文時顯示卡還剩 5.2 GiB,131072 時剩 4.5 GiB,拉到 262144(官方標示的原生上限)時剩 3.1 GiB。GGUF 版本放在官方另開的 XingChen-AGI/Xing4.0-29B-A4B-GGUF 這個 repo。
                                                              • 本期聲量:HF 熱度 1223,43.0K 次下載、1.7K 個讚,是本期三顆裡熱度最高的一顆。
                                                              • 跟同類比:同期熱度更高的兩顆,依各家 model card 自報,deepseek-ai/DeepSeek-V4.1-Flash 標的是 552B backbone(prefill 啟用 8B、decode 啟用 16B),XiaomiMiMo/MiMo-V2.6-Flash-RL 標 309B/15B、部署範例直接寫 --tp 8,兩者都不是單機量級。Xing4.0 是本期唯一「MoE 省算力又只有 29B 權重」同時成立的組合,card 自報 SWE-bench Verified 75.00、Terminal-Bench 2.1 57.50。
                                                              • 怎麼取得:README 的 transformers 範例要記得帶 trust_remote_code=True 和 device_map="auto";一行起服務是 vllm serve "XingChen-AGI/Xing4.0-29B-A4B",或 python3 -m sglang.launch_server --model-path "XingChen-AGI/Xing4.0-29B-A4B"。走地端量化就抓官方 GGUF repo,教學說是把 GGUF 放在跟 llama-server 同層的 deploy 目錄,用 -ngl 99 把層 offload 到 GPU。
                                                              • 連結:XingChen-AGI/Xing4.0-29B-A4B
                                                              • 2. Audio8-ASR-Infinite:4B 原生串流語音辨識,中文延遲可調,不用上雲
                                                                • 這是什麼:Edge0 出的 Audio8-ASR-Infinite,是一顆 4B 參數的原生串流語音辨識模型,權重檔 model.safetensors 大小 8.17 GB,資料型別 bfloat16,apache-2.0 授權可商用,支援中英雙語。
                                                                • 能用在哪些場景:
                                                                  • 做客服或線上會議系統的工程師,要即時字幕但錄音不能上傳第三方:model card 標示轉寫延遲落在 240 到 560 ms 之間,audio clock 可以選 80、120 或 160 ms,能自己在延遲跟正確率之間找平衡點。
                                                                  • 要長時間不斷線收音的場景,像直播字幕或值班監聽台:card 說原生上下文只有 30 秒,但靠 rolling KV cache 可以擴到不限長度,作者明講就是為 24/7 連續運作設計的。
                                                                  • 手上有一批中文訪談或內部會議錄音要轉成文字稿的內容團隊,用 transformers 的 pipeline 批次跑完,語言參數指定 zh 就好。
                                                                  • 跑得動嗎:card 沒有標示 VRAM 下限,只寫了 4B 參數、model.safetensors 8.17 GB、bfloat16。推論程式碼裡用了 .cuda(),代表需要 CUDA GPU;作者建議正式環境用 Docker compose 部署,串流推論則是走 WebSocket 搭配 vLLM。
                                                                  • 本期聲量:HF 熱度 426,2.9K 次下載、473 個讚。
                                                                  • 跟同類比:作者自己在 card 附的那張表(480 ms 延遲、80 ms frame length 的設定下)把對照組點名為 Voxtral:AISHELL-1 的字錯誤率(CER)是 1.750% 對 Voxtral 的 16.795%,中文差距很明顯;但反過來看 LibriSpeech test.clean 的字錯誤率(WER)是 3.042% 對 Voxtral 的 2.210%,test.other 是 6.808% 對 5.552%,英文反而略遜一截。照作者自己列出的數據,它的賣點是中文辨識跟串流延遲,不是英文的純準確率。
                                                                  • 怎麼取得:README 給的最短路徑是 transformers 的 pipeline("automatic-speech-recognition", model="Edge0/Audio8-ASR-Infinite", trust_remote_code=True);想跑串流解碼另外有 CLI 範例 python -m audio8_asr_infinite.examples.torch_streaming_decode --checkpoint /path/to/checkpoint --audio sample.wav --language zh --transcription-delay-ms 480。
                                                                  • 連結:Edge0/Audio8-ASR-Infinite
                                                                  • 3. openjev:把 Qwen3.5 改造成專門重排與事實把關的 cross-encoder
                                                                    • 這是什麼:AlexWortega 的 openjev,是把 Qwen3.5 改造成單一 cross-encoder 判斷模型的專案,checkpoint 從 0.8B 一路到 35B-A3B(MoE)都有,MIT 授權,下載不需要申請權限。
                                                                    • 能用在哪些場景:
                                                                      • 自架 RAG 的後端工程師,把檢索回來的十幾段候選丟給它重排:作者 README 有 rerank 範例,用 0.8B 的 checkpoint 幾乎不會增加多少延遲。
                                                                      • 要替回答做事實把關的人,把模型輸出當 hypothesis、檢索到的原文當 premise,讓它判斷 entailment、contradiction 還是 neutral,挑出沒有依據的句子,不用再叫一顆大模型當 judge。
                                                                      • 內容審核或即時互動判定:card 明講用途包含 guard content 和 play games in real time,靠小 checkpoint 就能做到即時回應。
                                                                      • 跑得動嗎:官方沒有標示 VRAM 或硬體門檻。card 只列出可選 checkpoint 規模,0.8B、2B、4B 與 35B-A3B(MoE),基底模型寫的是 Qwen3.5-4B。這裡官方沒給硬體數字,能推得的只有:0.8B 到 4B 這幾檔量級遠比一般對話用大模型小,理論上比較容易塞進消費級顯卡,但這是從參數量推估,不是官方寫明的門檻。
                                                                      • 本期聲量:HF 熱度 441,0 次下載、566 個讚。
                                                                      • 跟同類比:作者把它定位成一顆 cross-encoder 同時做重排、評分與把關,讀入 premise 與 hypothesis 後直接輸出三分類,跟常見的 bi-encoder 向量 reranker 走的是不同路線;成績是作者自報的 MNLI、ANLI,還有自建的 JevBench。
                                                                      • 怎麼取得:card 給的載入範例是 AutoTokenizer 和 AutoModelForSequenceClassification.from_pretrained("AlexWortega/openjev", subfolder="qwen3.5-4b-nli-v5"),權重放在各自的 subfolder 底下;作者說 v5 適合輸出分類決策,v2 用在多模態場景,README 另外還有 SGLang 部署、rerank 與 hypothesis 預測的範例。
                                                                      • 連結:AlexWortega/openjev
                                                                      • 結尾段落

                                                                        這期三顆模型剛好卡住不同的地端痛點:Xing4.0-29B-A4B 補的是旗艦級 agent 能力也塞得進單卡,Audio8-ASR-Infinite 補的是不能上雲的即時字幕,openjev 補的是自架 RAG 最缺、又最不該拿大模型硬幹的重排與把關。如果只能先挑一顆動手,openjev 的 0.8B checkpoint 門檻最低,最快能接進現有的 RAG pipeline 驗證看看。下集再見。

                                                                        節目製作:226 Network

                                                                        團隊用 AI 自己做了小工具,想讓它穩定、好維護?看看 Vibe Coding 架構規劃與陪跑:https://www.226network.com/vibe-coding

                                                                        本節目由 AI 撰稿並以合成語音播出,主持人為虛擬角色。

                                                                        11 min
                                                                      • 🧪 0 下載卻衝上熱度榜首:convaiinnovations/laya 葫蘆裡賣什麼藥|地端 AI 實驗室
                                                                        開場白

                                                                        本週 Hugging Face 熱度冠軍很反直覺:不是哪個新旗艦模型,而是一顆 0 次下載、卻拿下熱度 1530 的迷你分類器 convaiinnovations/laya,葫蘆裡賣什麼藥等一下告訴你。同一週還有下載破 700 萬次的視覺語言模型 Qwen3.8-27B,以及一個不生成文字、專門幫你打分的 LoRA:bespokelabs/Bespoke-Nimble-9B。三個要不要載回自己機器,看完就有答案。

                                                                        本期精選
                                                                        1. convaiinnovations/laya:不生成文字的判斷器,拿來做客服分派、guardrails、發票判讀
                                                                        • 這是什麼:laya 不是聊天模型,是把 state(一段文字或欄位)配上結構化問題丟進去、一次 forward 就回傳答案的路由型分類器。有兩個版本:英文版 laya(421M,ModernBERT-large 骨幹,512 token 脈絡)與多語版 laya-multilingual(322M,mmBERT-base,官方 card 寫支援「100+ languages」,1024 token 可擴到 8k)。授權 Apache-2.0,格式 safetensors。
                                                                        • 能用在哪些場景:
                                                                          1. 客服工單自動分派:官方 card 的示範是把一封 email 的 from、subject、body 當 state 丟進去,配一個 choice 型問題「Which department should handle this request?」,一次呼叫就回傳部門與信心值。card 把這個場景寫作「email triage」與「customer service」。
                                                                          2. 自架 LLM 服務的前置攔截器:card 把「guardrails」「moderation」列進用途,可以用 boolean 型問題(card 範例是「Does the user threaten to cancel?」)在把請求送去昂貴大模型之前先擋一輪,省下呼叫成本。
                                                                          3. 內部後台的結構化判讀:card 另外列出「invoice processing」「security incidents」「agent-trace observability」,適合把發票欄位、資安告警等級這類判斷留在地端,資料不出公司。
                                                                          4. 跑得動嗎:官方 model card 在 Tesla T4 上量的延遲,單題是 32.8ms(多語版)到 39.5ms(英文版),批次 103~332 questions/sec;CPU 部署官方寫的是 193~464ms(需 preload)。card 沒有標示 VRAM 需求,但以 322M~421M 的體積來看,CPU 就能跑並不意外。
                                                                          5. 本期聲量:HF 熱度 1530,本期第一名,下載數 0,讚數 1.6k。
                                                                          6. 跟同類比:card 自己挑的對照組是 TypeSafe Jev,作者宣稱延遲快 7.8 倍、校準好 3 倍(0.081 對 0.246 post-temperature),成本則是 0自架對上Jev的0 自架對上 Jev 的 0自架對上Jev的0.042/1M tokens;但同一份 card 也承認 Jev 在超過 20 個選項的高基數標籤上比較強。以上都是作者自己提出的數字。
                                                                          7. 怎麼取得:官方 card 給的是 pip install laya,接著 from laya import Router → router = Router(preload=True) → router.predict(state, questions),權重會在呼叫時自動從 Hugging Face 拉下來,問題型別 card 列了 choice、score(序數)與 boolean 三種。
                                                                          8. 連結:huggingface.co/convaiinnovations/laya
                                                                          9. 2. Qwen/Qwen3.8-27B:本期唯一塞得進單張消費級顯卡的視覺語言旗艦
                                                                            • 這是什麼:27B 的 dense 視覺語言模型,能理解圖片與影片,Apache-2.0 授權,safetensors 格式。本期一票 300B 起跳的大模型裡,它是少數一般開發者真的載得下來、量化後塞得進單張消費級顯卡的通用旗艦。
                                                                            • 能用在哪些場景:
                                                                              1. 地端的截圖/畫面問答助手:card 描述它是「native vision-language model that understands images and videos」,可以把操作截圖或錄影丟給它問「這個設定畫面哪裡不對」,不必把公司內部畫面上傳雲端服務。
                                                                              2. 整包程式碼的長脈絡審查:card 標示脈絡長度「262,144,可擴到 1,000,000 tokens」,能把一份 API 規格或模組關鍵檔案一次貼進去做重構建議;card 自列的程式能力數字有 SWE-bench Pro 61.7、LiveCodeBench 90.3、Terminal Bench 73.0。
                                                                              3. 自架 GUI/瀏覽器自動化代理的大腦:card 列出的 agentic 成績包含 OSWorld 84.3(電腦操作)、WebArena 64.8(瀏覽器)、AndroidWorld 81.9(手機),適合想在自己機器上跑操作型 agent、不想付 API 費用的人。
                                                                              4. 跑得動嗎:官方 model card 未標示 VRAM 需求,只給了「Browse Quantizations」入口,寫明可用於 llama.cpp、Ollama、LM Studio 或任何相容應用,目前掛著 1,194 個量化版本。實際門檻來自第三方安裝指南(Yotta Labs、The Autodidacts、codersera 等):Q4_K_M 約 17~20GB,可塞進 24GB 的 RTX 4090/3090;16GB 顯卡要降到 Q3,約 13.4GB。這些是第三方數字,不是官方標示。
                                                                              5. 本期聲量:HF 熱度 595,下載量 720 萬次、讚數 1.59 萬,兩項都是本期壓倒性第一,同家族的量化/重打包版本另有 13 個。
                                                                              6. 跟同類比:官方 card 把它拿去對比 Qwen3.6-27B、Qwen3.7-Plus、Muse Glimmer-30B 與 Opus4.6 Max,宣稱在 coding 與 agentic 任務上具競爭力。就地端可行性而言,本期另外兩個同樣熱門的多模態模型體型差很多:DeepSeek-V4.1-Flash 的 card 寫「552B backbone parameters」,GLM-5.3-Flash 的 card 寫「320B total parameters、18B active parameters」,都不是消費級機器扛得起的規模。
                                                                              7. 怎麼取得:官方 card 給的是 vllm serve "Qwen/Qwen3.8-27B",或用 transformers 的 AutoProcessor 搭 AutoModelForMultimodalLM.from_pretrained(..., device_map="auto");想在小顯卡上跑,就照 card 的「Browse Quantizations」連結挑 GGUF 版本丟進 Ollama 或 LM Studio。
                                                                              8. 連結:huggingface.co/Qwen/Qwen3.8-27B
                                                                              9. 3. bespokelabs/Bespoke-Nimble-9B:不生成文字的判斷型 LoRA,把 LLM-as-judge 搬回自己機器
                                                                                • 這是什麼:本期唯一的 LoRA/adapter,約 165 MiB,掛在 Qwen3.5-9B 底模上,把「判斷與評分」做成不生成文字的打分器,授權 Apache-2.0,格式 safetensors。
                                                                                • 能用在哪些場景:
                                                                                  1. RAG 回答的 grounding 檢查:官方 card 的 quickstart 範例是傳入一段退貨條款當 context,配 boolean schema 問「Is this item eligible?」,判斷答案有沒有真的被文件支撐,而不是模型自己掰的。
                                                                                  2. 用 rubric 分數批改自家模型輸出:card 說明 rubric 欄位可用整數字串 enum(如 ["0", "1", "2"])搭配 score_fields,並支援 probability-weighted expected scores,適合團隊把上千筆生成結果排序、挑出最差的來修。
                                                                                  3. 需要格式穩定的大量分類:card 寫它「scores the allowed answer tokens directly」,流程不產生推理或自由格式答案,不會像 prompt 一個大模型當 judge 那樣偶爾吐出解析不了的 JSON。
                                                                                  4. 跑得動嗎:官方 card 對硬體只寫一句「Use a CUDA GPU with BF16 support」,原始訓練跑在 PyTorch 2.8.0 加 CUDA 12.8,沒有標示 VRAM 數字。可確定的是 adapter 本身約 165 MiB,但實際使用還要另外載入 Qwen3.5-9B 底模;Mac 或純 CPU 能不能跑,官方沒有寫。
                                                                                  5. 本期聲量:HF 熱度 139,下載量 1.1k,讚數 141。
                                                                                  6. 跟同類比:要講清楚的是,官方 card 沒有列任何 benchmark,也沒有跟其他模型或做法做比較,訓練資料與方法同樣未說明。唯一能引述的差異來自 card 自述的機制:直接對允許的答案 token 打分、流程中不產生推理內容,這跟一般「prompt 一個大模型當 judge、再解析它吐出來的 JSON」的路線不同。
                                                                                  7. 怎麼取得:官方 card 給兩條路,peft 路線是 AutoModelForCausalLM.from_pretrained("Qwen/Qwen3.5-9B") 後接 PeftModel.from_pretrained(base_model, "bespokelabs/Bespoke-Nimble-9B");另一條是 repo 附的封裝 NimbleModel("nimble-model").score(context=..., schema=...),schema 支援 boolean、enum 與 rubric 分數欄位。
                                                                                  8. 連結:huggingface.co/bespokelabs/Bespoke-Nimble-9B
                                                                                  9. 結尾段落

                                                                                    這期最有意思的共同點是「判斷型」模型正在冒頭:laya 跟 Bespoke-Nimble-9B 都不生成文字,只負責路由、打分、擋請求,這種形狀特別適合地端,因為不需要長脈絡也不需要昂貴推論。至於本期唯一「一般機器真的扛得住」的多模態旗艦,就是下載破 700 萬次的 Qwen3.8-27B。下集再帶你挖新的地端模型。

                                                                                    節目製作:226 Network

                                                                                    團隊用 AI 自己做了小工具,想讓它穩定、好維護?看看 Vibe Coding 架構規劃與陪跑:https://www.226network.com/vibe-coding

                                                                                    本節目由 AI 撰稿並以合成語音播出,主持人為虛擬角色。

                                                                                    8 min
                                                                                  10. 🧪 27B 壓到 8GB:Ternary-Bonsai-2-27B 下載 40 萬次|地端 AI 實驗室
                                                                                    開場白

                                                                                    本期聲量冠軍是 Ternary-Bonsai-2-27B-gguf,官方標榜筆電就能跑 27B、檔案不到 8GB,一週下載 40.5 萬次。同集還有手機級 MiniCPM5-2B,跟 Mac mini 24GB 能跑 35B 的 LoRA:Edge0-35B-A3B-preview。三顆模型各自的硬體門檻跟隱藏但書,等一下一次講給你聽。

                                                                                    本期精選
                                                                                    1. Ternary-Bonsai-2-27B-gguf:把 27B 塞進不到 8GB 的三元量化版
                                                                                    • 這是什麼:這是 prism-ml 針對 Qwen3.8-27B 系列做的三元(ternary)量化 GGUF 版本,27B 參數、Apache-2.0 授權,主打把原本 53.8GB 的 F16 版本大幅瘦身。官方 model card 自述是「5.9 GB language model (down from 54 GB FP16)」。
                                                                                    • 能用在哪些場景:
                                                                                      • 接案工程師手上有客戶的機敏合約或內部文件,不能丟雲端 API,這時候用一台有獨顯的筆電離線跑 27B 級模型做摘要與問答,官方 model card 把用途明講為「privacy-sensitive and offline settings」與「laptop-local 27B agents」。
                                                                                      • 團隊只有一張消費級顯卡,卻想自架內部問答服務。PQ2_0 檔案只有 7.21GB,官方定位是「single-GPU and commodity-GPU serving」,不用為了跑 27B 去租 A100。
                                                                                      • 用 Mac 開發的工程師想要一個支援 thinking/reasoning 模式的本機 coding 助手,官方吞吐表列出 Apple M5 Pro 解碼 28.1 tok/s、M5 Max 47.0 tok/s(皆為 PQ2_0),屬於還能互動的速度區間。
                                                                                      • 跑得動嗎:官方 model card 列出三個檔案:PTQ1_0(dense trits)5.95GB、PQ2_0(2-bit slots)7.21GB,對照 F16 參考版 53.8GB,另有選配的 vision tower(Q8_0)0.63GB。吞吐部分 card 還列出 RTX 5090 129.9 tok/s、H100 SXM 113.9 tok/s(同樣是 PQ2_0 解碼)。要注意的是官方沒有標示最低 RAM/VRAM 下限,這塊沒有數字就不好幫忙猜。
                                                                                      • 本期聲量:HF 熱度 881(40.56 萬次下載、926 個讚),同家族目前另有 2 個量化/重打包版本。
                                                                                      • 跟同類比:作者自己的對照表把它放進同一個 Qwen3.8-27B 量化家族比較:14 項 benchmark 平均 84.78,贏過傳統 IQ2_XXS 的 72.59,只小輸給體積大三倍的 UD-Q4_K_XL(85.18),card 的說法是「far above the conventional IQ2_XXS build at less than two-thirds of its footprint」。不過第三方 MindStudio 的試用心得提到,它在視覺與創意任務表現不錯,但修 bug 跟基本 UI 程式碼生成不太穩定,成績看任務而定。
                                                                                      • 怎麼取得:README 給的指令是 hf download prism-ml/Ternary-Bonsai-2-27B-gguf Ternary-Bonsai-2-27B-PQ2_0.gguf --local-dir .,再用 llama-cli -m ... -ngl 99 -fa on -c 32768 啟動,或用 ollama run hf.co/prism-ml/Ternary-Bonsai-2-27B-gguf:F16。但重要前提是 README 明寫「Stock llama.cpp will not run these files」,要跑起來得先換成 PrismML 自己的 llama.cpp fork,這個坑要先知道再動手裝。
                                                                                      • 連結:huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf
                                                                                      • 2. MiniCPM5-2B:小到能塞進手機的地端 agent 底座
                                                                                        • 這是什麼:OpenBMB 出的 2B 參數模型,Apache-2.0 授權,官方同時備好 GGUF/MLX/GPTQ/LiteRT 四種格式,明確瞄準裝置端與資源受限場景。
                                                                                        • 能用在哪些場景:
                                                                                          • App 開發者想在 Android/iOS 端內建離線助理,不想每個使用者都燒 API 費用。官方直接提供 .litertlm 版本,model card 標示 LiteRT-LM 支援「Android / iOS / desktop / IoT, CPU + GPU」。
                                                                                          • 想自架一個常駐 agent 幫忙整理 log 或呼叫內部 API。官方把用途寫成「local assistants, coding agents, tool-use workflows」,並標示 BFCL v4 工具呼叫得分 66.6。
                                                                                          • 需要在單機上處理長文件(法規、會議逐字稿)但沒有顯卡預算。官方標示原生 131,072 token 長上下文,可用 GPTQ 4bit 版在低階硬體上跑。
                                                                                          • 跑得動嗎:官方沒有標示具體 RAM/VRAM 門檻,model card 也沒有任何 tokens/s 數據。有標示的是格式選項:官方量化倉庫包含 MiniCPM5-2B-GGUF(llama.cpp/Ollama/LM Studio)、MiniCPM5-2B-MLX(Apple Silicon)、MiniCPM5-2B-GPTQ(4bit),card 對硬體的描述僅止於定位語「on-device, local deployment, and resource-constrained scenarios」。這裡只能從 2B 參數量跟四種格式反推它應該跑得動輕量裝置,實際多快官方沒給,這段算推估不算保證。
                                                                                          • 本期聲量:HF 熱度 338(35.72 萬次下載、1.6 千個讚),同家族目前另有 2 個量化/重打包版本。
                                                                                          • 跟同類比:OpenBMB 官方的比較表主張它 34 項平均 53.9,贏過 LFM2.5-2.6B(33.2)、Qwen3.5-2B(28.0)、Gemma-4-E2B-it(24.6),甚至壓過 4B 級的 Qwen3.5-4B(51.1),card 的措辭是「remains competitive with 4B-class models overall」。第三方評測站 eesel AI 與 buildfastwithai 則提醒這是 OpenBMB 自選比較集內的成績,benchmark 領先不等於生產環境可靠,建議拿自己的任務先試。
                                                                                          • 怎麼取得:README 的 transformers 範例是 AutoModelForCausalLM.from_pretrained("openbmb/MiniCPM5-2B", torch_dtype="auto", device_map="auto"),要開服務則官方給 vllm serve openbmb/MiniCPM5-2B --port 8000,走 llama.cpp 則是 llama-server -m MiniCPM5-2B-F16.gguf -a MiniCPM5-2B --port 8080。
                                                                                          • 連結:huggingface.co/openbmb/MiniCPM5-2B
                                                                                          • 3. Edge0-35B-A3B-preview:拿 LoRA adapter 在 Mac mini 上跑 35B
                                                                                            • 這是什麼:Edge0 團隊發的 LoRA/adapter 版本,基底是 35B 的 MoE 模型 Qwen3.6-35B-A3B,用 int4 量化搭配 LoRA 與 prerouter adapter,Apache-2.0 授權,官方明講後端是 MLX、目前鎖定 Apple Silicon。
                                                                                            • 能用在哪些場景:
                                                                                              • 用 Apple Silicon 開發的工程師想在本機跑 35B 級模型做多語問答。官方標示峰值活躍記憶體只要 2.9 GiB,並列出 Mac mini M4 Pro(24GB)解碼 14.9 至 17.7 tok/s 的實測表。
                                                                                              • 想同時服務多種任務又不想每次都重新量化。card 把用途寫成「batch serving via LoRA adapters without re-quantization」,適合要掛多組 adapter 的自架服務。
                                                                                              • VRAM 吃緊但硬碟夠大的邊緣部署情境。card 的定位語是「edge / on-device inference where GPU VRAM is scarce and storage is fast」,官方標示模型總容量 19.6GB。
                                                                                              • 跑得動嗎:官方標示得相當完整:峰值活躍記憶體 2.9 GiB(短上下文)、總儲存 19.6GB,採 4-bit(int4)搭配 LoRA 與 prerouter adapter,後端是 MLX,card 直接寫「currently targets Apple Silicon」,並警告「Long contexts grow the KV cache; use shorter contexts to keep peak memory at 3 GiB」。速度方面官方列出 Mac mini M4 Pro 24GB 解碼 14.9 至 17.7 tok/s、prefill 冷/熱啟動 113/140 tok/s。
                                                                                              • 本期聲量:HF 熱度 250(5.25 萬次下載、3.4 千個讚)。
                                                                                              • 跟同類比:值得點出的是作者只跟自己的 fp16 基底 Qwen3.6-35B-A3B 比,沒有跟其他邊緣推論方案對照:官方表格顯示 int4 版平均 79.2 分,對上 fp16 的 83.2 分,作者自述平均退化 3.9 分。另外 card 自己標明這是「early preview release」,且直言 agent 能力「currently weak」,不適合長程自主任務,這個限制是作者本人寫的,介紹時得一起帶到。
                                                                                              • 怎麼取得:README 要求先裝官方框架 pip install -e 'git+https://github.com/Edge0-AI/edge0.git#egg=edge0[fetch]',再 huggingface-cli download Edge0/Edge0-35b-a3b-preview --local-dir ./Edge0-35b-a3b-preview,然後 edge0 chat --name edge0-35b 對話,或 edge0 serve --port 8085 開 OpenAI 相容 API;card 另有提供 mlx_lm 的 load("Edge0/Edge0-35B-A3B-preview") 走法。
                                                                                              • 連結:huggingface.co/Edge0/Edge0-35B-A3B-preview
                                                                                              • 結尾段落

                                                                                                這三顆選題有個共同點,都在想辦法把大模型塞進小記憶體:Ternary-Bonsai 靠三元量化把 27B 壓到 8GB 內,MiniCPM5-2B 直接瞄準手機格式,Edge0 則是拿 LoRA 在 Mac mini 上推 35B。如果你手上剛好有一台有獨顯的筆電、又要處理不能上雲的文件,Ternary-Bonsai-2-27B-gguf 大概是本期最值得先點進 model card 把門檻看清楚的一個。下週三再來看看又有哪些地端模型冒出頭。

                                                                                                節目製作:226 Network

                                                                                                團隊用 AI 自己做了小工具,想讓它穩定、好維護?看看 Vibe Coding 架構規劃與陪跑:https://www.226network.com/vibe-coding

                                                                                                本節目由 AI 撰稿並以合成語音播出,主持人為虛擬角色。

                                                                                                8 min

                                                                                              About 地端 AI 實驗室

                                                                                              From the publisher's feed

                                                                                              每週三、五精選 1~3 個可以下載到自己機器上跑的開源模型與 LoRA,用輕鬆對話帶你掌握它能用在哪些場景、你的顯卡跑不跑得動、跟同類差在哪。本節目為情報策展,功能與硬體規格一律引述官方 model card,未經我方實測,更多內容請見 (https://blog.markkulab.net)