
Sign up to save your podcasts
Or


google/embeddinggemma-2 只有 740M,但官方 model card 寫的是它用同一組 768 維向量,同時扛文字、圖片、影片、音訊四種模態,context window 還拉到 8,192 token。這集也會聊到一個被下載 1.5 萬次、專門把 AI 腔文章改到像真人寫的 jialinyyzz/humanizer,以及一個把 27B 壓進單張 16GB 顯卡就能跑的量化實驗 OrcaSAQ-2-Cyber-27B。手機裝得下的向量搜尋引擎到底能拿來幹嘛,等一下告訴你。
三個選題其實指向同一件事,模型不再只拚參數量,而是拚「怎麼塞進一般人的機器裡」,不管是 740M 的多模態 embedding、12B 的任務型微調,還是 27B 壓到 15.7GB 的量化實驗,省的都是同一塊 VRAM 跟記憶體。如果只能先裝一個來研究,jialinyyzz/humanizer 的量化階梯最完整,8GB 記憶體就能起步。下集再見。
節目製作:226 Network
團隊用 AI 自己做了小工具,想讓它穩定、好維護?看看 Vibe Coding 架構規劃與陪跑:https://www.226network.com/vibe-coding
本節目由 AI 撰稿並以合成語音播出,主持人為虛擬角色。
這週地端模型雷達上最熱門的一顆不是新模型,而是把 177B 等級 MoE 壓成 IQ3 量化的 Qwen3.8-Flash-Next-GSQ-RCO-GGUF,220 萬次下載、617 個讚,作者甚至說 IQ3_S 打平原始 BF16 模型的分數。另一顆主角是 Microsoft 的 FrogNano-4B-2609,9.3 GB 就跑出 SWE-bench 61.5%,但它是不是裝了就能用,等一下告訴你。
這是什麼:IST Austria DASLab 用自家方法做出來的 GGUF 量化版本,底層是 177B 等級的 MoE 模型。GSQ(Gumbel-Softmax Quantization)跟 RCO(Riemannian Constrained Optimization)各有一篇 arXiv 論文(2604.18556、2605.00649),不是社群隨手轉出來的量化包。提供 Q2_0、IQ2_XS、IQ3_XXS、IQ3_S 四檔,授權 Apache-2.0,承襲 base model。
能用在哪些場景:
跑得動嗎:README 下載表標示 Shard 1(權重)Q2_0 37.6 GB、IQ2_XS 39.2 GB、IQ3_XXS 47.0 GB、IQ3_S 54.8 GB,Shard 2(n-gram 查表)28.8 GB 可用記憶體映射留在磁碟。消費級單卡具體能不能跑,官方卡上沒有自己背書:llm-bench.io 網站寫在消費級 GPU 上最高約 36.4 tok/s,另有第三方提到透過 Strata Engine 可從 8 GB VRAM 起跑。這兩個數字都是外部獨立測試站台與第三方工具自己的說法,不是 Qwen3.8-Flash-Next-GSQ-RCO-GGUF 官方驗證過的數字,測試方法、硬體配置是否跟你的機器相同都查不到公開細節,拿來當參考就好,別當成保證。Mac 支援度官方也沒有標示。
本期聲量:HF 熱度 234(220 萬次下載、617 個讚),本期所有候選裡下載數最高的一顆。
跟同類比:作者主張 GSQ 是「closing most of the gap between scalar and vector quantization at 2 to 3 bits」,卻仍能存成標準 GGUF scalar 格式;RCO 則負責在總容量預算下逐 tensor 分派量化型別。要分清楚代表性的是,Hugging Face 討論區有一位使用者留言「效能不如官方版,但作為 IQ3 量化很優秀」,這只是單一使用者的個人體感、樣本數是 1,不是跑分數據,跟卡上那組有完整評測流程支撐的回復率數字不能放在同一個量級看待。
怎麼取得:hf download --include "IQ3_XXS/*" --local-dir .,接著 llama-cli -m IQ3_XXS/Qwen3.8-Flash-Next-GSQ-RCO-IQ3_XXS-00001-of-00002.gguf -lm mmap --lazy-mode on -ngl 99 -p "...";也支援 ollama run hf.co/ 與 LM Studio 直接搜尋 repo 名稱。
連結:Hugging Face
這是什麼:Microsoft 釋出的 46.6 億參數模型,32 層 dense,混合 Gated DeltaNet 與 gated-attention 架構,評測設定下約 131K 上下文,授權 MIT,格式 safetensors。技術報告掛在 arXiv 2609.07925,GitHub repo 是 microsoft/FrogNano。
能用在哪些場景:
跑得動嗎:官方 model card 寫 BF16 檢查點「requires about 9.3 GB for model weights alone, with additional memory needed for runtime state」。但卡上同時註明確切的最低 GPU 型號與 VRAM 配置「still to be validated before release」,官方目前也沒有提供量化版本。社群已有第三方轉換(roman220220/FrogNano-4B-2609-gptq-mlx-jang),但那不是官方產物,穩定性與正確性都未經 Microsoft 驗證。
本期聲量:HF 熱度 105(581 次下載、107 個讚)。
跟同類比:跟同樣走 agent 路線但動輒 27B 起跳的候選(例如本期雷達上的 BAAI/AREX-2、autotrust/JEV-27B-VL)相比,FrogNano 只有 4B。官方卡自己給的對照是同一套流程下 base model 39.4% 對上訓練後 61.5%。至於拿 4B 去對比 GPT-5 mini、Grok 4、Opus 4.1 這類大得多的系統,是 daily.dev 整理與 X 上研究者(Rohan Paul、Minseon Kim)貼文的說法,不是 Microsoft 官方表述。
怎麼取得:GitHub(microsoft/FrogNano,MIT)指令是 uv venv --python 3.12、uv pip install -e .,評測用 frognano-eval run --config frognano/configs/eval/swebench-verified.yaml。這裡有個要先知道的落差:repo 本身不附 vLLM 或本地服務指令,預期你透過 FROGNANO_MODEL_BASE_URL 自己架一個 OpenAI 相容端點,並在 Kubernetes sandbox 內執行任務。換句話說,9.3 GB 只是模型權重本身的顯示記憶體門檻,真的要把它變成「丟一個 issue、它自己改完」的 agent,還得自己兜 harness、agent loop 跟執行沙箱;沒有 K8s 環境、只想雙擊就跑的個人開發者,這段距離要先有心理準備,跟「不連外本地 agent」聽起來的輕鬆程度中間還有一段工程要補。
連結:Hugging Face
這兩顆剛好是兩種取捨:Qwen3.8-Flash-Next-GSQ-RCO-GGUF 用量化把 177B 等級的模型搬到你我架得起來的規模,權重大小跟取得方式都很明確;FrogNano-4B-2609 的顯示記憶體門檻看起來低很多,但想把它接成真正能動手改程式碼的 agent,還得自己補 harness 跟沙箱,這兩件事不能劃等號。如果只是想先試試量化模型的手感,GGUF 那顆現在就能用 Ollama 跑起來;如果對 agent 訓練方法本身更有興趣,FrogNano 的技術報告值得先讀完再評估要不要動工。下週五再來看看地端模型雷達上又冒出什麼新東西。
節目製作:226 Network
團隊用 AI 自己做了小工具,想讓它穩定、好維護?看看 Vibe Coding 架構規劃與陪跑:https://www.226network.com/vibe-coding
本節目由 AI 撰稿並以合成語音播出,主持人為虛擬角色。
Phonon-2 官方宣稱是 900 MB 以下最準的英文語音辨識模型,下載只要 164 MB,官方標示在 M5 MacBook Air 上能跑到 174 倍實時。這集也會看 Cloudflare 自己 post-train 的 9B 模型 clef-flash,以及能自己練 LoRA 的繪圖模型 Nanosaur2-670M,等一下告訴你誰最好上手。
這期三個模型剛好是三種不同切角:clef-flash 把 LLM 輸出收斂成機率、省掉解析層;Phonon-2 把語音辨識壓到 164 MB 塞進筆電;Nanosaur2-670M 則是小到能讓你自己動手練 LoRA。如果只能先挑一個試試看,clef-flash 的 20 個量化版本應該是門檻最低的起點。下集再見。
節目製作:226 Network
團隊用 AI 自己做了小工具,想讓它穩定、好維護?看看 Vibe Coding 架構規劃與陪跑:https://www.226network.com/vibe-coding
本節目由 AI 撰稿並以合成語音播出,主持人為虛擬角色。
這期 Hugging Face 熱度冠軍 Contrastive-LM/CLM-v0.1-8B 不生成文字,靠打分數就讓延遲最多砍 9 倍。同場還有專攻路由審核的 LoRA interfaze-ai/lev,跟免顯卡也能跑的小模型 SupersonicLabs/Julia-1。它憑什麼撐住 52 種語言分類,等一下告訴你。
這三個模型有個共同點:都不是拿來聊天的通用生成模型,而是幫系統做選擇、打分數、分類這種高頻小判斷,省下每次都要叫大模型出馬的成本。如果只能先挑一個動手,CLM-v0.1-8B 的 RAG 重排序場景,大概是台灣工程師最快能接上的一塊拼圖。下集見。
節目製作:226 Network
團隊用 AI 自己做了小工具,想讓它穩定、好維護?看看 Vibe Coding 架構規劃與陪跑:https://www.226network.com/vibe-coding
本節目由 AI 撰稿並以合成語音播出,主持人為虛擬角色。
這週 Hugging Face 熱度榜被小米 MiMo V2.6 家族整個洗版,官方旗艦範例指令要 8 張顯卡起跳,但家族裡的 MiMo-V2.6-Distill-Qwen-9B 卻是唯一一般顯卡有機會跑起來的版本,MIT 授權,還有 llama.cpp 官方團隊親自出的 GGUF。這集另外挑了兩顆同樣能落地的模型:1.2B 就能把發票掃描轉成結構化表格的 TeleOCR,還有純 CPU 就能跑、加新分類不用重新訓練的 GLiNER2.5-Decide,等一下告訴你這三顆各自適合塞進哪種工作流。
這期三顆模型剛好對應三種不同的地端需求:MiMo-V2.6-Distill-Qwen-9B 是唯一擠得進消費級顯卡的小米旗艦血統,TeleOCR 用 1.2B 把文件轉結構化這件事做到能打贏大模型的分數,GLiNER2.5-Decide 則證明分類任務有時候連 GPU 都不用。想先動手裝一個的話,GLiNER2.5-Decide 門檻最低,CPU 就能跑;想省顯卡又要做 coding agent,MiMo-V2.6-Distill-Qwen-9B 值得排進待辦清單。我們下集再見。
節目製作:226 Network
團隊用 AI 自己做了小工具,想讓它穩定、好維護?看看 Vibe Coding 架構規劃與陪跑:https://www.226network.com/vibe-coding
本節目由 AI 撰稿並以合成語音播出,主持人為虛擬角色。
本週 HF 熱度榜冠軍是 Xing4.0-29B-A4B,43K 次下載、1.7K 個讚,29B 參數但每個 token 只啟用 4B,官方教學說單卡就塞得下;這集另外帶了原生串流語音辨識 Audio8-ASR-Infinite,跟專門重排把關的 openjev,等一下告訴你三顆模型官方標示的硬體門檻,以及各自能解決哪些場景的問題。
這期三顆模型剛好卡住不同的地端痛點:Xing4.0-29B-A4B 補的是旗艦級 agent 能力也塞得進單卡,Audio8-ASR-Infinite 補的是不能上雲的即時字幕,openjev 補的是自架 RAG 最缺、又最不該拿大模型硬幹的重排與把關。如果只能先挑一顆動手,openjev 的 0.8B checkpoint 門檻最低,最快能接進現有的 RAG pipeline 驗證看看。下集再見。
節目製作:226 Network
團隊用 AI 自己做了小工具,想讓它穩定、好維護?看看 Vibe Coding 架構規劃與陪跑:https://www.226network.com/vibe-coding
本節目由 AI 撰稿並以合成語音播出,主持人為虛擬角色。
本週 Hugging Face 熱度冠軍很反直覺:不是哪個新旗艦模型,而是一顆 0 次下載、卻拿下熱度 1530 的迷你分類器 convaiinnovations/laya,葫蘆裡賣什麼藥等一下告訴你。同一週還有下載破 700 萬次的視覺語言模型 Qwen3.8-27B,以及一個不生成文字、專門幫你打分的 LoRA:bespokelabs/Bespoke-Nimble-9B。三個要不要載回自己機器,看完就有答案。
這期最有意思的共同點是「判斷型」模型正在冒頭:laya 跟 Bespoke-Nimble-9B 都不生成文字,只負責路由、打分、擋請求,這種形狀特別適合地端,因為不需要長脈絡也不需要昂貴推論。至於本期唯一「一般機器真的扛得住」的多模態旗艦,就是下載破 700 萬次的 Qwen3.8-27B。下集再帶你挖新的地端模型。
節目製作:226 Network
團隊用 AI 自己做了小工具,想讓它穩定、好維護?看看 Vibe Coding 架構規劃與陪跑:https://www.226network.com/vibe-coding
本節目由 AI 撰稿並以合成語音播出,主持人為虛擬角色。
本期聲量冠軍是 Ternary-Bonsai-2-27B-gguf,官方標榜筆電就能跑 27B、檔案不到 8GB,一週下載 40.5 萬次。同集還有手機級 MiniCPM5-2B,跟 Mac mini 24GB 能跑 35B 的 LoRA:Edge0-35B-A3B-preview。三顆模型各自的硬體門檻跟隱藏但書,等一下一次講給你聽。
這三顆選題有個共同點,都在想辦法把大模型塞進小記憶體:Ternary-Bonsai 靠三元量化把 27B 壓到 8GB 內,MiniCPM5-2B 直接瞄準手機格式,Edge0 則是拿 LoRA 在 Mac mini 上推 35B。如果你手上剛好有一台有獨顯的筆電、又要處理不能上雲的文件,Ternary-Bonsai-2-27B-gguf 大概是本期最值得先點進 model card 把門檻看清楚的一個。下週三再來看看又有哪些地端模型冒出頭。
節目製作:226 Network
團隊用 AI 自己做了小工具,想讓它穩定、好維護?看看 Vibe Coding 架構規劃與陪跑:https://www.226network.com/vibe-coding
本節目由 AI 撰稿並以合成語音播出,主持人為虛擬角色。
From the publisher's feed