Gemma 4 31B 以 430/600(71.7%)是唯一跨過 374 分門檻的模型。
這是七個非中國系開放權重模型,在不連網、不接 RAG、不用工具條件下的基準測試。它量的是基座模型的法律選擇題能力,不是法律 AI 產品的最終品質,更不是法律意見。
測的是什麼?刻意先把 RAG 拿掉
這次使用 2026 年(115 年)司法官/律師第一試完整 300 題:公法 75 題、民法/民事訴訟法 80 題、刑法/刑事訴訟法 75 題、商法 55 題、法律英文 15 題。每題 2 分,總分 600 分;第一試門檻為 374 分。
每個模型只收到題幹與選項,以原生聊天模板作答;不連網、不搜尋、不取用 RAG 語料、不呼叫法律工具。這不是要模擬產品使用情境,而是要先隔離「基座模型自己會不會答」:否則 RAG、提示詞、重排序或工作流程帶來的改善,會與模型本身混在一起。
本表是當時的裸模型基準。Gemma 系列以關閉 thinking 的設定比較;GPT-OSS 使用低推理設定。它們是可重複的起點,不是對模型能力的絕對排名。
完整成績:各科答對題數/該科題數(正確率)
模型名稱連至其公開模型卡或發布資訊;第三列為社群 LoRA 衍生模型,非 TAIDE 官方模型。
| 模型 | 發布 | 說明 | 公法(75) | 民法/民訴(80) | 刑法/刑訴(75) | 商法(55) | 法律英文(15) | 總計(600) |
|---|---|---|---|---|---|---|---|---|
| Gemma 4 31B | 2026-03-31 | Google 通用密集模型 | 54/75 (72.0%) | 58/80 (72.5%) | 55/75 (73.3%) | 33/55 (60.0%) | 15/15 (100.0%) | 430/600 (71.7%) ✓ |
| Gemma 4 26B | 2026-03-31 | Google MoE 通用模型 | 49/75 (65.3%) | 42/80 (52.5%) | 48/75 (64.0%) | 27/55 (49.1%) | 15/15 (100.0%) | 362/600 (60.3%) |
| Gemma 4 TAIDE 26B | 2026-06-08 | 繁中 LoRA 衍生模型 | 39/75 (52.0%) | 34/80 (42.5%) | 37/75 (49.3%) | 25/55 (45.5%) | 12/15 (80.0%) | 294/600 (49.0%) |
| Gemma 3 TAIDE 12B | 2026-02-13 | TAIDE 官方繁中模型 | 39/75 (52.0%) | 28/80 (35.0%) | 35/75 (46.7%) | 16/55 (29.1%) | 14/15 (93.3%) | 264/600 (44.0%) |
| Nemotron 3 Super 120B | 2026-03-11 | NVIDIA 混合 MoE | 45/75 (60.0%) | 41/80 (51.2%) | 44/75 (58.7%) | 30/55 (54.5%) | 14/15 (93.3%) | 348/600 (58.0%) |
| Llama-3 Taiwan 70B | 2024-05-31 | 台灣繁中 70B 模型 | 49/75 (65.3%) | 40/80 (50.0%) | 43/75 (57.3%) | 24/55 (43.6%) | 14/15 (93.3%) | 340/600 (56.7%) |
| GPT-OSS 120B | 2025-08-05 | 開放權重推理模型 | 47/75 (62.7%) | 34/80 (42.5%) | 45/75 (60.0%) | 20/55 (36.4%) | 13/15 (86.7%) | 318/600 (53.0%) |
這張表真正告訴我們什麼
第一,模型大小、中文化或「法律」標籤,都不是這組題目的充分保證。Gemma 4 31B 在五個科目皆居前段,是唯一達標者;120B 的 Nemotron 3 Super 與 GPT-OSS 並沒有因此超過它。這是一次基準結果,不足以推論所有法律任務都會如此,但足以排除「名稱看起來較法律化,就必然較會答」的直覺。
第二,TAIDE 相關模型這次的裸模型分數較低,不能直接解讀成繁中訓練無效。它可能同時受模型尺寸、對齊方式、提示模板、選擇題輸出格式、是否啟用思考模式與訓練目標影響。要判斷真正原因,必須固定提示、控制推理設定,並逐題檢視錯誤類型。
第三,選擇題通過不等於能解決使用者的法律問題。實務問答還需要正確找回法條與裁判、把事實套進法律要件、清楚標註不確定性,且每個結論必須能回到來源驗證。這正是 企業地端法律 AI 不該只買一個模型、而要驗收整套流程的原因。
下一步:從考試分數走向法律問答品質
這組 300 題會保留為回歸基準;每次換模型、量化、提示模板或推理設定,都能看見基座能力是提升還是退步。下一階段則應另建端到端的真實問題集,至少分開衡量三件事:檢索是否找對(retrieval)、回答是否忠於證據(faithfulness/groundedness)、以及法律結論是否合理(correctness/soundness)。
這也是我們在 台灣法律 MCP 與法律偵探問答中採取「附來源、可回查」設計的理由:模型的流暢說法不能取代可驗證的法律依據。重要案件仍應由合格律師依完整事實與最新法令判斷。
常見問題
哪一個模型通過第一試門檻?
本次七個裸模型中,只有 Gemma 4 31B 得 430/600(71.7%),高於 374 分門檻。這不代表它取得律師資格,也不代表它可獨立處理個案。
為什麼不接 RAG 或網路搜尋?
先把外部工具拿掉,才能知道模型原本的法律知識與推理到哪裡。接上檢索後,量到的是模型、資料、檢索與流程合起來的系統能力;那會是下一個獨立評測。
成績較低,就代表模型不適合繁中法律嗎?
不能這樣下結論。一份 300 題選擇題只能回答特定設定下的基準表現。更完整的判斷需要補上提示模板、推理設定、錯題類型與真實法律問答的端到端測試。
- 題組:2026 年(115 年)司法官/律師第一試完整 300 題;計分與門檻依該年度考試制度。
- 模型資訊:Google Gemma、TAIDE Gemma 3、NVIDIA Nemotron、Llama-3 Taiwan、GPT-OSS 公開發布資訊。
本文是技術評測紀錄,不構成法律意見、招生或模型保證。考試題目與作答結果的詮釋均應在其設定與限制內閱讀。