地端導入約 9 分鐘

七個開放權重模型實測:2026 年台灣司律一試 300 題

裸模型基準,不等於法律 AI 的最終能力

黃思齊律師
黃思齊律師
法律偵探 Dr.Legal 創辦人・台灣法律 AI 實作者
先講結論

Gemma 4 31B 以 430/600(71.7%)是唯一跨過 374 分門檻的模型。

這是七個非中國系開放權重模型,在不連網、不接 RAG、不用工具條件下的基準測試。它量的是基座模型的法律選擇題能力,不是法律 AI 產品的最終品質,更不是法律意見。

題目
300 題
五科、完整第一試題組
計分
600 分
每題 2 分
通過門檻
374 分
Gemma 4 31B 唯一達標

測的是什麼?刻意先把 RAG 拿掉

這次使用 2026 年(115 年)司法官/律師第一試完整 300 題:公法 75 題、民法/民事訴訟法 80 題、刑法/刑事訴訟法 75 題、商法 55 題、法律英文 15 題。每題 2 分,總分 600 分;第一試門檻為 374 分。

每個模型只收到題幹與選項,以原生聊天模板作答;不連網、不搜尋、不取用 RAG 語料、不呼叫法律工具。這不是要模擬產品使用情境,而是要先隔離「基座模型自己會不會答」:否則 RAG、提示詞、重排序或工作流程帶來的改善,會與模型本身混在一起。

本表是當時的裸模型基準。Gemma 系列以關閉 thinking 的設定比較;GPT-OSS 使用低推理設定。它們是可重複的起點,不是對模型能力的絕對排名。

完整成績:各科答對題數/該科題數(正確率)

模型名稱連至其公開模型卡或發布資訊;第三列為社群 LoRA 衍生模型,非 TAIDE 官方模型。

模型發布說明公法(75)民法/民訴(80)刑法/刑訴(75)商法(55)法律英文(15)總計(600)
Gemma 4 31B2026-03-31Google 通用密集模型54/75 (72.0%)58/80 (72.5%)55/75 (73.3%)33/55 (60.0%)15/15 (100.0%)430/600 (71.7%) ✓
Gemma 4 26B2026-03-31Google MoE 通用模型49/75 (65.3%)42/80 (52.5%)48/75 (64.0%)27/55 (49.1%)15/15 (100.0%)362/600 (60.3%)
Gemma 4 TAIDE 26B2026-06-08繁中 LoRA 衍生模型39/75 (52.0%)34/80 (42.5%)37/75 (49.3%)25/55 (45.5%)12/15 (80.0%)294/600 (49.0%)
Gemma 3 TAIDE 12B2026-02-13TAIDE 官方繁中模型39/75 (52.0%)28/80 (35.0%)35/75 (46.7%)16/55 (29.1%)14/15 (93.3%)264/600 (44.0%)
Nemotron 3 Super 120B2026-03-11NVIDIA 混合 MoE45/75 (60.0%)41/80 (51.2%)44/75 (58.7%)30/55 (54.5%)14/15 (93.3%)348/600 (58.0%)
Llama-3 Taiwan 70B2024-05-31台灣繁中 70B 模型49/75 (65.3%)40/80 (50.0%)43/75 (57.3%)24/55 (43.6%)14/15 (93.3%)340/600 (56.7%)
GPT-OSS 120B2025-08-05開放權重推理模型47/75 (62.7%)34/80 (42.5%)45/75 (60.0%)20/55 (36.4%)13/15 (86.7%)318/600 (53.0%)

這張表真正告訴我們什麼

第一,模型大小、中文化或「法律」標籤,都不是這組題目的充分保證。Gemma 4 31B 在五個科目皆居前段,是唯一達標者;120B 的 Nemotron 3 Super 與 GPT-OSS 並沒有因此超過它。這是一次基準結果,不足以推論所有法律任務都會如此,但足以排除「名稱看起來較法律化,就必然較會答」的直覺。

第二,TAIDE 相關模型這次的裸模型分數較低,不能直接解讀成繁中訓練無效。它可能同時受模型尺寸、對齊方式、提示模板、選擇題輸出格式、是否啟用思考模式與訓練目標影響。要判斷真正原因,必須固定提示、控制推理設定,並逐題檢視錯誤類型。

第三,選擇題通過不等於能解決使用者的法律問題。實務問答還需要正確找回法條與裁判、把事實套進法律要件、清楚標註不確定性,且每個結論必須能回到來源驗證。這正是 企業地端法律 AI 不該只買一個模型、而要驗收整套流程的原因。

下一步:從考試分數走向法律問答品質

這組 300 題會保留為回歸基準;每次換模型、量化、提示模板或推理設定,都能看見基座能力是提升還是退步。下一階段則應另建端到端的真實問題集,至少分開衡量三件事:檢索是否找對(retrieval)、回答是否忠於證據(faithfulness/groundedness)、以及法律結論是否合理(correctness/soundness)。

這也是我們在 台灣法律 MCP 與法律偵探問答中採取「附來源、可回查」設計的理由:模型的流暢說法不能取代可驗證的法律依據。重要案件仍應由合格律師依完整事實與最新法令判斷。

常見問題

哪一個模型通過第一試門檻?

本次七個裸模型中,只有 Gemma 4 31B 得 430/600(71.7%),高於 374 分門檻。這不代表它取得律師資格,也不代表它可獨立處理個案。

為什麼不接 RAG 或網路搜尋?

先把外部工具拿掉,才能知道模型原本的法律知識與推理到哪裡。接上檢索後,量到的是模型、資料、檢索與流程合起來的系統能力;那會是下一個獨立評測。

成績較低,就代表模型不適合繁中法律嗎?

不能這樣下結論。一份 300 題選擇題只能回答特定設定下的基準表現。更完整的判斷需要補上提示模板、推理設定、錯題類型與真實法律問答的端到端測試。

資料與模型來源

本文是技術評測紀錄,不構成法律意見、招生或模型保證。考試題目與作答結果的詮釋均應在其設定與限制內閱讀。