開源AI專案Jeff正式發布v1.1版本,針對零樣本分類(zero-shot classification)任務推出多款輕量級微調模型,提供開發者可直接嵌入程式碼的快速決策工具。此次更新涵蓋Jeff-Qwen3.5-0.8B、Jeff-Qwen3.5-2B以及Jeff-Gemma4-E2B三款模型,其中Qwen系列已升級至v1.1,Gemma版本則維持v1.0。
Jeff的核心設計理念是「用程式碼推理,用Jeff決策」。使用者以自然語言描述情境與選項,模型即可在單次前向傳遞(forward pass)中回傳每個選項的校準機率,無需生成文字或額外解析。在NVIDIA RTX PRO 6000上每個決策僅需22毫秒,在Apple M4 Max(MLX)上為28毫秒,展現出極高的執行效率。
在基準測試方面,Jeff採用了4,599題來自五個公開基準的題目,加上JevBench公開困難級(105題,分開評分)。整體表現上,Jeff-Qwen3.5-0.8B獲得79.1%,Jeff-Qwen3.5-2B為82.0%,Jeff-Gemma4-E2B則為81.6%,三者皆逼近甚至超越大型模型Jev的83.0%。在金融文本分類基準Financial PhraseBank上,Jeff-Qwen3.5-0.8B以95.7%、Jeff-Qwen3.5-2B以94.7%的成績大幅領先Jev的77.0%,顯示其在金融領域文本處理上具有顯著優勢。然而,在推理密集型基準(BBH、JudgeBench、JevBench)上,Jeff受限於模型規模,仍明顯落後於大型模型。
v1.1版本的主要改進在於長清單分類能力。v1.0版本的Qwen模型在處理超過26個選項時無法可靠運作,因為訓練資料中從未出現超過19個選項的題目。v1.1新增32,000道包含20至254個選項的訓練題目,使0.8B在長清單測試中的正確率從40.3%大幅躍升至94.7%,2B模型則維持在95.2%的高水準。此外,v1.1將校準誤差從0.049降至0.021(0.8B)與0.026(2B),並改為發布訓練週期結束時的最終檢查點,而非依開發損失最低點選擇,以獲得更穩定的模型狀態。
Jeff支援三種題目類型:choice(從最多254個選項中擇一)、noul(是非題,以機率形式回傳)以及score(在自定義量表上給分)。單一請求中可同時處理多個獨立問題。模型對支援工單分派、用戶意圖識別、內容審核標籤、語音指令、遊戲走法等應用場景皆可靈活應用,且選項無需出現在訓練資料中,使用者只需以文字描述即可讓Jeff進行判斷。
在遊戲測試方面,團隊以Doom、Frogger、Pac-Man三款遊戲作為零樣本效能的另類驗證。每回合以文字描述遊戲狀態與合法行動及其後果,由模型直接選擇。結果顯示Jeff-Qwen3.5-0.8B在Doom中獲得6.55擊殺數,與手寫規則機器人持平;Frogger中達到10.3次過馬路,略低於規則機器人的10.25;Pac-Man則取得57.0顆彈珠,超越未訓練版本的25.8顆。值得注意的是,Jeff-2B在遊戲表現上反而不如0.8B,團隊推測2B模型在未訓練時已較為風險規避,微調後此傾向更加明顯。
Jeff的訓練過程完全在本地硬體上完成,使用單張RTX PRO 6000工作站GPU(0.8B訓練約2小時,2B約3.5小時),合成訓練資料由開源模型Qwen3.8-Flash-Next在兩台DGX Spark上產出,測試則在MacBook上進行,全程未使用雲端GPU。訓練資料中亦無封閉模型的輸出內容,僅在抽樣品質檢核時使用了封閉模型進行比對。
在微調應用方面,團隊以西洋棋為例展示微調威力。使用60萬個由Stockfish標註的Lichess棋盤位置進行訓練,耗時約3.5小時,在1,000道保留測試題上,未訓練的Qwen3.5-0.8B僅解出6.2%,零樣本下提升至15.5%,而經過微調的Jeff-Qwen3.5-0.8B-Chess則達到55.8%,展現約1,000 Elo的棋力,單張GPU可同時應對約600場人類快棋賽。語音導航微調案例則更為驚人:在約11,000個應用專屬範例上訓練不到半小時,保留集準確率即從31.7%提升至95.8%,在M4 Max上每次決策僅需約40毫秒。
Jeff採用與Jev相同的請求格式,但屬於獨立專案,與TypeSafe公司或其產品Jev並無關聯或背書關係。程式碼採MIT授權(包含AutoJev部分),模型權重採Apache 2.0授權,訓練資料則依各來源原始授權釋出。模型權重與程式碼皆已在Hugging Face上開源,但訓練資料因部分來源採用CC BY-SA等分享相同授權而未一併釋出。