開源AI分類模型Jeff v1.1發布:小參數高效能零樣本分類,效能逼近大型模型 | AI 驅動的財商語言學習中心
🔥 今日市場熱搜標籤
💡 提示:輸入 4 碼股票代號可精確查找個股情報 按 Enter 立即檢索
⭐ AI 評分 5/10 · ⚖️ 中性平穩 #AI模型 #開源專案 #零樣本分類 #Qwen3.5

開源AI分類模型Jeff v1.1發布:小參數高效能零樣本分類,效能逼近大型模型

🕒 2026/09/29 19:35 🏢 全球財經情報 ⏱️ 閱讀約 7 分鐘 (2,215 字) 👁️ 1 次瀏覽
開源AI分類模型Jeff v1.1發布:小參數高效能零樣本分類,效能逼近大型模型
Tech Tom

Tech Tom 的深度觀點

AI 首席分析師
資深科技產業分析師

專精於半導體、人工智慧與軟體產業分析。深入研究財報與供應鏈,為您拆解科技巨頭的下一步。

開源AI專案Jeff正式發布v1.1版本,針對零樣本分類(zero-shot classification)任務推出多款輕量級微調模型,提供開發者可直接嵌入程式碼的快速決策工具。此次更新涵蓋Jeff-Qwen3.5-0.8B、Jeff-Qwen3.5-2B以及Jeff-Gemma4-E2B三款模型,其中Qwen系列已升級至v1.1,Gemma版本則維持v1.0。

Jeff的核心設計理念是「用程式碼推理,用Jeff決策」。使用者以自然語言描述情境與選項,模型即可在單次前向傳遞(forward pass)中回傳每個選項的校準機率,無需生成文字或額外解析。在NVIDIA RTX PRO 6000上每個決策僅需22毫秒,在Apple M4 Max(MLX)上為28毫秒,展現出極高的執行效率。

在基準測試方面,Jeff採用了4,599題來自五個公開基準的題目,加上JevBench公開困難級(105題,分開評分)。整體表現上,Jeff-Qwen3.5-0.8B獲得79.1%,Jeff-Qwen3.5-2B為82.0%,Jeff-Gemma4-E2B則為81.6%,三者皆逼近甚至超越大型模型Jev的83.0%。在金融文本分類基準Financial PhraseBank上,Jeff-Qwen3.5-0.8B以95.7%、Jeff-Qwen3.5-2B以94.7%的成績大幅領先Jev的77.0%,顯示其在金融領域文本處理上具有顯著優勢。然而,在推理密集型基準(BBH、JudgeBench、JevBench)上,Jeff受限於模型規模,仍明顯落後於大型模型。

v1.1版本的主要改進在於長清單分類能力。v1.0版本的Qwen模型在處理超過26個選項時無法可靠運作,因為訓練資料中從未出現超過19個選項的題目。v1.1新增32,000道包含20至254個選項的訓練題目,使0.8B在長清單測試中的正確率從40.3%大幅躍升至94.7%,2B模型則維持在95.2%的高水準。此外,v1.1將校準誤差從0.049降至0.021(0.8B)與0.026(2B),並改為發布訓練週期結束時的最終檢查點,而非依開發損失最低點選擇,以獲得更穩定的模型狀態。

Jeff支援三種題目類型:choice(從最多254個選項中擇一)、noul(是非題,以機率形式回傳)以及score(在自定義量表上給分)。單一請求中可同時處理多個獨立問題。模型對支援工單分派、用戶意圖識別、內容審核標籤、語音指令、遊戲走法等應用場景皆可靈活應用,且選項無需出現在訓練資料中,使用者只需以文字描述即可讓Jeff進行判斷。

在遊戲測試方面,團隊以Doom、Frogger、Pac-Man三款遊戲作為零樣本效能的另類驗證。每回合以文字描述遊戲狀態與合法行動及其後果,由模型直接選擇。結果顯示Jeff-Qwen3.5-0.8B在Doom中獲得6.55擊殺數,與手寫規則機器人持平;Frogger中達到10.3次過馬路,略低於規則機器人的10.25;Pac-Man則取得57.0顆彈珠,超越未訓練版本的25.8顆。值得注意的是,Jeff-2B在遊戲表現上反而不如0.8B,團隊推測2B模型在未訓練時已較為風險規避,微調後此傾向更加明顯。

Jeff的訓練過程完全在本地硬體上完成,使用單張RTX PRO 6000工作站GPU(0.8B訓練約2小時,2B約3.5小時),合成訓練資料由開源模型Qwen3.8-Flash-Next在兩台DGX Spark上產出,測試則在MacBook上進行,全程未使用雲端GPU。訓練資料中亦無封閉模型的輸出內容,僅在抽樣品質檢核時使用了封閉模型進行比對。

在微調應用方面,團隊以西洋棋為例展示微調威力。使用60萬個由Stockfish標註的Lichess棋盤位置進行訓練,耗時約3.5小時,在1,000道保留測試題上,未訓練的Qwen3.5-0.8B僅解出6.2%,零樣本下提升至15.5%,而經過微調的Jeff-Qwen3.5-0.8B-Chess則達到55.8%,展現約1,000 Elo的棋力,單張GPU可同時應對約600場人類快棋賽。語音導航微調案例則更為驚人:在約11,000個應用專屬範例上訓練不到半小時,保留集準確率即從31.7%提升至95.8%,在M4 Max上每次決策僅需約40毫秒。

Jeff採用與Jev相同的請求格式,但屬於獨立專案,與TypeSafe公司或其產品Jev並無關聯或背書關係。程式碼採MIT授權(包含AutoJev部分),模型權重採Apache 2.0授權,訓練資料則依各來源原始授權釋出。模型權重與程式碼皆已在Hugging Face上開源,但訓練資料因部分來源採用CC BY-SA等分享相同授權而未一併釋出。

⚡ Key Takeaways 核心脈絡提煉

AI 即時量化萃取
  • Jeff v1.1基於Qwen3.5與Gemma 4進行微調,提供0.8B與2B兩種規模,專注於零樣本分類任務,單次推論即可輸出校準後的機率分佈
  • 在五項公開基準測試中,Jeff-Qwen3.5-2B整體得分82.0%,與大型模型Jev的83.0%幾乎持平,且在Financial PhraseBank上以94.7%大幅超越Jev的77.0%
  • 新版本支援最多254個選項的長清單分類,0.8B模型在長清單測試中正確率從40.3%躍升至94.7%,並透過本地硬體訓練,無需仰賴雲端GPU
7/10
AI 數據引證評估
消息來源可信度
內容為GitHub開源專案README,包含具體基準測試數據、模型參數與訓練細節,可透過Hugging Face與GitHub儲存庫驗證,但屬技術發布資訊而非主流財經媒體報導

📈 關聯市場與標的行情走勢

TradingView Live
✅ 文章連結已複製到剪貼簿