2026 年 9 月的 Hermes Agent,Claude Sonnet 5 是日常自動化的穩妥起點,Claude Opus 5 或 GPT-5.6 Sol 適合更困難的工作,而 DeepSeek V4.1 Flash 或 GLM-5.3 Flash 則能讓例行執行保持低成本。這些只是起點建議,並非受控的 Hermes 基準測試結果。一個在編碼排行榜上看起來很強的模型,仍然可能在長時間工具迴圈中失敗,或因重試而產生更高成本。
Hermes 允許您在不更換 agent 的情況下變更主模型。其模型設定指南也將主模型與用於較小工作的輔助模型分開。也就是說,您可以在推理迴圈上投入較多成本,同時為壓縮或摘要選用較便宜的模型。以下模型 ID 已於 2026 年 9 月 16 日對照 haimaker 即時目錄確認;可用性和價格可能隨時變動。
應該從哪個模型開始?
從您的 agent 最常執行的任務開始。根據近期的 Hermes 使用者回報,大家會針對日常工作、困難推理和本機隱私任務使用不同模型。下表提供一份簡短清單,供您針對自己的提示詞、工具和失敗案例進行測試。
| Hermes 工作負載 | 建議優先測試的模型 | haimaker 模型 ID | 取捨 |
|---|---|---|---|
| 日常助理與自動化 | Claude Sonnet 5 | anthropic/claude-sonnet-5 | 可靠的高階預設選項;成本高於預算型模型 |
| 正式環境編碼與困難除錯 | Claude Opus 5 | anthropic/claude-opus-5 | 推理能力天花板更高;每次執行成本較高 |
| 使用 OpenAI 模型進行困難規劃 | GPT-5.6 Sol | openai/gpt-5.6-sol | 另一個高階選項;比較長時間執行的 token 用量 |
| 長上下文研究 | Gemini 3.8 Flash | google/gemini-3.8-flash | 大型輸入視窗;請用您的文件驗證回答品質 |
| 透過雲端 API 使用開放權重模型 | Kimi K3 | moonshotai/kimi-k3 | 彈性的替代方案;測試供應商延遲與工具呼叫表現 |
| 預算型背景工作 | DeepSeek V4.1 Flash 或 GLM-5.3 Flash | deepseek/deepseek-v4.1-flash 或 z-ai/glm-5.3-flash | 較低的 token 成本;重試可能抵銷省下的成本 |
這些選擇反映目前的可用性和使用回報,並不表示每個模型都通過了相同的 Hermes 測試套件。Hermes 社群八月的供應商總覽也將 Sonnet 和 Opus 列在品質層級,而預算型使用者則偏好 DeepSeek 和 GLM。該總覽中的價格僅為當時的快照,設定預算前請查看即時目錄。
如何在 Hermes Agent 中切換模型?
執行 hermes model,選擇自訂端點,並提供 base URL、API 金鑰和模型 ID。Hermes 會將端點選擇保留在其設定中。這樣就能在同一任務上比較模型,而不是從不相關的基準測試來推測表現。
export HAIMAKER_API_KEY=your-haimaker-key
npx -y @haimaker/connect --hermes
@haimaker/connect 會寫入 Hermes 端點設定並驗證金鑰。若需手動設定,請使用 https://api.haimaker.ai/v1 作為 base URL,並從模型目錄複製目前的 ID。Hermes 自訂供應商指南涵蓋各供應商的 URL 和逾時修正。
變更模型只是其中一個變數。如果研究任務失敗,請先檢查搜尋、擷取、瀏覽器存取和工具權限,再歸咎於模型。Hermes 使用者曾回報,這些環節往往才是影響結果的主因。
哪種模型適合哪種工作?
日常自動化: 當 Hermes 處理訊息、檔案和排程任務時,Claude Sonnet 5 是第一個值得嘗試的雲端模型。執行一個典型的多步驟任務,統計失敗的工具呼叫、重試次數和總 token 數。如果任務屬於例行性質,在確定使用高階預設之前,先與預算型模型比較。
高風險編碼: 當 agent 編輯正式環境儲存庫或必須從複雜的錯誤中恢復時,Claude Opus 5 和 GPT-5.6 Sol 是候選方案。用相同的問題和相同的工具來比較它們。單次成功執行雖有參考價值,但重複執行才能確認模型能否穩定處理中斷和錯誤。
長文件與研究: Gemini 3.8 Flash 在目前的 haimaker 目錄中擁有大型輸入視窗。當 Hermes 需要處理大量文件或工具回傳結果時,值得測試。大型輸入視窗並不保證檢索的準確度;請對照來源檔案驗證回答。
持續運作的背景工作: DeepSeek V4.1 Flash 和 GLM-5.3 Flash 是低成本選項。如果您已在使用,MiniMax M3(minimax/minimax-m3)仍然可用。為每個候選模型設定範圍有限的任務、重試上限和支出上限。一個重複失敗動作的便宜模型,可能比一次就完成的更強模型花費更多。保留一個高階模型以因應困難任務,而非將每個任務都交給它。
使用一個 haimaker.ai 金鑰,在同一個 Hermes 任務上比較這些模型。保留能以可接受的總成本可靠完成工作的模型。
用一個金鑰測試模型應該在本機模型上執行 Hermes 嗎?
Hermes 可以使用本機 OpenAI 相容端點。其本機模型指南建議選擇符合您實際記憶體預算的版本,包括上下文狀態和執行階段緩衝區。一個勉強能載入的模型,可能沒有足夠空間容納長時間 agent 執行所需的上下文。
當隱私資料必須留在您的機器上,或您已擁有合適硬體時,本機使用是合理的。九月的 Hermes 模型討論中有使用者將本機主模型與雲端模型搭配使用,以處理更困難的任務。在讓本機模型無人看管運作之前,請先測試工具呼叫和上下文處理。我們的 Ollama 編碼模型指南涵蓋硬體層級,編碼 agent 最便宜的 API 則涵蓋雲端方案。
如何比較最終候選模型?
對每個候選模型執行相同的三個任務:一個例行自動化、一個長時間工具序列,以及一個需要恢復的失敗情境。記錄完成率、錯誤工具呼叫、重試次數、耗時和總成本。保持任務指示和工具存取不變,讓模型成為主要變數。如果一個模型只在基準測試上勝出卻在您的工作流程中失敗,請選擇能完成您工作的那個。
Hermes 更新快速,模型目錄也隨之變動。設定 agent 時請在即時目錄中重新確認模型 ID,然後當新模型看起來有潛力時,重複這個小型比較。
常見問題
2026 年 Hermes Agent 的最佳模型是什麼?
Claude Sonnet 5 是日常 Hermes 自動化的穩妥起點。當困難任務值得付出更高成本時,改用 Claude Opus 5 或 GPT-5.6 Sol;對於例行背景工作,可測試 DeepSeek V4.1 Flash 或 GLM-5.3 Flash 等預算型模型。您自己的工具密集型任務才是最終考驗。
Hermes Agent 中運作良好且最便宜的模型是什麼?
DeepSeek V4.1 Flash 和 GLM-5.3 Flash 是 haimaker 目錄中目前的低成本雲端選項。本機模型可避免按 token 計費的 API 費用,但需要合適的硬體,且可能在長時間工具迴圈中表現不佳。選擇預設模型前,請先測試可靠度與整體任務成本。
如何變更 Hermes Agent 使用的模型?
執行 hermes model,選擇自訂端點,並輸入 base URL、API 金鑰和模型 ID。搭配 haimaker.ai 使用時,請使用 https://api.haimaker.ai/v1 和即時目錄中的模型 ID。您也可以執行 npx -y @haimaker/connect --hermes 來設定端點。
想比較的是 agent 而非模型?請參閱 Hermes vs Codex。正在設定端點本身?請參閱 Hermes 自訂供應商指南。