2026 年 9 月,Claude Sonnet 5 是 Hermes Agent 日常自动化的实用起点,Claude Opus 5 或 GPT-5.6 Sol 适合更高难度的工作,DeepSeek V4.1 Flash 或 GLM-5.3 Flash 则能让常规运行保持低成本。这些只是起点建议,并非受控的 Hermes 基准测试结果。一个在编程排行榜上看起来很强的模型,仍然可能在长工具循环中失败,或者因为反复重试而花掉更多钱。
Hermes 支持在不更换 Agent 的情况下切换主模型。其模型配置指南还将主模型与用于轻量任务的辅助模型做了区分。也就是说,你可以在推理循环上多花预算,同时为压缩或摘要选择更便宜的模型。以下模型 ID 已于 2026 年 9 月 16 日与 haimaker 实时目录核对;可用性和价格可能随时变动。
应该从哪个模型开始?
建议从 Agent 最常执行的任务入手。在近期的 Hermes 用户报告中,用户为日常工作、高难度推理和本地隐私任务分别使用不同的模型。下表列出了一份简短的候选清单,供你针对自己的提示词、工具和失败场景进行测试。
| Hermes 工作负载 | 首选测试模型 | haimaker 模型 ID | 取舍 |
|---|---|---|---|
| 日常助手和自动化 | Claude Sonnet 5 | anthropic/claude-sonnet-5 | 可靠的高端默认选择;成本高于低成本模型 |
| 生产级编程和复杂调试 | Claude Opus 5 | anthropic/claude-opus-5 | 推理能力上限更高;单次运行成本也更高 |
| 使用 OpenAI 模型进行高难度规划 | GPT-5.6 Sol | openai/gpt-5.6-sol | 另一个高端选项;对比长运行中的 token 用量 |
| 长上下文研究 | Gemini 3.8 Flash | google/gemini-3.8-flash | 输入窗口大;需在你自己的文档上验证回答质量 |
| 通过云端 API 使用开放权重模型 | Kimi K3 | moonshotai/kimi-k3 | 灵活的替代方案;测试提供商延迟和工具调用表现 |
| 低成本后台任务 | DeepSeek V4.1 Flash 或 GLM-5.3 Flash | deepseek/deepseek-v4.1-flash 或 z-ai/glm-5.3-flash | token 成本更低;但重试可能抵消省下的费用 |
这些选择反映的是当前可用性和用户实际使用情况,并不意味着每个模型都通过了相同的 Hermes 测试套件。Hermes 社区 8 月的提供商综述同样将 Sonnet 和 Opus 归入质量第一梯队,而预算有限的用户则更倾向于 DeepSeek 和 GLM。该综述中的价格只是当时的快照,设定预算前请查看实时目录。
如何在 Hermes Agent 中切换模型?
运行 hermes model,选择自定义端点,然后提供 base URL、API 密钥和模型 ID。Hermes 会在配置中保存端点选择。这样你就可以在相同任务上直接对比模型表现,而不是根据无关的基准测试来猜测。
export HAIMAKER_API_KEY=your-haimaker-key
npx -y @haimaker/connect --hermes
@haimaker/connect 会自动写入 Hermes 端点配置并验证密钥。手动配置时,使用 https://api.haimaker.ai/v1 作为 base URL,并从模型目录中复制当前 ID。Hermes 自定义提供商指南涵盖了各提供商的 URL 和超时问题的修复方法。
换模型只是其中一个变量。如果一次研究运行失败了,请先检查搜索、提取、浏览器访问和工具权限,再考虑是不是模型的问题。Hermes 用户曾报告,这些依赖项往往才是影响结果的主导因素。
哪种模型适合哪种工作?
日常自动化: 当 Hermes 处理消息、文件和定时任务时,Claude Sonnet 5 是第一个值得尝试的云端模型。运行一个有代表性的多步骤任务,记录失败的工具调用次数、重试次数和总 token 消耗。如果任务本身是常规性的,先拿低成本模型对比一下,再决定是否用高端模型做默认。
高风险编程: 当 Agent 需要编辑生产仓库或必须从复杂故障中恢复时,Claude Opus 5 和 GPT-5.6 Sol 是候选方案。在相同的问题上用相同的工具做对比。单次成功运行是有参考价值的,但反复运行才能看出模型能否稳定地处理中断和错误。
长文档和研究: Gemini 3.8 Flash 在当前 haimaker 目录中拥有很大的输入窗口。当 Hermes 需要承载大量文档或工具返回结果时,值得测试。不过窗口大不等于召回准确,务必对照源文件验证回答。
常驻后台任务: DeepSeek V4.1 Flash 和 GLM-5.3 Flash 是低成本选项。如果你已经在用 MiniMax M3(minimax/minimax-m3),它也仍然可用。给每个候选模型设定明确的任务边界、重试上限和支出上限。便宜模型如果反复执行失败操作,总花费可能比一次就能搞定的强模型还高。建议保留一个高端模型用于处理升级的复杂任务,而不是把所有任务都交给它。
用一个 haimaker.ai 密钥,在相同的 Hermes 任务上对比这些模型。留下那个能以可接受的总成本可靠完成工作的模型。
用一个密钥测试模型是否应该在本地模型上运行 Hermes?
Hermes 可以使用本地 OpenAI 兼容端点。其本地模型指南建议选择适合你实际内存预算的构建版本,要把上下文状态和运行时缓冲区也算进去。勉强能加载的模型,可能已经没有足够空间来承载长任务所需的上下文了。
当私有数据必须留在本机,或者你已经有合适的硬件时,本地部署才值得考虑。9 月的 Hermes 模型讨论中有用户将本地主模型与云端模型搭配使用,把更难的任务交给云端。在让本地模型无人值守运行之前,请先测试工具调用和上下文处理。我们的 Ollama 编程模型指南涵盖了硬件分级,编程 Agent 最便宜的 API 则覆盖了云端方案。
如何对比最终候选模型?
在每个候选模型上运行相同的三个任务:一个常规自动化、一个长工具序列、一个需要故障恢复的场景。记录完成率、错误工具调用次数、重试次数、耗时和总成本。保持任务指令和工具权限不变,让模型成为唯一变量。如果一个模型只在基准测试中得分高,但在你的实际工作流中表现不佳,那就选能真正完成工作的那个。
Hermes 迭代很快,模型目录也跟着变。配置 Agent 时请在实时目录中重新确认模型 ID,之后每当有看起来不错的新模型出现,就重复一遍这个小型对比测试。
常见问题
2026 年 Hermes Agent 的最佳模型是什么?
Claude Sonnet 5 是日常 Hermes 自动化的可靠起点。任务难度较高时,可切换到 Claude Opus 5 或 GPT-5.6 Sol;常规后台任务则可以试试 DeepSeek V4.1 Flash 或 GLM-5.3 Flash 等低成本模型。最终还是要用你自己的工具密集型任务来验证。
Hermes Agent 中最便宜的可用模型是什么?
DeepSeek V4.1 Flash 和 GLM-5.3 Flash 是 haimaker 目录中当前的低成本云端选项。本地模型可以避免按 token 计费的 API 费用,但需要合适的硬件,且在长工具循环中可能表现不佳。选择默认模型前,请先测试可靠性和总任务成本。
如何更改 Hermes Agent 使用的模型?
运行 hermes model,选择自定义端点,然后输入 base URL、API 密钥和模型 ID。使用 haimaker.ai 时,输入 https://api.haimaker.ai/v1 和实时目录中的模型 ID。你也可以运行 npx -y @haimaker/connect --hermes 来配置端点。
想对比的是 Agent 而非模型?请参阅 Hermes vs Codex。需要配置端点本身?请参阅 Hermes 自定义提供商指南。