本文由 辛梓煜@词元二号站(www.ciyuanerhao.com)撰写,转载请注明出处。
快速摘要
如果你用过各种 AI 聊天工具,大概率会有这种感觉:每次打开对话框,它都像第一次见你。你反复告诉它你的工作习惯、你的知识背景、你的偏好风格,但下次对话它又忘光了。这不是你的问题,而是市面上大多数 AI 助手根本不具备"跨会话记忆"和"经验积累"的能力。
Hermes Agent 解决的就是这件事。它由知名 AI 研究机构 Nous Research 在 2026 年 2 月开源发布,核心设计思路只有一个:让 Agent 越用越聪明。它不是那种每次对话从零开始的聊天框,而是一个真正住在你电脑上的自主智能体——它会记住你、记住自己做过什么、从成功经验里自动提炼"技能",下次遇到类似任务直接复用。截至 2026 年 7 月,它在 OpenRouter 的全球 Agent 日活排行榜上已经排到第一,日消耗 token 量超过 2240 亿。
本文我会从零开始,带你走完 Hermes Agent 的完整上手路径:从安装部署、模型配置(包括免费的本地 Ollama 模型)、多 Agent 架构搭建,到核心的技能系统(Skills)和记忆系统原理,最后用一个"赛博学习导师"的实战案例,展示如何打造一个真正懂你、而且越来越懂你的 AI 助手。所有操作我都亲自在 Windows 和 macOS 上验证过,坑在哪、怎么绕,文中都会说清楚。
想看完整拆解,往下翻。
一、为什么你需要一个会自己进化的 AI 助手
我自己折腾 AI 助手这件事,前后差不多两年了。从最早的 ChatGPT 网页版,到后来的各种套壳客户端、开源框架,我统统试过一遍。中间踩过的坑就不展开了,只说一个最核心的痛点:它们全都不记事儿。
注意,我说的"不记事儿"不是指单次对话的上下文窗口——那个现在各家模型都能做到 128K、甚至 1M token。我说的是跨对话的记忆。你今天跟它聊了两个小时,把项目背景、技术栈、个人偏好都交代清楚了。明天你再打开,它一脸茫然地问:"有什么可以帮您的?"
于是你只能把昨天说过的话再说一遍。周而复始。这不是助手,这是个金鱼。
更让我难受的是另一个层面的问题:即使同一个会话内它能帮你完成一个任务——比如写了个爬虫脚本、做了份数据分析——这个"成功经验"也不会被沉淀下来。下次你再让它做类似的事情,它还是从零开始思考、从零开始调用工具。没有任何积累、没有任何进化。
直到我开始用 Hermes Agent,才真正体会到什么叫"养一个助手"。
Hermes Agent 是 Nous Research 在 2026 年 2 月正式开源的自主 AI Agent 项目。Nous Research 这个名字如果你关注开源大模型圈应该不陌生,他们之前发布的 Hermes 系列微调模型在 HuggingFace 上非常受欢迎,HuggingFace 下载量早就破千万了。Hermes Agent 是他们在模型层之上构建的 Agent 框架,2026 年 2 月一经发布就冲到了 GitHub 26K+ stars(截至 2026 年 4 月数据)。
但 star 数不是我关注的重点。我真正在意的是它那个独特的设计理念——闭环学习机制。通俗说就是:Agent 每完成一次任务,会自动评估过程、提炼有效步骤、生成一份可复用的"技能文档"(Skill)。下次遇到类似任务时,它会自动加载这个技能,不需要你重新教一遍。
打个生活中的比方:普通 AI 助手像是每天新来的实习生,你天天得从头教。Hermes Agent 像个老员工,干过的活自己记笔记,下次干得更快更好。
这个机制到底怎么运作的、能进化到什么程度,后面的章节我会结合实操详细拆解。但在那之前,咱们先把东西装起来——毕竟说再多,不如跑起来看看。
二、Hermes Agent 到底是什么:拆解它的底层逻辑
先把概念捋清楚,因为这东西确实跟大多数人对"AI 助手"的想象不太一样。
它不是什么
Hermes Agent 不是 ChatGPT 的桌面客户端,也不是 Cursor 或 Copilot 那样的 IDE 编程插件,更不是你手机上装的那种语音助手 App。它是一套运行在你本地(或服务器)上的自主 Agent 框架。
所谓"自主",意思是它可以自己决定什么时候调用什么工具、执行什么命令、读写什么文件,不需要你每一步都手动确认。当然,这些权限你可以在设置里控制,但核心设计哲学就是:给它目标,让它自己想办法达成。
它到底是什么
用一句话概括:Hermes Agent 是一个带自学习循环的命令行级 AI Agent 运行时。
拆开来看有四个关键词:
- 命令行级:它的核心交互方式是终端命令和对话。但同时它也支持通过消息网关连接到 Telegram、Discord、Slack、WhatsApp、飞书、微信等 14+ 种即时通讯平台。所以虽然底层在命令行跑,但你日常用的时候完全可以对着飞书或者微信发消息来指挥它。
- AI Agent:它不是一个单纯的对话模型,而是一个能调用工具的智能体。内置 70+ 种工具,包括文件读写、网页抓取、代码执行、浏览器操作、数据库查询等等。它可以自己编排这些工具来完成复杂任务。
- 运行时:它不是一次性调用,而是常驻的、持续运行的。你可以给它设定定时任务(Cron),让它每天固定时间自动做某些事。
- 自学习循环:这是它跟其他 Agent 框架最大的区别。每次任务成功执行后,系统会评估是否需要从中提炼出可复用的"技能"(Skill)。提炼出来的技能以人类可读的 Markdown 文件存储,下次遇到相似场景自动触发。
和同类工具比,差在哪、好在哪
下面这个表格是我实际用过几款主流 Agent 工具之后的直观对比:
|
维度 |
Hermes Agent |
OpenClaw |
典型 Chat 客户端 |
|
自学习能力 |
✅ 自动生成技能、持续精炼 |
❌ 依赖社区手动维护技能 |
❌ 无 |
|
记忆持久性 |
三层记忆(工作+FTS5+用户建模) |
基础上下文持久化 |
单会话内 |
|
部署方式 |
一行 curl / 桌面端安装包 |
需手动配置环境 |
App 安装 |
|
模型支持 |
200+ Provider,含本地 Ollama |
主流 Provider |
单一厂商 |
|
消息平台 |
14+ 种(飞书/微信/Telegram等) |
50+ 种 |
通常无 |
|
代码语言 |
Python |
TypeScript |
|
|
GitHub Stars |
26K+ |
346K+ |
|
注意,OpenClaw 的 star 数和社区规模目前还是大很多(毕竟发布时间早得多),但 Hermes Agent 的增长势头非常猛。到 2026 年 6 月,它在 OpenRouter 上的日消耗 token 量已经达到 2240 亿,超过了 OpenClaw 的 1860 亿,排到全球第一。这说明真实用户量和使用深度都在快速赶超。
底层架构的一个关键设计
Hermes Agent 的架构核心是Agent Loop——一个持续运行的循环:接收输入 → 分析意图 → 调用工具 → 评估结果 → 决定是否生成技能 → 回到等待状态。
这个 Loop 不是简单的线性流程。在"评估结果"这一步,系统会检查当前任务过程中调用了多少工具、任务是否成功、中间有没有值得复用的操作模式。如果满足条件(默认是成功调用 5 个以上工具且任务完成),就会触发技能生成流程。
这个设计的意义在于:你不是在"配置"一个 Agent,而是在"养"一个 Agent。 用得越久,它的技能库越丰富,处理任务越高效。这也是为什么官方给它的口号是"The Agent That Grows With You"——一个和你一起成长的智能体。
理解了这些底层设计之后,接下来我们深入看它的三大核心能力系统。
三、核心能力三件套:技能、记忆与多模型协作
Hermes Agent 能实现"越用越聪明",靠的不是单一魔法,而是三个系统环环相扣的配合。我做了一张图来帮大家理解它们的关系:
flowchart TB
User[用户输入任务] --> Loop[Agent Loop 主循环]
Loop --> Memory[记忆系统]
Loop --> Skills[技能系统]
Loop --> Models[多模型调度]
Memory --> |检索相关经验| Loop
Skills --> |匹配可复用技能| Loop
Models --> |分配最优模型执行| Loop
Loop --> |任务成功后| SkillGen[技能生成器]
SkillGen --> |提炼新技能| Skills
Loop --> |所有交互记录| Memory
Memory --> WM[工作记忆<br/>当前会话]
Memory --> FTS5[FTS5 全文搜索<br/>跨会话持久记忆]
Memory --> UM[用户建模<br/>偏好/习惯/身份]
下面逐个拆解。
技能系统(Skills):Agent 的"肌肉记忆"
这是 Hermes Agent 最核心的差异化能力。技能系统的设计原则很简单:把复杂任务中验证有效的操作流程沉淀为可复用文档。
每个 Skill 本质上是一个 Markdown 文件(文件名 SKILL.md),存储在 ~/.hermes/skills/ 目录下。一个典型的 Skill 文件结构大致是这样:
# Skill: 每日科技新闻摘要
## Trigger Conditions
- 用户询问"今天有什么科技新闻"
- 用户提及关键词:"科技新闻"、"tech news"
- 每天早上 8:00 Cron 触发
## Execution Steps
### Step 1: 搜索新闻源
使用 web_search 工具,查询 `今日科技新闻`、`tech news today`
### Step 2: 过滤与排序
从搜索结果中提取 5-10 条最相关的新闻,按重要性排序
### Step 3: 生成摘要报告
将新闻整理为结构化的 Markdown 报告,包含标题、链接、一句话摘要
### Step 4: 保存并推送
将报告保存到本地文件夹,并通过消息平台推送给用户
Skill 除了 SKILL.md 这个核心文件外,还可以附带 references/(参考资料)、templates/(模板文件)、scripts/(可执行脚本)、assets/(静态资源)等子目录。这让你可以把一个完整的工作流封装成一个可移植的技能包。
触发条件是技能系统的精髓。它支持多种触发方式:
- 关键词匹配:用户消息中包含特定词汇
- Cron 定时:按计划时间自动触发
- 手动调用:通过
/skills斜杠命令显式调用 - Agent 自主判断:Agent 分析当前任务后认为某个 Skill 适用
截至 2026 年 4 月,官方的 Skills Hub 上已经有 643 个社区贡献的技能,涵盖开发、运维、数据分析、内容创作、学习辅助等几乎所有技术领域。你可以直接 skills install 安装社区的技能,也可以自己手搓、或者让 Agent 在工作中自动生成。
记忆系统:三层架构让 Agent 不再"失忆"
Hermes Agent 的记忆不是简单地保存聊天记录。它用了三层架构:
|
层级 |
名称 |
存储内容 |
技术实现 |
生命周期 |
|
L1 |
工作记忆 |
当前会话的上下文 |
模型上下文窗口 |
会话结束即释放 |
|
L2 |
持久记忆 |
跨会话的重要信息 |
SQLite + FTS5 全文搜索 |
永久保存 |
|
L3 |
用户建模 |
你的身份、偏好、习惯 |
结构化配置文件 |
永久保存,持续更新 |
工作记忆(L1) 就是模型上下文里存的东西,跟普通聊天一样,会话结束就没了。但关键是 L2 和 L3。
持久记忆(L2) 用了 SQLite 数据库 + FTS5 全文搜索引擎。这意味着 Agent 可以在海量历史交互中快速检索到相关信息。比如三个月前你跟它讨论过一个 Bug 的解决方案,今天你又遇到类似问题,它可以自己搜索到那段历史并参考。
用户建模(L3) 是最让我惊喜的设计。Agent 会在和你交互的过程中,持续构建对你的"认知模型"——你常用的技术栈、工作习惯、偏好风格、甚至你的作息时间。这些信息不是一次性填表填出来的,而是通过一次次对话慢慢"感受"出来的。你在对话中提到"我喜欢用 Python 而不是 Node.js",它会记下;你经常深夜发消息,它会据此调整互动节奏。
三层记忆协同工作的效果是:Agent 既能在当前对话中保持连贯(L1),又能跨会话调用历史经验(L2),还能根据对你的了解来优化交互方式(L3)。
多模型协作:一个好汉三个帮
Hermes Agent 支持接入 200+ 种模型 Provider,包括 OpenAI、Anthropic、Google、DeepSeek、以及本地的 Ollama。你可以为不同的任务分配不同的模型:
# 概念示例:多模型分工策略
model_providers:
primary: # 主力模型 - 处理复杂推理
provider: anthropic
model: claude-sonnet-4-20250514
secondary: # 辅助模型 - 处理日常对话
provider: deepseek
model: deepseek-chat
local: # 本地模型 - 处理隐私任务
provider: ollama
model: qwen3:14b
tool_only: # 纯工具模型 - 网页提取、上下文压缩
provider: ollama
model: qwen3:4b
这种分层策略的好处很明显:复杂的推理任务用顶级模型,简单的文本处理用本地免费模型,省钱又不牺牲能力。 我自己跑下来的经验是,合理配置之后,主力模型的 Token 消耗能减少 40%-60%。
具体怎么配,后面的章节会手把手走一遍。
四、安装与基础设置:60 秒让你的电脑拥有一个 Agent
Hermes Agent 的安装体验让我挺意外的——可以说是我用过的开源 AI 工具里最顺畅的之一。官方提供了两种安装途径:桌面端安装包和命令行一键脚本。
桌面端安装(推荐新手)
直接访问 Hermes Agent 官网(hermes-agent.nousresearch.com),首页就能看到醒目的下载按钮。目前支持的平台:
- macOS 12+:标准 DMG 安装包,拖进 Applications 就完事
- Windows 10/11:原生安装包,双击安装
- Linux(任意发行版):提供 AppImage 格式或通过命令行安装
下载完成后启动应用,它会自动完成一些初始化工作——包括检查运行环境、安装必要的依赖组件。这个过程通常只需要一两分钟。
命令行安装(喜欢折腾的选这个)
如果你用的是 Linux、macOS 或者 WSL2,一行命令搞定:
# Linux / macOS / WSL2
curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash
如果是原生 Windows(PowerShell),用这个:
# Windows PowerShell
iex (irm https://hermes-agent.nousresearch.com/install.ps1)
执行后脚本会自动检测你的系统环境,下载并配置好所有依赖。整个过程不需要你手动装 Python、Node.js 或者 Docker——安装脚本全包了。官方说"60 秒完成安装",在我自己的 MacBook Pro 上实测大概花了 45 秒左右(网络状况好的前提下)。
安装后第一件事:改语言
启动 Hermes Agent 后,默认界面是英文的。如果你习惯看中文,先去右上角的设置(齿轮图标),找到外观(Appearance),把语言改成简体中文。整个界面会立刻切换过来。
这一步虽小,但对于第一次接触 Agent 概念的新手来说,母语界面能大大降低上手门槛。Hermes 的中文翻译质量相当不错,不是机翻那种生硬感。
第一次对话:让它自我介绍
改完语言、回到主界面,你可以直接发一条消息测试:
介绍一下你自己。顺便直接做一件你觉得可以为我做的事情,展示一下自己的综合能力。
我在自己的 Windows 机器上第一次跑这条指令时,它直接对我的电脑做了一次健康体检——检查了内存占用、磁盘空间、系统安全状态,然后生成了一份结构化的诊断报告,包括:
📊 系统健康报告
━━━━━━━━━━━━━━━━
🖥 内存:16GB 总容量,当前使用率 62%,健康
💾 磁盘:C 盘剩余 85GB(总 256GB),建议清理临时文件
🔒 安全:防火墙已开启,最近无异常登录记录
⚠ 建议:C 盘空间偏低,建议释放至少 20GB
这其实就是 Hermes Agent 工作方式的缩影:它不是被动等你问问题,而是会主动调用系统工具去获取信息、分析、然后呈现结果。它住在你的电脑上,直接在你的环境里操作——这个感觉跟打开一个网页版 AI 聊天完全不一样。
安装目录与文件结构
装完之后你可能会好奇它到底装在哪、文件是怎么组织的。这里简单列一下(以 macOS/Linux 为例):
~/.hermes/ # 主配置目录
├── config.yaml # 全局配置文件
├── skills/ # 技能库存放目录
│ ├── <skill-name>/
│ │ ├── SKILL.md # 技能定义文件
│ │ ├── references/ # 参考资料
│ │ └── scripts/ # 可执行脚本
├── memory.db # 持久记忆数据库(SQLite)
├── agents/ # 各 Agent 独立配置
│ ├── default/
│ └── <agent-name>/
└── logs/ # 运行日志
了解这个结构对后续排查问题很有用。比如技能不生效,直接去 skills/ 目录看看文件生成没有;记忆出了问题,memory.db 可以备份或重置。
五、连接大语言模型:API Key 与模型选择策略
Hermes Agent 本身不包含大模型——它是一个框架,需要你接入模型 API 才能工作。好消息是,它支持的模型提供商非常广泛,而且配置过程极其简单。
填入 API Key
安装完成后的主界面右下角有一个入口,点击后会打开模型配置页面。在这里你可以选择模型提供商并填入相应的 API Key。
以 DeepSeek 为例:
- 在提供商列表中选择「DeepSeek」
- 填入你的 API Key
- 选择要使用的模型(如
deepseek-chat或deepseek-reasoner) - 点击保存
搞定。不需要写配置文件、不需要改环境变量,图形界面里点几下就行。
通过 OAuth 授权登录
如果你有某些 AI 服务的会员或包月订阅(比如 ChatGPT Plus、Claude Pro 等),Hermes 还支持通过 OAuth 授权 的方式直接使用你的会员额度。点击"其他供应商",按弹出的链接登录你的账号并授权,就可以直接调用对应的模型了。
这个功能说实话很实用——你不用单独为 Hermes 买 API 额度,直接复用你已有的订阅就行。
模型选择策略:大小搭配,干活不累
接入多个模型之后,关键的来了——怎么分配任务。我的策略很简单,用一张表说清楚:
|
任务类型 |
推荐模型 |
为什么 |
|
复杂推理、代码生成、长文写作 |
Claude Sonnet 4 / DeepSeek-R1 |
推理能力最强 |
|
日常对话、快速问答 |
DeepSeek-V3 / Qwen3-32B |
性价比高,速度快 |
|
网页内容提取 |
Qwen3-4B(本地) |
轻量任务,本地免费 |
|
上下文压缩 |
Qwen3-4B(本地) |
无需顶级推理能力 |
|
隐私数据处理 |
Qwen3-14B(本地) |
数据不出本机 |
|
图片分析 |
本地视觉模型 |
敏感图片本地处理 |
这个"主力+辅助+本地"的三层模型架构,是我自己折腾一段时间后沉淀下来的最佳实践。它的核心逻辑是:复杂的活给顶级模型干,杂活给免费模型干,隐私活给本地模型干。 后面章节我会详细展示怎么把本地的 Ollama 模型配进 Hermes。
说到本地模型,下一章咱们就来装一个。
六、本地模型加速器:Ollama 安装与模型部署
上一章我们提到用"本地模型"来处理杂活和隐私数据。这一章就来实操——给你的电脑装一个完全免费的本地大模型运行环境。
为什么需要本地模型
三个理由,一个比一个重要:
省钱。 云端 API 按 Token 计费,看起来单价不贵,但 Hermes Agent 这种持续运行的 Agent 消耗量远大于手动聊天。网页提取、上下文压缩、定时任务的自动执行……这些"杂活"如果也用顶级模型,月底账单能吓你一跳。而本地模型——跑在你自己显卡上,零额外成本。
隐私。 有些文件你不想上传到任何云端服务器。比如公司内部文档、个人财务数据、或者一些敏感的本地文件。本地模型处理这些数据时,信息完全不离开你的电脑。
离线可用。 断网了照样能跑。虽然很多任务需要联网搜索,但基础的文件处理、代码分析、文本整理这些,完全可以在本地完成。
Ollama 是什么
Ollama 是目前最流行的本地大模型运行框架,开源、跨平台(Windows / mac