在本地部署大模型推理、搭建AI智能体服务时,vLLM(高性能推理引擎)和 Hermes Agent(可编程AI智能体运行时)是高频组合工具。很多新手部署报错、服务访问失败、端口冲突,核心原因都是不熟悉二者的默认端口规则、服务区分和自定义方式。
今天一文讲透 vLLM、Hermes 官方默认端口、对应服务用途、启动命令、端口修改方法,帮大家彻底避开部署踩坑。
一、vLLM 默认端口:统一 8000(推理API服务)
vLLM 作为主流的高速大模型推理服务框架,所有官方版本的默认服务端口固定为 8000,也是业界通用标准端口,无版本差异。
1. 端口对应服务
默认启动后,vLLM 会在 http://localhost:8000 开启兼容 OpenAI 协议的 HTTP 推理服务,支持模型列表查询、文本补全、对话补全等核心接口,是本地、服务器部署的标准访问地址。
2. 标准启动命令(默认端口)
vllm serve 你的模型路径/模型名称
启动成功后,可通过 http://127.0.0.1:8000/v1 直接对接各类AI客户端、智能体框架。
3. 自定义端口(解决8000端口冲突)
如果本地8000端口被FastAPI、Jupyter、其他模型服务占用,可通过 --port 参数一键修改端口,同时支持 --host 配置外网访问:
# 自定义端口为8080,允许外网访问
vllm serve 模型名称 --host 0.0.0.0 --port 8080
4. 常见报错避坑
出现 Address already in use 报错,百分百是8000端口被占用。优先排查本地常驻服务、历史未关闭的vLLM进程,或直接更换端口重启即可。
二、Hermes Agent 默认端口:双端口分工(API+控制台)
Hermes 是 Nous Research 推出的可编程AI智能体运行时,和单端口的vLLM不同,它采用双端口分离设计,分别承载API服务和Web可视化控制台,端口固定且用途明确,全网通用标准配置。
1. 核心默认端口明细
- API服务端口:8642(核心接口端口) 默认绑定
127.0.0.1:8642,开启兼容OpenAI的智能体API服务,用于对接vLLM推理服务、上下游业务程序,是智能体交互的核心端口。默认关闭API服务,需手动开启配置。 - Web控制台端口:9119(可视化管理端口) 用于浏览器访问Hermes后台面板,支持智能体配置、任务管理、日志查看、插件调试等可视化操作,是运维管理的核心入口。
2. 端口配置方式(环境变量)
Hermes 支持通过环境变量自定义双端口,无需修改源码,适配多服务并行部署场景:
# 自定义API端口
export API_SERVER_PORT=8643
# 自定义控制台端口
export HERMES_DASHBOARD_PORT=9120
# 重启服务生效
hermes start
3. 标准访问地址
- API接口地址:
http://localhost:8642/v1 - Web管理后台:
http://localhost:9119
三、vLLM + Hermes 组合部署端口总结
二者端口无默认冲突,是绝佳的部署组合,新手可直接套用以下标准配置,无需额外调整:
| 工具 | 默认端口 | 服务用途 | 核心访问地址 |
|---|---|---|---|
| vLLM | 8000 | 大模型推理API服务 | http://127.0.0.1:8000/v1 |
| Hermes API | 8642 | AI智能体接口服务 | http://127.0.0.1:8642/v1 |
| Hermes 控制台 | 9119 | 可视化运维后台 | http://127.0.0.1:9119 |
四、最佳部署实践建议
- 默认端口优先使用:vLLM 8000、Hermes 8642/9119 默认无冲突,常规部署无需改端口,适配绝大多数框架对接规则,减少兼容问题。
- 冲突快速处理:仅当端口被其他服务占用时,通过命令行(vLLM)或环境变量(Hermes)自定义端口,不要随意修改默认配置。
- 内外网访问区分:本地调试默认
127.0.0.1即可;服务器/局域网部署时,vLLM 配置--host 0.0.0.0,Hermes 修改绑定Host为0.0.0.0,实现外网访问。 - 服务分层调用:业务层调用Hermes 8642智能体接口,Hermes 内部转发调用vLLM 8000推理接口,分层清晰、排查问题更高效。
结尾
掌握 vLLM 和 Hermes 的默认端口规则,是搭建本地大模型推理、AI智能体服务的基础。绝大多数部署报错、对接失败的问题,都能通过核对端口、排查冲突快速解决。后续多模型、多智能体集群部署时,也可基于这套端口规范统一配置,提升项目稳定性。