开发者必看:vLLM 与 Hermes Agent 默认端口详解(部署避坑)

13次阅读
没有评论

在本地部署大模型推理、搭建AI智能体服务时,vLLM(高性能推理引擎)和 Hermes Agent(可编程AI智能体运行时)是高频组合工具。很多新手部署报错、服务访问失败、端口冲突,核心原因都是不熟悉二者的默认端口规则、服务区分和自定义方式。

今天一文讲透 vLLM、Hermes 官方默认端口、对应服务用途、启动命令、端口修改方法,帮大家彻底避开部署踩坑。

一、vLLM 默认端口:统一 8000(推理API服务)

vLLM 作为主流的高速大模型推理服务框架,所有官方版本的默认服务端口固定为 8000,也是业界通用标准端口,无版本差异。

1. 端口对应服务

默认启动后,vLLM 会在 http://localhost:8000 开启兼容 OpenAI 协议的 HTTP 推理服务,支持模型列表查询、文本补全、对话补全等核心接口,是本地、服务器部署的标准访问地址。

2. 标准启动命令(默认端口)

vllm serve 你的模型路径/模型名称

启动成功后,可通过 http://127.0.0.1:8000/v1 直接对接各类AI客户端、智能体框架。

3. 自定义端口(解决8000端口冲突)

如果本地8000端口被FastAPI、Jupyter、其他模型服务占用,可通过 --port 参数一键修改端口,同时支持 --host 配置外网访问:

# 自定义端口为8080,允许外网访问
vllm serve 模型名称 --host 0.0.0.0 --port 8080

4. 常见报错避坑

出现 Address already in use 报错,百分百是8000端口被占用。优先排查本地常驻服务、历史未关闭的vLLM进程,或直接更换端口重启即可。

二、Hermes Agent 默认端口:双端口分工(API+控制台)

Hermes 是 Nous Research 推出的可编程AI智能体运行时,和单端口的vLLM不同,它采用双端口分离设计,分别承载API服务和Web可视化控制台,端口固定且用途明确,全网通用标准配置。

1. 核心默认端口明细

  • API服务端口:8642(核心接口端口) 默认绑定 127.0.0.1:8642,开启兼容OpenAI的智能体API服务,用于对接vLLM推理服务、上下游业务程序,是智能体交互的核心端口。默认关闭API服务,需手动开启配置。
  • Web控制台端口:9119(可视化管理端口) 用于浏览器访问Hermes后台面板,支持智能体配置、任务管理、日志查看、插件调试等可视化操作,是运维管理的核心入口。

2. 端口配置方式(环境变量)

Hermes 支持通过环境变量自定义双端口,无需修改源码,适配多服务并行部署场景:

# 自定义API端口
export API_SERVER_PORT=8643
# 自定义控制台端口
export HERMES_DASHBOARD_PORT=9120
# 重启服务生效
hermes start

3. 标准访问地址

  • API接口地址:http://localhost:8642/v1
  • Web管理后台:http://localhost:9119

三、vLLM + Hermes 组合部署端口总结

二者端口无默认冲突,是绝佳的部署组合,新手可直接套用以下标准配置,无需额外调整:

工具 默认端口 服务用途 核心访问地址
vLLM 8000 大模型推理API服务 http://127.0.0.1:8000/v1
Hermes API 8642 AI智能体接口服务 http://127.0.0.1:8642/v1
Hermes 控制台 9119 可视化运维后台 http://127.0.0.1:9119

四、最佳部署实践建议

  1. 默认端口优先使用:vLLM 8000、Hermes 8642/9119 默认无冲突,常规部署无需改端口,适配绝大多数框架对接规则,减少兼容问题。
  2. 冲突快速处理:仅当端口被其他服务占用时,通过命令行(vLLM)或环境变量(Hermes)自定义端口,不要随意修改默认配置。
  3. 内外网访问区分:本地调试默认 127.0.0.1 即可;服务器/局域网部署时,vLLM 配置 --host 0.0.0.0,Hermes 修改绑定Host为0.0.0.0,实现外网访问。
  4. 服务分层调用:业务层调用Hermes 8642智能体接口,Hermes 内部转发调用vLLM 8000推理接口,分层清晰、排查问题更高效。

结尾

掌握 vLLM 和 Hermes 的默认端口规则,是搭建本地大模型推理、AI智能体服务的基础。绝大多数部署报错、对接失败的问题,都能通过核对端口、排查冲突快速解决。后续多模型、多智能体集群部署时,也可基于这套端口规范统一配置,提升项目稳定性。

正文完
可以使用微信扫码关注公众号(ID:xzluomor)
post-qrcode
 0
评论(没有评论)
验证码