导语:随着 Flux、DiT、视频生成模型对注意力计算需求暴涨,第三方 SageAttention、FlashAttention 一直是 ComfyUI 玩家首选加速手段。近期 ComfyUI 官方合并 Comfy Kitchen INT8 Attention,作为官方原生注意力后端,无需额外插件、跨 NVIDIA/AMD 平台,成为新一代轻量化加速选择。本文完整梳理原理、实测表现、启用方式、横向对比与避坑指南。
一、什么是 Comfy Kitchen Attention
comfy-kitchen 是 ComfyUI 官方维护的底层工具库,Comfy Kitchen Attention 就是库内实现的 INT8 量化注意力计算内核(int8_attention),由 ComfyUI 作者直接开发并入主干代码,并非第三方插件。
传统 SDPA、FlashAttention、SageAttention 大多基于 FP16/BF16 浮点运算;而 Comfy Kitchen Attention 核心思路:
- 将注意力 QKV 张量在线量化为 INT8 进行矩阵运算;
- 计算完成后反量化回浮点;
- 提供 CUDA 原生内核、ROCm(AMD)内核、Triton 实现、Eager fallback 多后端自动调度;
- 深度嵌入 ComfyUI 原生注意力后端调度器,一条启动参数全局开启,不需要 Model Patch 节点。
核心定位:官方原生、跨 N 卡 / A 卡、开箱即用的 8bit 注意力优化,兼顾速度与显存占用。
二、核心优势
✅ 1. 官方原生集成,兼容性拉满
区别于 SageAttention 需要手动安装、版本不匹配极易报错、更新 ComfyUI 经常炸工作流;Comfy Kitchen 属于项目官方依赖,跟随 ComfyUI 主线同步维护,不存在第三方补丁冲突。
✅ 2. NVIDIA & AMD 显卡同时支持
- NVIDIA:CUDA 原生 int8 kernel
- AMD:ROCm HIP 原生实现 绝大多数第三方注意力加速仅重点适配 N 卡,AMD 用户可选方案极少,这是 Kitchen Attention 一大亮点。
✅ 3. 显存优化 + 推理提速双重收益
INT8 运算天然降低张量内存占用,减少显存读写压力。社区早期 RTX3050 8GB 实测 Flux 工作流:
同等分辨率下对比 SageAttention,迭代耗时进一步下降 10%~15%,峰值显存小幅降低;高分辨率、长序列视频生成场景提升更明显。
✅ 4. 无需节点补丁,全局一键开关
不需要在工作流添加任何 Model Patch 节点,启动命令启用后全局生效,新旧工作流直接兼容,不用修改画布。
三、如何启用 Comfy Kitchen Attention
前置条件
ComfyUI 更新至最新主干版本(≥合并 #15479 PR 版本,2026 年 8 月后新版本),自动携带 comfy-kitchen 依赖。
如果缺失依赖,执行安装:
bash
pip install comfy-kitchen>=0.2.30
启动命令开启
bash
python main.py --use-comfy-kitchen-attention
启动日志出现 Comfy Kitchen Attention backend enabled 即代表生效。
注意:同一时间只能启用一套注意力后端,不要同时叠加
--use-sage-attention/--use-flash-attention,容易引发冲突。
四、主流注意力方案横向对比
表格
| 方案 | 开发者 | 实现方式 | N 卡 | AMD | 是否需要额外安装 | 是否需要工作流节点 | 精度特点 |
|---|---|---|---|---|---|---|---|
| Comfy Kitchen Attention | ComfyUI 官方 | INT8 原生内核 | ✅ | ✅ | 基础依赖,大多无需手动装 | ❌ 启动参数全局开启 | 轻微量化损耗,绝大多数画面无感知 |
| SageAttention | 第三方开源 | INT8 注意力 | ✅ | 有限支持 | ✅ pip 安装 | 可选节点 / 启动参数 | 质量控制优秀,画质损失极低 |
| FlashAttention 2 | DAO-AILab | FP16 优化 | ✅ | 部分支持 | ✅ 编译安装 | ❌ 启动参数 | 无损浮点,显存优化 |
| xFormers | Meta | 内存分片 SDPA | ✅ | ✅ | ✅ | ❌ | 速度中等,兼容性最强 |
| 原生 PyTorch SDPA | Pytorch 官方 | 标准 SDPA | ✅ | ✅ | 内置 | ❌ | 基准速度,显存占用最高 |
适合选择 Comfy Kitchen Attention 的人群
- AMD 显卡(7000/8000 系列 ROCm 用户),缺少稳定加速方案;
- 不想折腾第三方库、频繁遇到 Sage 版本冲突、编译报错;
- 批量跑图、Flux 大分辨率、视频 DiT 模型,追求稳定提速;
- 追求极简环境,尽量减少额外 Python 依赖。
不太推荐优先使用场景
极致画质生产、对细微色彩 / 纹理极其敏感的商业出图,可以优先 FlashAttention。
五、已知局限与避坑清单
- 量化带来微小精度损失 本质 INT8 运算,极端场景(精细皮肤渐变、微小文字)理论上存在画质差异;日常创意生成几乎无法肉眼区分。
- 部分老旧显卡缺少硬件 INT8 加速 算力低于 sm_75(20 系及更早 N 卡),内核会自动降级 Eager 模式,速度反而变慢,老卡不建议开启。
- 注意显存峰值波动 早期版本存在峰值显存异常问题,升级
comfy-kitchen到最新版即可修复;如果开启后出现 OOM,尝试关闭再对比测试。 - 不要多重加速叠加 同时开启多种注意力后端会造成调度混乱、速度下降、随机报错,每次只启用一种。
六、实测调试小技巧
- 想要确认是否生效:观察启动日志搜索
comfy kitchen; - 新旧方案对照测试:固定种子、提示词,分别切换不同注意力后端横向对比速度与画面;
- 画质敏感场景:可以准备两套启动脚本,一套 Kitchen 用于快速迭代出草图,一套 FlashAttention 用于最终成品渲染。
七、总结
Comfy Kitchen Attention 是 ComfyUI 官方补齐原生注意力加速生态的重要更新。
对于 AMD 用户、讨厌第三方库折腾的创作者、批量渲染玩家,它是目前最省心的加速方案;如果你是 N 卡商业出图,可在 SageAttention、FlashAttention、Kitchen 之间根据画质需求自由选择。
随着后续 comfy-kitchen 持续迭代内核优化,未来大概率会成为 ComfyUI 内置的默认备选注意力后端之一。