一、完整报错现象
近期在Windows平台使用ComfyUI运行视频工作流时,触发节点执行错误,核心报错信息如下:
Node ID: 19
Node Type: SamplerCustom
异常类型: subprocess.CalledProcessError
关键提示: Workflow too large. Please manually upload the workflow from local file system.
表面看似工作流文件过大导致的上传问题,实则为底层编译报错引发的节点执行崩溃,并非单纯的工作流体积问题。
二、深度根因分析
1. 核心崩溃原因
本次报错并非工作流本身故障,真实问题为:Windows 平台下 Triton 调用 tcc.exe 编译 cuda_utils.c 文件失败,属于环境兼容性编译错误。
2. 报错触发源头
该错误由 comfyui-kjnodes 插件中的 SageAttention(智慧注意力) 节点强制触发。该节点会主动调用Triton编译链路,在特定环境下直接导致采样器节点(SamplerCustom)执行中断。
3. 高危兼容环境组合
本次出问题的环境搭配,是Windows ComfyUI的经典坑位组合:
重点说明:模型本身、采样器节点本身无任何功能故障,所有崩溃问题均来自 Windows 端 Triton+tcc 编译链路的兼容性缺陷。
三、关键认知纠正
很多人会被日志中的 Workflow too large 误导,误以为是工作流文件过大、需要拆分或手动上传文件,实则为虚假报错提示。
真实逻辑:底层Triton编译失败导致节点进程异常终止,程序捕获异常后抛出了错误的兜底提示,属于日志误导性问题。无需处理工作流文件大小、无需重新上传工作流。
四、极简有效解决方案
针对Windows平台该固定兼容问题,最优解无需降级环境、无需重装CUDA/Python,仅需关闭触发问题的节点功能:
禁用/移除工作流中 comfyui-kjnodes 的 SageAttention 注意力优化节点
替换为 Wan2.1 视频模型原生PyTorch注意力机制即可正常运行。
五、性能答疑(为什么不用SageAttention也够用?)
很多用户担心移除SageAttention后视频生成速度变慢,这里针对性说明:
在双4090显卡配置下,Wan2.1视频模型的原生PyTorch注意力机制,渲染速度、生成效率完全满足日常出图、视频生成需求,性能损耗几乎无感知。
反观Windows平台强行开启SageAttention,会持续面临Triton编译报错、启动失败、节点崩溃、环境冲突等一系列问题,得不偿失。
六、长期避坑总结(Windows ComfyUI用户必看)
- Windows优先规避Triton编译类功能:Triton+tcc编译器在Windows端适配极差,高版本Python+新CUDA组合下,极易触发cuda_utils.c编译失败;
- 慎用SageAttention第三方优化节点:Windows环境不建议强行开启该优化,Linux服务器环境可正常使用;
- 拒绝被日志误导:出现
Workflow too large伴随SamplerCustom报错时,优先排查注意力节点、Triton编译问题,而非工作流文件; - 本地显卡优先原生机制:40系及以上高端显卡,模型原生注意力性能足够,无需第三方插件强行优化。
七、适用场景
本文方案适配所有 Windows + Python3.13 + CUDA13.0 环境下,使用ComfyUI运行Wan2.1视频模型、因SageAttention触发的Triton编译报错、SamplerCustom节点崩溃问题。