用 Gradio Workflow 重造 AUTOMATIC1111:73 个节点拼出 11 条 AI 图像视频流水线
一句话结论
AUTOMATIC1111 的整套功能可以用一张 Gradio Workflow 节点画布重建出来,而且更好用:Hugging Face 官方用 73 个节点、11 条媒体流水线复刻了 stable-diffusion-webui 的文生图、高清修复、图生图、提示词矩阵、检测擦除、ControlNet 预处理器、抠图、PNG 信息读写、图生视频全家桶。
核心差异有三点:本地 Python 函数和云端模型在同一张画布混排;每个输出节点自动变成 REST API 和 MCP 工具;开发者不需要自己的 GPU 就能跑完整流水线,整个 Space 可以直接复制改造。
Workflow1111 是什么
在上一篇 Gradio 文章里,团队搭了五个小型 gr.Workflow 图,并预告了用它重建 AUTOMATIC1111 stable-diffusion-webui 会是什么样。这篇就是兑现:Workflow1111 把 A1111 的大部分功能集重建为一张工作画布。
Workflow1111 是一张由 11 条媒体流水线、73 个节点构成的节点图,串起了当前最强的各类模型:文生图、高清修复、图生图、提示词矩阵网格、VLM 反推提示词、检测生成擦除蒙版、ControlNet 风格预处理器、背景移除、PNG 信息存储、图生视频。
运行方式有两种:用 Hugging Face 账号登录或提供 access token 直接跑,模型调用消耗你自己账号的额度;或者点 Duplicate 把整个 Space 复制下来,从 11 条流水线里挑一条改成自己的版本。
四类算子构成全部流水线
所有媒体流水线都由四种算子搭成:fn 是 Python 函数,model 是经 InferenceClient 调用的模型,space 是另一个 Gradio Space,dataset 是 Hub 数据集的一行。画布上每个节点包装一个算子,算子的输入输出就是连线用的端口。这个统一抽象贯穿全部 11 条流水线,也是理解后面所有例子的钥匙。
文生图主线:提示词构建到 PNG 元数据一条龙
核心流水线复刻了 A1111 的 txt2img 标签页:负向提示词、步数、CFG、种子、宽高,外加选择 checkpoint 的 model_id 字段。提示词先经过一个提示词构建 fn 节点——追加选定的风格预设并清理文本——再进入通过 Inference Providers 调用 checkpoint 的 model 节点。出口处还有一个后处理 fn 节点,把生成参数写进 PNG 的元数据,供后面的 PNG Info 流水线回读。A1111 用户熟悉的”参数随图走”体验原样保留。
高清修复与图生图:同一个 Kontext 节点两种用法
A1111 的高清修复是先放大 txt2img 输出、再跑第二轮去噪。这里改成两节点绕行:文生图结果送进 FLUX.1-Kontext model 节点,附上细化指令(“增强精细细节和微纹理,保持构图不变”),返回一张更清晰更大的图。
同一个 Kontext 节点兼任图生图标签页:上传图片、描述想要的修改,就得到编辑后的成品。
让 LLM 写提示词
输入粗糙提示词”风暴中的灯塔”,这条流水线把它交给 Qwen3-4B model 节点,一个小 fn 节点把回复转成干净的标签列表(上限 40 个)——“stormy sea, wet rocks, dramatic composition, low angle shot, volumetric lighting, ominous tone”。输出可以接到任何扩散模型节点直接出图。
与 ComfyUI 不同,这里没有自定义节点的概念——LLM 和扩散模型就是同一张画布上的普通 model 算子,连接它们不需要写任何胶水。
让 VLM 反推提示词
类似 A1111 的 Interrogate 按钮,但由 VLM 代替 CLIP 执行:Qwen2.5-VL 看一张夜市照片,写出可能生成它的提示词;同时一个 ViT 分类节点读同一张图,返回标签:餐厅 51.9%、烟草店 15.6%、玩具店 9.1%。
两个节点共用同一个图片输入,gr.Workflow 自动并行执行,两个答案大约在单个模型的用时内同时返回。
检测到擦除蒙版
A1111 要求手动涂抹擦除蒙版,这条流水线改用检测器自动生成:DETR 在街景照片里找出六个目标(三个人、一条狗、一辆自行车、一辆汽车),然后流程分两支——一支把检测框画在原图上,另一支把检测框转成蒙版,喂给下游的 inpaint 流水线。
画框和蒙版生成都用 Pillow 和 NumPy 在本地完成,只有检测调用离开本机。这个分工是整张画布的缩影:重的模型调用走云端,轻的图像处理留在本地。
提示词矩阵与并行生成
复刻 A1111 提示词矩阵:基础提示词”一棵孤零零的橡树”,由 fn 节点与四个后缀(日出时、雷暴中、银河下、秋雾里)组合,每个变体进入自己的文生图节点,最后一个节点把四张结果拼成一张对比图。
gr.Workflow 没有循环算子,所以四个文生图节点并排放在画布上。因为依赖深度相同,它们并行执行,四张图同时开始生成。
放大与抠图:本地与云端双路
对应 A1111 的 Extras 标签页,两个放大器节点走不同路线:第一个是 fn 节点里的本地 Lanczos 重采样,不需要网络调用,Pillow 多快它多快;第二个是 AuraSR ×4,画布上第一个 space 节点——调用 Hub 上的 Space,把结果当普通节点输出用。
背景移除同理:BRIA RMBG-2.0 也是一个 space 节点,整个模型住在自己的 Space 里,画布只负责调用进来。
ControlNet 预处理器:纯 NumPy 实现
Canny、线稿、素描、亮度深度图、色调分离——这些通常来自 A1111 的 ControlNet 扩展的预处理器,在这里每个都是一个纯 NumPy 写的 fn 节点,背后没有任何模型。在预载的建筑立面示例照片上,每个预处理器在 CPU 上约半秒完成。
整个应用 36 个算子节点里 32 个是 fn 节点,其中 22 个完全进程内运行、零网络调用——约三分之二的画布在断网时照常工作。它们是普通 Python 函数,不需要画布、服务器或 GPU 就能直接单测。
PNG Info 与图生视频:一次上传多点复用
PNG Info 流水线复刻 A1111 同名标签页:文生图流水线的后处理节点把生成参数写进 PNG 的 parameters 文本块,这条流水线把提示词、负向提示词、步数、CFG、种子、图片尺寸、模型全部读回来。
PNG Info 读取的图片节点同时馈给一个 Wan 2.2 I2V A14B 节点做图生视频——演示里一只睡着的狐狸醒来开始活动。没有第二个上传框,因为一个参考节点可以喂给任意多的下游流水线:单次上传,元数据被读取、图片被动画化,同画布完成。
自有 GPU 也能接
到目前为止所有模型调用都走别人的硬件——Inference Providers 或 Space——所以搭建和运行 Workflow1111 这样的应用不需要自己的 GPU。
但 fn 节点就是 Python,同样可以加载本地模型跑自己的 GPU。FastVideo 的 fastvideo-fasth3-preview 就是一个这样做的 gr.Workflow 应用:跑 FastH3(MiniMax-H3 的四步蒸馏版),在 ZeroGPU 上生成带音轨的视频。
ZeroGPU 在函数需要时分配 GPU、调用结束就释放,gr.Workflow 对此一无所知,照常调用 fn 节点。这套机制也不限于 Spaces:把 bind= 指向加载本地 checkpoint 的函数,在自己机器上 .launch(),Workflow1111 画布就能驱动自己的 GPU。
每个输出节点都是 API
画布上每个输出节点自动变成 REST 端点,无需手写路由。Workflow1111 暴露九个端点:/image、/edited_image、/generated_prompt、/recovered_prompt、/detected_objects、/x_y_grid、/upscaled_local、/annotator_map、/png_info,用 gradio_client 带 OAuth token 直接调用。
同一批端点还是 MCP 工具:启动时加 mcp_server=True,把 Claude Code、Cursor 或任何 MCP 客户端指向服务器 URL 即可。
这样智能体就能把”生成图片、反推提示词、跑检测”当作大任务里的步骤直接调用,零胶水代码。每个调用方在请求头里带自己的 X-HF-Token,Space 本身不保存任何令牌。
与 ComfyUI 怎么选
AUTOMATIC1111 给了功能清单,但 Gradio Workflow 真正的对标物是 ComfyUI——两者都是节点图,而很多想搭建和交付的东西,gr.Workflow 覆盖同样的地面。
官方列出的核心差异:节点可以是你不拥有的硬件,经 Inference Providers、任意 Space、任意 API 或数据集运行;每个输出自动变成类型化 REST 端点;访客可以用自己的身份运行工作流——开 OAuth 分享公开 URL,任何人登录即用、无需安装;扩散模型、LLM、VLM、检测器、视频模型可以在同一画布混排;需要定制时写个 Python 函数就行,Python 能做的它都能做。
最终产物是一个人们能在浏览器打开、登录、立即使用、还能从代码调用的多模型流水线。
三步起步
Workflow1111 有 73 个节点,但起点只有三行:定义函数、bind= 变节点、.launch() 开画布编辑。画布就绪后 gradio deploy 一行命令整体部署到 Space,完整细节在 gr.Workflow 官方指南里,包括 JSON 模式和全部算子类型。
想直接改现成的,打开 Workflow1111 点 Duplicate,从 11 条流水线里挑一条动刀——删节点、换模型、重接线。想从小开始,上一篇文章里有五个一分钟就能跑通的工作流。
原文信息
- 原文标题:Rebuilding AUTOMATIC1111 with Gradio Workflow
- 作者:Hugging Face 博客(ysharma)
- 发布日期:2026-09-10 原文地址:https://huggingface.co/blog/gradio-workflow-1111
原文信息
- 作者Hugging Face 博客(ysharma)
- 发布时间2026-09-10
- 原文链接huggingface.co/blog/gradio-workflow-1111
原文链接:https://www.jxxy.net/ai/articles/hf-workflow1111-rebuild-a1111/