허깅페이스, A1111 기능을 gr.Workflow 노드로 재구현
최근 30일 조회수 — 좋아요 —핵심 요약
허깅페이스가 AUTOMATIC1111의 주요 기능을 11개 파이프라인·73개 노드로 재구현한 Workflow1111 데모를 공개했다.
이번 자료는 파이프라인 설명 도중 잘려 있어, 이후에 소개된 “ControlNet 스타일 어노테이터”, “배경 제거”, “PNG Info 저장”, “이미지-투-비디오” 파이프라인의 세부 내용은 확인할 수 없습니다. 지금까지 주어진 내용만으로 기사를 작성하면 다음과 같습니다.
허깅페이스가 스테이블 디퓨전 이미지 생성 도구 AUTOMATIC1111의 주요 기능을 자사 워크플로 도구 gr.Workflow로 재구현한 데모 공간 ‘Workflow1111’을 공개했다. 허깅페이스 블로그에 따르면 이 데모는 열한 개의 미디어 파이프라인을 일흔세 개의 노드로 연결한 단일 캔버스 형태로 만들어졌다.
AUTOMATIC1111은 스테이블 디퓨전 이미지 생성을 위한 오픈소스 웹UI로, txt2img와 img2img 탭, 인페인팅, 업스케일링 등의 기능을 하나의 브라우저 화면에서 제공해온 도구다. 허깅페이스는 이번 포스트에서 이 기능들을 gr.Workflow의 그래프 구조로 옮겨, 노드를 잇는 방식만으로 같은 결과를 재현할 수 있음을 보여준다.
gr.Workflow의 노드는 네 가지 연산자 유형 중 하나로 구성된다. 파이썬 함수를 감싼 fn, InferenceClient로 호출하는 model, 다른 Gradio Space를 참조하는 space, Hub 데이터셋의 한 행을 가져오는 dataset이다. 캔버스 위의 각 노드는 이 연산자 하나를 감싸고, 입력과 출력이 그대로 다른 노드와 잇는 포트가 된다.
핵심이 되는 텍스트-투-이미지 파이프라인은 A1111의 txt2img 탭과 동일하게 네거티브 프롬프트, 스텝 수, CFG, 시드, 해상도, 체크포인트 선택(model_id) 항목을 제공한다. 프롬프트는 먼저 fn 노드를 거쳐 스타일 프리셋이 붙고 정리된 뒤, Inference Providers를 통해 체크포인트를 호출하는 model 노드로 넘어간다. 생성이 끝나면 후처리 fn 노드가 생성 파라미터를 PNG 메타데이터에 기록하는데, 이 값은 뒤에 있는 PNG Info 파이프라인이 다시 읽어 들이는 용도로 쓰인다.
AUTOMATIC1111에서 고해상도 보정은 1차 업스케일 후 2차 디노이징을 거치는 방식이지만, Workflow1111에서는 두 개 노드로 단순화됐다. txt2img 결과를 FLUX.1-Kontext 모델 노드에 “구도는 유지하되 미세한 디테일과 질감을 보강하라”는 지시와 함께 넣으면 더 선명하고 커진 이미지가 나온다. 같은 Kontext 노드는 이미지-투-이미지 탭 역할도 겸해, 이미지를 올리고 원하는 변경 사항을 문장으로 적으면 편집된 결과를 돌려준다.
프롬프트 작성을 LLM에 맡기는 파이프라인도 있다. “폭풍우 속 등대”처럼 짧은 문장을 Qwen3-4B 모델 노드에 보내면, fn 노드가 답변을 최대 마흔 개의 태그로 정리해 “폭풍우 치는 바다, 젖은 바위, 극적인 구도” 같은 목록으로 만든다. 이 출력은 원하는 어떤 디퓨전 모델 노드에도 연결해 이미지를 생성할 수 있다. 허깅페이스는 ComfyUI와 달리 별도의 전용 노드 없이, LLM과 디퓨전 모델이 같은 캔버스 위의 평범한 model 연산자로 다뤄진다는 점을 차이로 짚었다.
반대로 이미지를 프롬프트로 되돌리는 파이프라인은 AUTOMATIC1111의 인터로게이트 버튼에 해당한다. CLIP 대신 Qwen2.5-VL이 야시장 사진을 보고 그 이미지를 만들어냈을 법한 프롬프트를 쓰고, 같은 이미지를 ViT 분류기 노드가 함께 읽어 레스토랑 51.9%, 담배 가게 15.6%, 장난감 가게 9.1% 식으로 레이블을 매긴다. 두 노드가 같은 이미지 입력을 공유하기 때문에 gr.Workflow는 이들을 병렬로 실행하며, 하나를 돌리는 시간만큼만 기다리면 두 결과를 동시에 얻는다.
수작업 인페인트 마스크도 자동화됐다. AUTOMATIC1111에서는 사용자가 직접 마스크를 그려야 하지만, Workflow1111은 객체 탐지 모델 DETR로 이를 대신한다. 거리 사진에서 사람 셋, 개 한 마리, 자전거, 자동차 등 여섯 개 객체를 찾아낸 뒤, 워크플로는 두 갈래로 갈라진다. 하나는 탐지된 박스를 원본 이미지 위에 그리고, 다른 하나는 그 박스들을 인페인트용 마스크로 변환한다. 두 작업 모두 로컬에서 Pillow 라이브러리로 처리된다.
허깅페이스는 Workflow1111을 자사 계정이나 액세스 토큰으로 로그인해 직접 실행해볼 수 있으며, Space를 복제해 자신의 용도에 맞게 노드를 다시 연결할 수 있다고 안내했다.
읽기 목록은 이 브라우저에 저장됩니다.
출처
- Rebuilding AUTOMATIC1111 with Gradio Workflow — Hugging Face Blog
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.