알리바바 그룹의 QWEN 팀에서 강력한 생성형 모델을 또 오픈 소스로 공개했습니다. 이는 기존의 QWEN IMAGE 2512보다 압도적인 성능을 자랑하며 Google의 Nano Banana 보다 더 나은 성능을 보여줍니다. 2026년 9월 20일 공개한 Qwen-Image-2.1이 이미지 생성 커뮤니티에서 빠르게 주목받고 있는 이유는 새 이미지 생성 모델 하나가 추가됐기 때문만은 아닙니다. Qwen-Image-2.1은 이미지 생성, 이미지 편집, 여러 장의 레퍼런스 이미지 활용, 투명 배경 생성까지 하나의 모델 안에서 처리하면서도 이미지 생성부의 규모를 7B 파라미터 수준으로 구성했습니다.
공개 당일부터 Hugging Face Diffusers와 ComfyUI가 지원을 시작했다는 점도 상당히 이례적입니다.
7B인데 기능은 오히려 늘었다?
Qwen-Image-2.1의 이미지 생성 Transformer는 32개 레이어로 구성된 7B 파라미터 Single-Stream DiT입니다. 여기에 Qwen3-VL 8B를 텍스트와 입력 이미지의 의미를 해석하는 인코더로 사용합니다. 이전 세대의 대형 이미지 모델들이 점점 거대해지는 방향으로 발전해온 것을 생각하면, 생성부 7B라는 숫자는 로컬 이미지 생성 사용자들에게 상당히 매력적입니다. Qwen은 Mixed-Granularity Attention과 Prefix KV Cache를 적용해 이미지 편집 과정에서 입력 이미지와 텍스트 조건을 매 스텝마다 다시 계산하지 않고 캐시를 재사용하도록 설계했습니다.
여기서 가장 중요한 것은 모델이 작다는 점이 아닙니다. 모델이 작아지면서 기능을 포기한 것이 아니라 오히려 이미지 생성과 편집을 하나의 파이프라인으로 통합했습니다. Diffusers에서는 QwenImage21Pipeline 하나로 Text-to-Image와 이미지 기반 생성을 모두 처리할 수 있습니다. GPU 메모리가 부족한 경우 CPU Offload도 공식적으로 지원합니다.
사람들이 특히 놀란 기능, 진짜 RGBA 생성
이번 발표에서 가장 눈에 띄는 기능 중 하나는 네이티브 투명 이미지 생성입니다. 일반적인 이미지 생성 AI에서 “투명 배경으로 만들어줘”라고 입력하면 실제 Alpha Channel을 생성하는 것이 아니라 흰색이나 체크무늬 배경을 그려버리는 경우가 많았습니다. 결국 별도의 배경 제거 모델을 거쳐야 했습니다.
여기 아래 내용이 정말 핵심! 누끼 따기 굿 ! 🙄
Qwen-Image-2.1은 아예 VAE 단계부터 64채널 RGBA Autoencoder를 사용하며, 실제 Alpha Channel이 포함된 이미지를 직접 생성할 수 있습니다. 이미 존재하는 RGB 사진에서 특정 피사체만 추출해 투명 RGBA 레이어로 만드는 작업도 가능합니다. 즉 캐릭터 스프라이트, 스티커, 상품 이미지, UI 리소스처럼 처음부터 배경 분리가 필요한 작업에서는 생성 → 배경 제거 → 마스크 보정이라는 기존 워크플로우를 상당 부분 줄일 가능성이 있습니다.
실제로 공개 직후 Stable Diffusion 커뮤니티에서도 Alpha Channel 지원 여부가 가장 빠르게 화제가 된 기능 가운데 하나였습니다.
최대 10장의 이미지를 동시에 참고한다
Qwen-Image-2.1은 이미지 편집 모델의 성격도 상당히 강합니다. 공식적으로 최대 10장의 Reference Image를 동시에 사용할 수 있습니다. 예를 들어 한 이미지에서 사람을 가져오고, 다른 이미지에서 옷을 가져오고, 또 다른 이미지에서 신발과 가방을 가져와 하나의 장면으로 조합하는 방식입니다. 공식 예시에는 6명의 개별 인물 사진을 이용해 단체 사진을 만들거나 모델·옷·신발·가방·모자를 각각 다른 이미지에서 가져와 하나의 착장을 구성하는 사례도 포함돼 있습니다.
다중 레퍼런스 이미지를 하나로 합친 모습
특정 영역을 원으로 표시하거나 직접 칠해서 수정할 영역을 지시하고, 별도의 Mask를 제공하는 방식도 지원합니다. 이미지 전체를 다시 생성하는 것이 아니라 “시계만 지워라”, “머리 색만 바꿔라”, “이 옷만 교체하라”와 같은 작업을 하나의 모델로 처리하려는 방향입니다. 사람 얼굴이나 상품의 Identity를 유지하는 기능 역시 Qwen이 이번 모델에서 강조하는 부분입니다.
그리고 강력한.. 처음부터 2K를 기준으로 만들어졌다
해상도 역시 상당히 공격적입니다. 공식 기본 출력은 2048×2048이며 16:9에서는 2752×1536, 3:2에서는 2528×1696 등의 해상도를 권장합니다. 즉 저해상도로 생성한 뒤 별도의 Upscaler를 거치는 방식만을 전제로 만든 모델이 아니라 처음부터 약 2K급 이미지를 생성하도록 설계됐습니다.
공개 직후 커뮤니티에서는 이 특성을 이용해 Qwen-Image-2.1 자체를 이미지 디테일 보강이나 업스케일링 용도로 사용하는 워크플로우도 등장하고 있습니다. 아직 공식적인 업스케일러 기능이라고 보기는 어렵지만, 다른 모델에서 만든 이미지를 Qwen-Image-2.1에 다시 넣어 세부 묘사를 재구성하는 활용법이 빠르게 실험되고 있습니다.
그리고 결정적으로, 공개 첫날부터 ComfyUI가 된다
아무리 좋은 모델이라도 공개된 뒤 몇 주 동안 전용 코드를 설치하고 복잡한 환경을 구성해야 한다면 실제 사용자 확산 속도는 느릴 수밖에 없습니다. Qwen-Image-2.1은 이 부분이 완전히 달랐습니다. 9월 20일 모델 공개와 동시에 Hugging Face Diffusers가 QwenImage21Pipeline을 지원했고, ComfyUI 역시 Day 0 네이티브 지원을 시작했습니다. ComfyUI용 BF16뿐 아니라 INT8 ConvRot 가중치도 제공되고 있으며 Text-to-Image와 이미지 편집용 공식 Workflow까지 준비됐습니다. vLLM-Omni, SGLang, LightX2V까지 같은 날 지원을 발표했습니다.
오픈 모델 커뮤니티에서는 모델 자체 성능만큼이나 이것이 중요합니다. 모델이 공개되는 순간 기존 ComfyUI 환경에 넣어 바로 실험할 수 있고, 이후 Quantization, LoRA, Custom Node와 다양한 Workflow가 빠르게 만들어질 기반이 이미 갖춰져 있기 때문입니다.
저사양 하드웨어에서도 구동 OK
특히 24~32GB 또는 데이터센터나 연구소 급의 GPU를 필요로 하지 않기 때문입니다. 한 사용자는 RTX 5060 Ti 16GB에서 INT8 버전을 실행해 1024×1024, 25스텝 이미지를 약 24초, 2048×2048, 40스텝 이미지를 약 200초에 생성했다고 공개했습니다. 이 환경에서 최대 VRAM 사용량은 약 15.2GB였습니다.
저는 5070Ti 16GB 기준에 INT8에서 1024x1024, 25스텝을 약 12초만에 생성했습니다. 즉 16GB VRAM 정도부터 이미 현실적인 로컬 사용 영역에 들어옵니다. 물론 이는 공식 벤치마크가 아니라 초기 사용자 테스트이며 ComfyUI 버전, Quantization, Attention 구현, CPU Offload, 이미지 해상도와 스텝 수에 따라 속도는 상당히 달라질 수 있습니다. 또한 현재 GGUF 버전이 공개되어 더 낮은 VRAM에서도 이용이 가능합니다.
24GB급 GPU에서는 더욱 여유가 생깁니다. RTX 3090이나 RTX 4090 같은 카드는 INT8 구성이라면 비교적 편하게 운용할 수 있고, BF16 역시 CPU Offload 등의 메모리 최적화를 조합해 사용할 수 있습니다. 반면 전체 BF16 파이프라인을 GPU 메모리에 최대한 올리는 방식에서는 30GB 이상의 메모리가 사용됐다는 초기 측정도 있어, “7B니까 16GB에서 BF16으로 넉넉하게 돌아간다”는 의미는 아닙니다. 일부 테스트에서는 1024×1024, 40스텝 기준 BF16 환경의 최대 메모리 사용량이 약 34GB 수준으로 측정됐습니다.
ComfyUI는 이미 이미지 Transformer의 INT8 버전을 약 7.26GB 크기로 제공하고 있고, Qwen3-VL 인코더 역시 BF16 17.5GB 외에 INT8 약 9.35GB, W4A8 약 6.31GB 버전이 준비돼 있습니다. 따라서 메모리가 부족한 소비자용 GPU에서는 Transformer와 인코더를 함께 양자화하고 CPU Offload를 사용해 요구 VRAM을 크게 낮출 수 있습니다.
현재 초기 테스트를 종합하면 12GB급 카드는 강한 양자화와 Offload를 전제로 접근해야 하고, 16GB는 1K급 생성을 실제로 사용할 수 있는 현실적인 시작점, 24GB는 훨씬 편한 로컬 사용 구간, 32~48GB 이상은 고해상도와 BF16·멀티 레퍼런스 작업에서 유리한 영역 정도로 보는 것이 적절합니다. 아직 출시 직후이기 때문에 앞으로 FP8·INT8·GGUF·커스텀 커널과 Distillation이 더 발전하면 요구 사양과 생성 속도는 더 낮아질 가능성이 있습니다.
GPT Image 같은 폐쇄형 모델을 완전히 넘어섰다는 의미는 아니
다만 현재의 열광과 모델의 실제 완성도를 구분해서 볼 필요도 있습니다. 공개된 지 하루 정도밖에 지나지 않은 시점이라 장기간의 독립적인 비교평가가 충분하지 않습니다. 커뮤니티 테스트에서도 반응은 상당히 엇갈리고 있습니다. 일부 사용자들은 조명과 디테일, 색 표현을 높게 평가하는 반면 복잡한 장면에서 손가락이나 물체 구조, 물리적 일관성이 깨지거나 특유의 인공적인 질감이 나타난다는 지적도 나오고 있습니다. 다른 테스트에서는 GPT Image 계열과 비교해 세부 객체나 해부학적 정확도가 떨어진다는 평가도 있습니다. 반대로 로컬에서 실행 가능한 모델이라는 점을 고려하면 상당히 높은 품질이라는 반응 역시 존재합니다. 이는 아직 커뮤니티의 초기 사용 후기이므로 객관적인 벤치마크와 동일하게 받아들여서는 안 됩니다.
라이선스 논란, 그리고 ‘모델 권리’와 ‘출력물 권리’는 다르다
공개 직후 Qwen-Image-2.1의 Qwen Research License도 논란이 됐습니다. 이전 Qwen-Image 계열 상당수가 Apache 2.0으로 제공된 것과 달리 Qwen-Image-2.1의 기본 라이선스는 모델 Materials의 이용을 연구·평가 목적의 비상업적 사용으로 제한하고 있으며, 상업적으로 모델을 사용하려면 Qwen 측과 별도의 상업 라이선스를 체결하도록 명시하고 있습니다.
다만 여기서 생성한 이미지 자체의 권리까지 Qwen이 가져가는 것으로 이해해서는 안 됩니다. Qwen 측은 이후 X를 통해 Qwen-Image-2.1로 생성한 출력물의 권리는 사용자에게 있다는 점을 별도로 밝혔습니다. 관련 답변이 공유되면서 초기 커뮤니티에서도 이 부분에 대한 정정이 이뤄지고 있습니다.
따라서 두 가지를 구분할 필요가 있습니다. 생성된 출력물에 대한 권리 귀속과 Qwen-Image-2.1 모델을 어떤 목적으로 사용할 수 있는지에 대한 라이선스는 별개의 문제입니다. 출력물에 대한 권리를 사용자가 보유한다고 하더라도 기본 Qwen Research License가 모델 Materials 자체의 상업적 사용까지 자동으로 허용하는 것은 아닙니다. 실제 상업 서비스나 제작 파이프라인에 모델을 넣으려 한다면 별도의 상업 라이선스 조건을 확인해야 합니다.
즉 “이 모델로 만든 그림은 Qwen 소유다”라는 해석은 맞지 않지만, 반대로 “출력물이 내 것이니 모델도 아무 제한 없이 상업적으로 사용할 수 있다”고 해석하는 것 역시 현재 라이선스 문구와는 다릅니다.
몇 년 전이었다면 이미지 생성 모델, Inpainting 모델, ControlNet, Face ID 도구, 배경 제거 모델, Upscaler와 Photoshop을 여러 단계로 연결해야 했던 작업들이 점점 하나의 모델 안으로 들어오고 있습니다. 사람들이 열광하는 이유는 이제 이 정도 기능이 자신의 PC에서 직접 돌아가기 시작했다는 것 아닐까요.
이 글이 도움이 되었나요?
댓글
서로의 생각을 나누고, 새로운 이야기를 이어가세요.