Qwen-Image-2.1, 7B에 투명 이미지 편집을 담았다 — 라이선스는 상업적 사용을 막았다

알리바바 Qwen 팀이 소비자용 GPU 한 장으로 돌아가는 생성·편집 통합 모델을 내놓고, 연구 전용 계약을 붙였다

|5분 읽기0
A machine-generated plant study from the Better Images of AI collection, illustrating the generative image models that Qwen-Image-2.1 now competes with at 7B parameters.
A machine-generated plant study from the Better Images of AI collection, illustrating the generative image models that Qwen-Image-2.1 now competes with at 7B parameters.

알리바바 Qwen 팀이 9월 20일 Qwen-Image-2.1을 공개했다. 텍스트-이미지 생성과 이미지 편집을 체크포인트 하나로 처리하는 공개 가중치 모델이며, 시각 생성 부분의 파라미터는 70억 개에 그친다. 가중치는 허깅페이스와 ModelScope에서 받을 수 있고, 공개 당일 다섯 개 추론 스택에 통합이 들어갔다. 빠진 것은 이 결과물을 제품에 쓸 권리다.

핵심 요약

  • 시각 생성 부분은 7B 파라미터의 32층 단일 스트림 DiT이며, Qwen3-VL 8B 텍스트 인코더와 16배 공간 압축의 64채널 RGBA 오토인코더가 함께 붙는다.
  • 모델은 투명한 RGBA 이미지를 그대로 출력하고 레퍼런스 이미지를 최대 10장까지 받는다. 부분 편집은 원을 그리거나 칠하거나 별도 마스크로 지정한다.
  • 배포는 Qwen Research License Agreement를 따른다. 비상업적 연구·평가만 허용하며, 상업적 배포에는 별도 계약이 필요하다.

70억 파라미터에 무엇이 들어갔나

작은 크기는 큰 모델을 쳐낸 결과가 아니라 구조 자체에서 나왔다. Qwen-Image-2.1은 32층 단일 스트림 디퓨전 트랜스포머로, 블록 단위 인과 어텐션을 적용한다. 텍스트에는 토큰 단위 인과 마스크를, 이미지에는 청크 단위 양방향 마스크를 건다. 텍스트 인코더로는 Qwen3-VL 8B 비전-언어 모델을 써서 지시문과 조건 이미지를 하나의 표현으로 묶는다. 스케줄러는 플로우 매칭에 오일러 이산 샘플링과 동적 시프팅을 쓴다.

효율 주장의 근거가 이 혼합 단위 어텐션이다. 조건 컨텍스트가 디노이징 단계에 대해 인과적이므로, 입력 이미지와 지시문은 첫 단계에서 한 번만 인코딩되고 이후 모든 단계는 프리픽스 KV 캐시를 재사용한다. 권장 기본값인 40단계 디노이징 기준으로, 레퍼런스 이미지가 늘수록 절감 폭은 줄지 않고 오히려 커진다. 다중 레퍼런스 편집의 통상적인 비용 곡선을 뒤집는 셈이다.

Qwen 팀은 자체 내부 벤치마크에서 이 모델이 대부분의 폐쇄형 시스템을 앞섰다고 주장한다. 디코더는 독립 평가가 아직 나오지 않았다고 짚으면서, 이 모델이 RTX 3090 같은 고성능 소비자용 그래픽카드에서 돌아간다고 전했다.

네이티브 투명도가 실전에서 갖는 의미

대부분의 이미지 모델은 RGB만 뱉고 배경 제거는 다른 도구에 넘긴다. Qwen-Image-2.1은 오토인코더가 알파 채널을 끝까지 들고 가기 때문에 투명 에셋을 바로 생성하고, 투명 레이어를 편집하고, 사진에서 피사체를 따로 매팅 과정 없이 떼어낸다. 스티커 세트, 제품 누끼, UI 에셋 작업에서는 두 단계 파이프라인이 프롬프트 하나로 줄어든다.

편집 기능의 폭도 공개 모델치고는 이례적으로 넓다. 레퍼런스 이미지 10장까지를 한 장면으로 합성할 수 있어, 개별 인물 사진을 모아 단체 사진을 만들거나 따로 찍은 의류 사진으로 한 벌의 착장을 구성할 수 있다. 편집 영역은 정밀한 마스크를 만드는 대신 원을 그리거나 덧칠하는 방식으로 지정한다. 출력은 네이티브 2K로, 정사각형 기본값은 2048×2048, 16:9는 2752×1536이다.

연구 라이선스가 실제로 허용하는 범위

이 지점에서 이번 공개는 Qwen이 쌓아온 진짜 관대한 공개 가중치 릴리스와 갈라선다. Qwen Research License Agreement는 비상업적 연구나 평가 목적의 사용·수정·재배포를 허용한다. 상업적 용도에는 항저우 통이 랩 테크놀로지의 별도 라이선스가 필요하다.

공개 가중치와 공개 라이선스는 같은 말이 아니고, 이 차이가 누가 이 모델 위에 무언가를 만들 수 있는지를 가른다. 스튜디오가 체크포인트를 받아 폐쇄형 API와 비교 측정하고 LoRA를 학습시켜 논문을 내는 것은 가능하다. 그 결과물을 유료 디자인 도구에 실어 파는 것은 내려받기가 아니라 협상의 영역이다.

가중치와 함께 도구도 당일 도착했다

대규모로 추론을 돌리는 쪽에는 출시 조율이 더 중요한 대목이다. Diffusers는 공개 당일 QwenImage21Pipeline으로 모델을 노출했고, ComfyUI는 텍스트-이미지와 편집 워크플로를 공개하며 네이티브 지원을 붙였다. vLLM-Omni, SGLang, LightX2V는 프리픽스 KV 캐싱, CUDA 그래프 디코드, FP8 양자화, 텐서·시퀀스 병렬화를 아우르는 최적화 경로를 모두 함께 내놨다.

Qwen은 짧은 프롬프트를 상세하게 다시 쓰는 Qwen3.5-VL 9B 파인튜닝 체크포인트 두 개도 함께 공개했다. 텍스트-이미지용과 편집용으로 나뉜다. 별도로 FlagOS 스택은 엔비디아가 아닌 여덟 개 칩 플랫폼에 사전 빌드된 이미지와 가중치를 배포하면서, 추론 정확도가 레퍼런스 구현과 일치한다고 밝혔다.

전망

관건은 7B 생성 모델이 제3자 벤치마크에서도 알리바바의 자체 주장을 버텨내느냐다. 버텨낸다면 확산을 가로막는 것은 연산 자원이 아니라 라이선스가 된다. Qwen이 연구 단계의 관심을 상업 계약으로 전환할지, 아니면 앞선 모델 계열에서 그랬듯 결국 조건을 풀지가 남은 질문이다.

자주 묻는 질문

Qwen-Image-2.1은 오픈소스인가

가중치는 공개돼 누구나 내려받을 수 있지만 라이선스는 오픈소스 라이선스가 아니다. Qwen Research License Agreement는 비상업적 연구와 평가만 허용하며, 상업적 이용에는 항저우 통이 랩 테크놀로지와의 별도 계약이 필요하다.

어느 정도 하드웨어가 필요한가

시각 생성 부분은 7B 파라미터이며, RTX 3090 같은 고성능 소비자용 GPU에서 구동된다고 보도됐다. 메모리가 부족한 GPU를 위해 모델 오프로딩을 지원하고, 처리량을 높이려면 vLLM-Omni를 통한 FP8 양자화를 쓸 수 있다.

기존 Qwen-Image와 무엇이 다른가

2.1 버전은 생성과 편집을 분리하지 않고 한 모델에 합쳤다. 64채널 오토인코더로 네이티브 RGBA 투명도를 더했고, 레퍼런스 이미지 지원을 10장으로 늘렸으며, 프리픽스 KV 캐시 재사용을 도입해 조건 이미지를 디노이징 단계마다 인코딩하지 않고 한 번만 처리한다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

버그 수정을 맡겼더니, 코딩 에이전트가 자기 모델을 재학습해 교체했다
AI & Machine Learning

버그 수정을 맡겼더니, 코딩 에이전트가 자기 모델을 재학습해 교체했다

AI 보안 연구소 Irregular가 Qwen3.5-27B 에이전트에 유지보수 과제를 맡겼다. 에이전트는 앱과 자기 자신을 동시에 구동하던 모델을 파인튜닝해 다시 배포했다.

Seung Jung23시간 전
Qwen3.8-Omni-Flash, 영상에서 필요한 구간만 골라 본다
AI & Machine Learning

Qwen3.8-Omni-Flash, 영상에서 필요한 구간만 골라 본다

Alibaba Qwen 팀이 9월 18일 Qwen3.8-Omni-Flash를 공개했다. 텍스트·이미지·오디오·비디오를 받고 파일에서 어느 부분을 볼지 스스로 정하는 옴니모달 모델이다.

Seung Jung어제
PrismML, 27B 추론 모델을 5.95GB로 압축하고도 추론을 지켰다
AI & Machine Learning

PrismML, 27B 추론 모델을 5.95GB로 압축하고도 추론을 지켰다

4비트 미만 압축은 보통 추론 모델이 추론을 멈추는 지점이다. PrismML은 Qwen3.8-27B를 5.95GB로 줄이고도 원본 성능의 98.2%를 지켰다고 밝혔다.

Seung Jung3일 전
DeepSeek-V4.1-Flash, KV 캐시를 토큰당 890바이트로 줄였다
AI & Machine Learning

DeepSeek-V4.1-Flash, KV 캐시를 토큰당 890바이트로 줄였다

DeepSeek의 새 552B 멀티모달 MoE가 글로벌 KV 캐시를 토큰당 890바이트로 압축했다. 이전 세대의 약 4분의 1 수준이며 MIT 라이선스로 Hugging Face에 공개됐다.

Seung Jung4일 전
알리바바, 복부 CT 소견 146개 판독 모델 공개... 평균 AUC 0.913
AI & Machine Learning

알리바바, 복부 CT 소견 146개 판독 모델 공개... 평균 AUC 0.913

알리바바 DAMO 아카데미가 복부 CT 소견 146개를 평균 AUC 0.913으로 판독하는 범용 모델 RADAR를 가중치·코드와 함께 공개했다.

Seung Jung그저께
25턴 압박 실험, LLM은 굴복해도 추론은 정답을 붙들고 있었다
AI & Machine Learning

25턴 압박 실험, LLM은 굴복해도 추론은 정답을 붙들고 있었다

SPINE이라는 새 arXiv 벤치마크는 모델과 최대 25턴을 논쟁한다. 시험한 7개 시스템 모두 대화가 길어질수록 굴복률이 올라갔다.

Seung Jung7일 전