[모델]알리바바, 7B 이미지 생성·편집 모델 'Qwen-Image-2.1' 공개
알리바바 Qwen 팀이 이미지 생성과 편집을 단일 모델로 처리하는 7B 규모의 디퓨전 트랜스포머 'Qwen-Image-2.1'을 공개했습니다. 텍스트 기반 생성뿐 아니라 네이티브 RGBA 투명도 지원, 최대 10장의 참조 이미지를 활용한 빠른 편집 기능까지 단일 체크포인트에 담았습니다. 가중치는 공개되었으나 상업적 이용에는 별도 라이선스가 필요합니다.
전문 읽기접기
무슨 일이야
알리바바의 Qwen 팀이 7B 파라미터 규모의 오픈 가중치 디퓨전 트랜스포머 모델인 'Qwen-Image-2.1'을 내놓았습니다. 이번 릴리스의 핵심은 텍스트 투 이미지(Text-to-Image) 생성, 다중 참조 이미지 편집, 네이티브 RGBA 투명도 처리를 하나의 체크포인트에서 모두 지원한다는 점입니다.
편집 작업의 효율을 높이기 위해 프리픽스 KV 캐시(prefix KV cache) 기술도 도입되었습니다. 이를 통해 최대 10장의 참조 이미지를 사용하는 복잡한 편집 작업에서도 처리 속도를 끌어올렸습니다.
왜 중요해
생성과 편집, 투명도 배경 처리를 위해 여러 모델이나 복잡한 파이프라인을 엮을 필요 없이 하나의 7B 모델로 처리할 수 있게 되었습니다. 특히 최대 10장의 레퍼런스를 참조하면서도 캐시 구조를 통해 속도를 확보한 만큼, 연속적이고 정교한 이미지 편집 워크플로우를 구축하려는 개발자들에게 유용한 선택지가 될 것으로 보입니다.
짚고 넘어갈 점
가중치는 공개되었지만 상업적으로 활용하려면 Qwen 측으로부터 별도의 라이선스를 취득해야 합니다. 연구 목적 외에 실제 서비스에 도입하려는 팀은 라이선스 조건을 미리 확인할 필요가 있습니다.
참고: MarkTechPost
댓글 0
첫 댓글을 남겨보세요.