8월 5일 소식에 따르면 알리 통의천문팀은 오늘 정식으로 Qwen-Image를 오픈소스한다고 선포했다.이것은 20B 매개변수를 기반으로 한 MMDiT 모델이며 일반 천문 시리즈의 첫 번째 이미지 생성 기본 모델입니다.이 모델은 복잡한 텍스트 렌더링과 정확한 이미지 편집 분야에서 현저한 돌파를 이룩하여 이미지 생성과 편집 분야에 새로운 활력을 불어넣었다.
Qwen-Image의 핵심 기능
Qwen-Image는 다음과 같은 다양한 기능을 통해 강력한 성능을 제공합니다.
탁월한 텍스트 렌더링 기능: 이 모델은 복잡한 텍스트 렌더링에서 눈에 띄며 여러 줄 레이아웃, 단락급 텍스트 생성 및 세분화된 디테일 렌더링을 지원할 수 있습니다.영어든 중국어 텍스트든 모두 고화질 출력을 실현할 수 있으며, 문자의 형태와 조판을 정확하게 복원할 수 있다.
안정적인 이미지 편집 일관성: 향상된 멀티태스킹 훈련 패러다임을 통해 Qwen-Image는 이미지 편집 과정에서 편집의 일관성을 효과적으로 유지하고 편집 전후의 이미지가 스타일, 요소 관련 등 방면에서 일관되고 통일되도록 확보한다.
업계 최고의 크로스 데이텀 성능: 여러 공개 벤치마크 테스트에서 Qwen-Image는 업계 최고 수준 (SOTA) 을 달성했습니다.통의천문팀은 통용영상생성령역의 GenEval, DPG 및 OneIG-Bench와 영상편집령역의 GEdit, ImgEdit 및 GSO를 포함한 전면적인 평가를 진행했다.특히 텍스트 렌더링과 관련된 LongText-Bench, ChineseWord 및 TextCraft 벤치마크 테스트에서 이 모델은 특히 뛰어나 중국어 텍스트 렌더링에서 기존 최첨단 모델을 크게 앞섰다.
기능 예제 프레젠테이션
Qwen-Image의 기능을 시각적으로 보여주는 여러 예:
장면화 이미지 생성:"미야자키 하야오의 애니메이션 스타일.평면 촬영, 햇빛 아래의 옛 거리는 떠들썩하고..."등의 상세한 묘사에 따라 스타일과 장면 설정에 부합하는 생동감 있는 이미지를 생성할 수 있으며, 여기에는"알리 클라우드"카드,"클라우드 스토리지","클라우드 컴퓨팅","클라우드 모델"등의 요소가 포함되어 있으며, 디테일이 풍부하고 텍스트에 밀착되어 있다.
중국식 텍스트 및 장면 생성: 전아하고 장중한 중국식 대청 장면을 생성할 수 있는데, 그 중에는 지정 대련"의본생지인기 동도선사신","통운부지건곤계수고지원"이 걸려있고,"지계통의"를 가로지르며, 글씨체가 찰랑찰랑하고, 청화자기, 악양루 그림 등 요소를 배합하여 고전적인 운치를 한껏 드러낸다.
특정 텍스트를 포함하는 인물 이미지: "QWEN" 로고 티셔츠를 입은 중국 미녀 이미지를 생성할 수 있습니다. 그 뒤의 유리판에 있는 필기체 텍스트"Meet Qwen-Image -- a powerful image foundation model capable of complex text rendering and precise image editing.Qwen-Image, 복잡한 텍스트 렌더링과 정확한 이미지 편집이 가능한 강력한 이미지 기반 모델을 이해하신 것을 환영합니다."
광범위한 응용 능력
텍스트 처리의 장점뿐만 아니라 Qwen-Image는 일반 이미지 생성 및 이미지 편집 분야에서도 광범위한 응용 능력을 갖추고 있습니다.
다중 스타일 이미지 생성: 사진급 사실적인 장면에서 인상파 회화, 애니메이션 스타일에서 미니멀한 디자인에 이르기까지 다양한 예술 스타일을 지원하여 각종 창의적인 제시에 유연하게 응답하고 서로 다른 창작 수요를 만족시킬 수 있다.
다양한 이미지 편집: 스타일 마이그레이션, 첨삭, 디테일 향상, 문자 편집, 인물 자세 조정 등 다양한 편집 조작을 제공하여 일반 사용자가 전문 기술 없이도 전문적인 이미지 편집 효과를 실현할 수 있도록 한다.
Qwen-Image의 오픈 소스는 통의천문 시리즈의 모델 생태를 풍부하게 할 뿐만 아니라 개발자와 사용자가 이미지 생성과 편집 분야에서 더욱 강력한 도구를 제공하여 관련 기술의 진일보한 발전과 응용 정착을 추진할 수 있을 것이다.