Qwen-Image-3.0 - 풍부한 콘텐츠, 사실적 디테일, 깊이 있는 지식

9 hours ago 3
  • Qwen-Image 시리즈의 3세대 기반 이미지 생성 모델로, 보기 좋은 이미지를 넘어 생산성 작업에 활용할 수 있는 ‘Real(实)’을 핵심 목표로 삼음
  • 최대 4.5k 토큰 입력을 처리해 신문·스토리보드·시험지처럼 정보량이 많은 레이아웃과 여러 개념이 병렬·중첩된 이미지를 한 번에 생성함
  • 10px 크기의 글자와 LaTeX 수식, 손글씨 주석을 읽을 수 있게 렌더링하고 모공·머리카락·피부·붓질 같은 미세 질감도 재현함
  • 12개 언어와 여러 글꼴, 100개 이상의 예술 스타일, 웹·게임·라이브스트리밍 UI를 지원하며 인터넷에서 최신 정보를 검색해 이미지에 반영할 수도 있음
  • 신문 PDF, 숏드라마 스토리보드, 복잡한 UI를 비롯해 디자인·콘텐츠 제작·교육·전자상거래에서 이미지 생성을 배포 가능한 생산성 도구로 확장하려는 모델임

‘Real’을 향한 3세대 모델

  • Qwen-Image-3.0은 Qwen-Image 시리즈의 3세대 기반 이미지 생성 모델
  • 세대별 핵심 방향은 다음과 같음
    • Qwen-Image-1.0: Precision
    • Qwen-Image-2.0: Precision, Variety, Completeness, Beauty, Authenticity
    • Qwen-Image-3.0: Real(实)
  • ‘Real’은 세 가지 역량으로 구성됨
    • 풍부한 콘텐츠: 최대 4.5k 토큰 입력과 복잡한 레이아웃 지원
    • 사실적인 디테일: 10px 글자와 모공·머리카락 같은 미세 요소 재현
    • 깊이 있는 지식: 12개 언어, 다양한 UI와 세계 지식을 활용한 생성
  • 이미지 생성을 ‘사용 가능’에서 ‘실용적’으로, ‘보기 좋은 것’에서 유용한 것으로 발전시키는 데 목표를 둠

풍부한 콘텐츠와 복잡한 배치

  • 수학 슬라이드에서 공간 관계, 수학 기호, 정리 설명과 각 요소의 상대적 위치를 함께 렌더링할 수 있음
  • 3.7k 토큰의 지시문으로 여러 이미지를 이어 붙이지 않고 하나의 3×3 그리드를 단일 패스로 생성함
    • 각 셀은 중국어·영어 문장, 수식, 차트, 만화 캐릭터가 결합된 복잡한 인포그래픽으로 구성됨
    • 터널 안전 만화, 공간기하학 수업, 「Chu Shi Biao」 문체 분석, 포물선 운동, 기생충학, 오른쪽 흉통 의학 도표, Sylow 정리, 은행 내부통제, 세포 DNA 구조 비교를 한 이미지에 배치함
  • 최대 4.5k 토큰의 지시문을 받아 정보 밀도가 높은 시각적 레이아웃을 이해하고 렌더링함
  • 수평 확장

    • 단일 캔버스에 여러 병렬 요소를 배치하는 능력을 뜻함
    • 의미적 병치와 공간 제어를 활용해 여러 개념이 서로 방해하지 않도록 정돈함
  • 수직 깊이

    • 의미를 분해하고 논리적으로 중첩된 인터페이스를 단계별로 표현하는 능력임
    • 단일 지시문으로 VSCode 프로그래밍 화면, Qwen Chat, WeChat, 핸드드립 커피 포스터가 겹쳐진 다중 화면 구조를 생성함
    • 각 계층은 해당 UI의 스타일과 세부 요소를 유지함

작은 글자부터 회화 복원까지

  • 작은 글자와 복잡한 조판

    • 10px 크기의 작은 글자도 읽을 수 있도록 렌더링함
    • 고래상어 지식 인포그래픽처럼 글과 삽화가 많은 영역을 함께 생성할 수 있음
    • 대수기하학 논문 한 페이지에서 LaTeX 수식, 위첨자·아래첨자, 그리스 문자, 정리 번호, 중괄호, 분수선, 여러 줄 정렬을 재현함
    • 작은 글꼴에서도 수식과 본문의 가독성을 유지함
    • 사실적인 종이 질감과 조밀한 텍스트를 결합해 신문 형태의 이미지를 생성함
  • 편집과 손글씨

    • 책 페이지 위에 빨간색 손글씨 주석을 추가할 수 있음
    • 밑줄, 물결선, 원, 화살표, 짧은 메모를 포함함
    • 고등학생의 수업 필기와 같은 자연스러운 손글씨 스타일을 구현함
  • 질감 표현과 복원

    • 인물 사진에서 모공, 머리카락, 피부 질감 같은 미세 요소를 묘사하며 다른 사물의 섬세한 질감도 표현할 수 있음
    • 손상되거나 일부가 사라진 전통 회화를 원래 화풍과 붓질에 맞춰 복원함
    • 독수리 전투 그림의 먹 농담, 깃털 질감, 구도 균형을 유지하면서 곰팡이 얼룩과 손상 흔적을 제거하고 누락된 부분을 완성함

언어·UI·세계 지식의 활용

  • 12개 언어와 여러 글꼴, 100개 이상의 예술 스타일, 다양한 UI 인터페이스를 지원함
  • 일본어·한국어·스페인어를 정확하게 렌더링하는 사례가 포함됨
  • 웹 페이지, 게임, 라이브스트리밍 등 여러 종류의 사실적인 UI 화면을 생성할 수 있음
  • 지식 기반 인포그래픽

    • 실제 곤충 사진의 주요 피사체를 유지하면서 연구용 인포그래픽으로 확장함
    • 분류학 정보, 형태적 특징 주석, 확대 상세 화면, 축척 막대를 포함함
    • 결과물을 학술 출판에 바로 사용할 수 있는 연구 도표 형태로 구성함
  • 최신 정보와 IP 활용

    • 모델이 보유한 지식뿐 아니라 인터넷에 연결해 최신 정보를 검색할 수 있음
    • 7월 21일 Hangzhou 날씨를 검색해 일기예보 이미지를 생성함
    • 특정 IP 인물을 찾아 이를 바탕으로 이미지를 만들 수 있음
    • Qi Baishi와 Van Gogh가 라이브스트리밍 방에서 Qwen-Image-3.0을 소개하는 장면을 생성함

생산성 작업으로의 확장

  • 세 가지 핵심 역량을 바탕으로 신문 PDF, 숏드라마 스토리보드, 복잡한 UI 인터페이스 같은 고가치 작업을 지원함
  • 이미지 생성 역량을 디자인, 콘텐츠 제작, 교육, 전자상거래 등 더 많은 분야의 생산성 가치로 연결하는 것을 목표로 함
Read Entire Article