알리바바가 텍스트-이미지 생성, 단일 이미지 편집, 멀티 이미지 편집 기능을 통합한 Swift-Image 6B 모델을 공개했어요. 이 모델은 60억 개의 파라미터로 구성된 DiT 아키텍처를 채택했어요. Character-level 토큰화 기술을 적용해 생성 이미지 내 텍스트 표현을 개선했어요.
Swift-Image는 블록 공유 타임스텝 조절, 병렬 어텐션 및 MLP 연산, 4D 로터리 위치 인코딩 등 다양한 기술을 활용했어요. 멀티 이미지 편집 시 위치 오프셋과 이미지 선행 입력 형식을 지원하여 참조 조건 편집이 가능해요. 이 모든 기술을 통해 여러 생성 및 편집 설정을 위한 단일 생성 백본을 제공해요.
논문은 arXiv에 공개되었으며 Reddit 사용자 /u/AgeNo5351이 해당 논문을 공유했어요.