연구진은 다중 모드 사전 훈련의 작동 원리를 체계적으로 분석하여 4가지 핵심 통찰력을 얻었습니다.
분석 결과, 언어, 시각 이해, 시각 생성 간 지식 흐름 패턴이 불균형하며, 데이터 복잡성에 따라 모달리티 간 시너지 효과가 결정됩니다.
초기 통합 방식이 후기 정렬이나 순차적 훈련보다 효과적이며, 시각적 우선 의존 현상(vision laziness)이 나타납니다.
연구진은 효율적인 사전 훈련 레시피를 개발하여 컴퓨팅 예산의 5% 만으로 강력한 생성 성능을 달성했으며, 135억 파라미터 MoE 모델로 검증했습니다.