SenseNova가 7B 파라미터의 멀티태스크 비전 모델 'SenseNova-Vision'을 공개했어요. 이 모델은 객체 감지, 분할, 깊이 추정, OCR, 3D 재구성 등 다양한 작업을 하나의 생성 문제로 처리합니다.
별도의 예측 헤드 없이 자연어 지시를 통해 이미지, 텍스트 결과물을 생성하며, 특히 멀티뷰 3D 재구성 및 카메라 포즈 추정 기능이 주목받고 있어요.
5000만 개의 instruction-response 페어 데이터셋으로 학습되었으며, Hugging Face에서 모델 가중치를 다운로드하고 웹 데모를 체험할 수 있지만, 고성능 GPU가 필요해요.
GitHub에서 학습 파이프라인과 데이터 준비 관련 정보도 공개되어, 사용자들이 직접 모델을 학습하거나 fine-tuning할 수 있도록 지원합니다.