연구진이 Omni-LLM의 실시간 비디오 어시스턴트 성능을 평가하는 새로운 벤치마크 OmniAssistBench를 공개했어요.
OmniAssistBench는 모델의 예측 불가능한 응답으로 인한 상호 작용 경로의 차이 문제를 해결하기 위해, 사전 정의된 가이드라인을 제공하여 사용자가 동일한 경로를 따르도록 유도해요.
Gemini-3-Pro는 100점 만점에 66.4점을 기록했고, Qwen3-Omni-Instruct는 51.2점을 기록했으며, 현재 모델들은 시각적 프롬프트 이해, 맥락 유지, 적절한 응답 지연 등의 어려움을 겪고 있어요.