StartupBench는 실제 사용자 수요 기반 AI 에이전트 성능을 측정하는 새로운 벤치마크입니다. 시장에서 검증된 AI 스타트업 제품의 워크플로우를 분석하여 실제 업무 환경에서 AI가 수행할 수 있는 작업을 평가합니다. 현재 최고 성능 모델도 StartupBench에서 약 30%의 작업만 완료하며, 복잡한 지시 수행 및 전문 지식 부족이 주요 원인으로 분석됐습니다.
StartupBench는 기존 벤치마크의 연구자 중심적인 한계를 극복하고, 실제 사용자의 요구사항을 반영한 평가 기준을 제시합니다. 다양한 전문 분야에서 AI가 수행할 수 있는 실제 업무를 파악하고, 복합적인 요구사항을 반영한 세분화된 평가 기준을 적용합니다. 이를 통해 현재 AI 에이전트의 한계를 명확히 보여주고, 향후 발전 방향을 제시합니다.
StartupBench 분석 결과, 현재 AI 에이전트는 시장 검증된 워크플로우를 안정적으로 수행하는 데 어려움을 겪고 있으며, 이는 복잡한 지시 수행 능력과 전문 지식 부족에서 비롯됩니다. StartupBench는 실제 업무 환경에서 AI 에이전트의 성능을 측정하는 중요한 지표로 활용될 수 있습니다.