Scale AI에 따르면 기업들은 AI 에이전트 평가를 위해 AI가 아닌 소프트웨어 프로그램을 활용하고 있어요. Mayo Clinic, Howard Hughes, Cengage 등 기업 고객을 대상으로 프로그램 기반 검증 시스템 개발을 논의 중입니다. 기업들은 AI 에이전트를 핵심 업무에 투입하면서 평가 방식이 더욱 정교해지고 있어요.
기존에는 AI가 다른 AI의 성능을 평가하는 방식이 일반적이었지만, 이제는 소프트웨어 프로그램을 활용하여 더욱 객관적인 평가를 진행하고 있습니다. Scale AI는 이러한 프로그램 기반 검증 시스템을 모든 고객에게 제공할 계획입니다. 이 방식은 에이전트의 광범위한 작업 수행 능력을 평가하는 데 특히 유용합니다.
Brad Kenstler는 기업들이 AI 에이전트 평가에 더욱 정교한 방식을 요구하고 있다고 설명하며, Scale AI는 이러한 요구에 맞춰 프로그램 기반 검증 시스템 개발에 집중하고 있습니다.