연구진이 의료 분야 LLM의 다국어 평가를 위한 벤치마크 'HealMed'를 발표했어요. HealMed는 9개 언어, 9개 데이터셋, 3가지 작업 형식을 포함하며, 23명의 의료 전문가가 2년간 개발했어요. 다국어 환경에서 모델 성능은 저자원 언어에서 감소하는 경향을 보였어요.
상용 모델은 언어 간 안정성이 높았지만, 오픈 소스 모델은 성능 격차가 더 컸어요. 의료 전문성이 다국어 성능을 보장하지는 않으며, 전문가 검토는 성능을 향상시키거나 저하시킬 수 있어요.