AMD V620 GPU에서 Qwen 27B와 Gemma A4B 모델의 llama.cpp 벤치마크 결과를 공유했어요. ROCm과 Vulkan 환경에서 각각 테스트했으며, 모델별로 다양한 설정값을 사용했어요. 벤치마크 결과, Gemma 모델이 Qwen 모델보다 더 높은 토큰 생성 속도를 보여줬어요.
Qwen ROCM은 약 3.4k 토큰에서 14.3 토큰/초, Qwen Vulkan은 8.6 토큰/초를 기록했어요. Gemma ROCM은 50.5 토큰/초, Gemma Vulkan은 65.1 토큰/초를 기록하며 우수한 성능을 보여줬어요. 최대 26.7k 토큰까지 테스트했으며, Qwen 모델은 18.3~19.9 토큰/초, Gemma 모델은 51.1~76.8 토큰/초의 속도를 기록했어요.
벤치마크는 실제 13페이지 분량의 책 발췌본을 컨텍스트로 사용했으며, 최대 토큰 수는 16개, 온도는 0으로 설정했어요.