Qwen3-8B 모델을 QLoRA 방식으로 보스니아어 응답에 특화하여 파인튜닝했어요. 5천 개의 도메인 예시를 활용해 2 에폭 학습했고, 손실은 0.3524를 기록했어요.
RTX 5090에서 약 85분 만에 학습을 완료했으며, GGUF 형식으로 내보내 Ollama를 통해 제공하며 OpenAI 호환 엔드포인트로 감싸서 사용 가능해요.
torch 2.13/cu126 호환성 문제와 vLLM 실패로 GGUF/Ollama로 대체했으며, 보스니아어 SFT 경험이나 8B-MoE 모델 실행 가능성에 대한 질문을 받고 있어요.