TEAMMix는 LLM 기반 약한 지도 계층적 텍스트 분류 프레임워크입니다. 키워드 생성과 코퍼스 마이닝으로 레이블 계층을 의미적으로 풍부하게 만들어 모델의 이해도를 높입니다. 가우시안 혼합 모델을 활용해 신뢰도 기반 리샘플링으로 생성 데이터 품질을 최적화합니다.
LLM이 생성한 가짜 샘플을 활용해 긴 꼬리 문제(long-tail problem)를 완화하고, 레이블 구조 정보를 손실하는 기존 방식의 한계를 극복합니다. 세밀하고 불균형 데이터셋에서 분류 성능을 크게 향상시킵니다.
키워드 생성, 코퍼스 마이닝, 가짜 샘플 생성, 가우시안 혼합 모델 등 다양한 기술을 결합하여 LLM 기반 약한 지도 HTC 성능을 높입니다.