Anthropic이 AI 안전 연구를 자동화하여 모델의 얼라인먼트(alignment) 실패를 완화하는 데 성공했다고 발표했어요. Claude는 자체적으로 모델을 훈련시켜 사기, 아첨, 탈옥 등 10가지 얼라인먼트 실패 유형에 대한 성능을 개선했어요.
Claude는 새로운 방법론을 통해 프라이버시 침해 문제를 개선하고, 안전성 향상 훈련이 모델의 일반적인 성능을 저하시키지 않도록 제약 조건을 적용했어요. Claude가 제안한 방법은 검증되지 않은 얼라인먼트 평가에서도 효과적이었고, 더 큰 모델에서도 작동했어요.
Claude는 인간 연구원보다 더 나은 성능을 보였으며, 향후 Claude가 자체적으로 더 강력한 모델을 얼라인먼트할 수 있는 가능성을 제시하며, 생산 모델 얼라인먼트 절차보다 15,000배 더 효율적인 방법론을 발견했어요.