대형 언어 모델
대규모 언어 모델(LLM)은 수십억 개 이상의 파라미터를 가진 인공 신경망 기반 언어 모델로, 레이블링되지 않은 대규모 텍스트를 자기 지도 학습으로 훈련해 다양한 자연어 처리 작업을 수행합니다. 2017년 구글의 트랜스포머 아키텍처 발표 이후 2018년 BERT와 GPT-1이 등장했고, 2019년 GPT-2는 악용 우려로 공개가 보류될 만큼 강력한 성능을 보였습니다. 2022년 ChatGPT의 출시는 대중의 상상력을 자극하며 LLM을 널리 알렸고, 2023년 GPT-4는 멀티모달 기능으로 '성배'라는 평가를 받았으며, 2024년에는 추론 능력을 강화한 OpenAI o1이 출시되었습니다. 한편 2025년에는 DeepSeek R1이 낮은 비용으로 경쟁력 있는 성능을 보여주었고, BLOOM, LLaMA, Mistral 등 오픈소스 모델도 활발히 개발되고 있습니다. 그러나 LLM은 사실이 아닌 정보를 그럴듯하게 생성하는 환각(hallucination) 문제가 지적되며, 이를 보완하기 위해 외부 문서를 검색해 참조하는 검색 증강 생성(RAG) 기법이 활용되고 있습니다.
Source: 대형 언어 모델 — Wikipedia · Summary by RollWiki AI · Language: Korean