왜 새로운 NLP 기술이 계속 등장했을까?
자연어는 단어의 순서, 문맥, 의미 관계가 복잡하게 얽혀 있습니다. 초기 모델은 짧은 문장과 단순한 패턴은 처리할 수 있었지만, 긴 문맥을 기억하거나 여러 단어의 관계를 동시에 이해하는 데 한계가 있었습니다.
새로운 기술은 이전 기술을 완전히 없애기 위해 등장한 것이 아니라, 기존 방식의 한계를 줄이고 더 많은 데이터를 효율적으로 학습하기 위해 발전했습니다.
주요 기술의 발전 과정
장단기 메모리 (LSTM)
기억 구조 보완Word2Vec
단어 임베딩트랜스포머 (Transformer)
셀프 어텐션대규모 언어 모델 (LLM)
대규모 사전학습기술 흐름 살펴보기
아래 기술을 선택하면 각 기술이 해결한 문제와 남긴 한계를 다시 확인할 수 있습니다.
RNN — 문장을 순서대로 처리
이전 시점의 정보를 다음 시점으로 전달하여 단어 순서를 반영했습니다. 그러나 긴 문장의 앞부분 정보를 오래 유지하기 어렵고, 순차 계산 때문에 학습을 병렬화하기 어렵습니다.
주요 기술 비교
| 기술 | 핵심 아이디어 | 개선한 점 | 대표 한계 |
|---|---|---|---|
| RNN | 이전 상태를 다음 단계로 전달 | 단어 순서를 가진 문장 처리 | 긴 문맥 기억과 병렬화의 어려움 |
| LSTM | 게이트를 이용한 기억 제어 | 장기 의존성 문제 완화 | 여전히 순차 계산 필요 |
| Word2Vec | 문맥을 이용한 단어 벡터 학습 | 단어 의미와 유사성 표현 | 문맥에 따라 변하지 않는 고정 벡터 |
| Transformer | 셀프 어텐션과 병렬 처리 | 긴 거리 관계와 학습 효율 개선 | 큰 계산량과 메모리 사용 |
| LLM | 대규모 사전학습과 범용 생성 | 하나의 모델로 다양한 작업 수행 | 환각, 비용, 편향, 신뢰성 문제 |
기술은 서로 어떻게 연결되는가?
이 흐름은 완전한 NLP 연대표인가?
학습 내용 정리
이번 장에서는 자연어 처리 기술이 발전해 온 대표적인 흐름을 살펴보았습니다.
- RNN은 문장을 순서대로 처리하여 단어의 순서를 반영했습니다.
- LSTM은 필요한 정보를 오래 기억하도록 RNN의 기억 구조를 보완했습니다.
- Word2Vec은 단어를 의미를 가진 벡터로 표현하는 방법을 확산시켰습니다.
- Transformer는 셀프 어텐션과 병렬 처리를 통해 긴 문맥을 효과적으로 학습했습니다.
- LLM은 Transformer를 대규모로 사전학습하여 여러 자연어 처리 작업을 하나의 모델로 수행합니다.
이후 장에서는 이 흐름의 출발점인 RNN부터 차례대로 살펴보며, 각 모델이 문장을 어떻게 읽고 학습하는지 더 자세히 알아봅니다.