1. LLM이란?
- 대규모 텍스트에서 언어의 구조와 패턴을 학습해 문장을 이해하고 생성하는 인공신경망 모델
- ✅ 문장 패턴을 모델 내부의 파라미터에 반영함 (단어와 문장의 관계, 문맥, 문법, 표현 방식 등)
- ➡️ 주어진 문맥에서 다음에 올 가능성이 높은 토큰을 생성함
- ex) 문장 생성, 요약, 번역, 질문 답변, 코드 작성 등
2. 자기지도학습
- 사람이 모든 정답을 붙이지 않아도 데이터 자체에서 정답을 만들어 학습하는 방식
학습 과정
- 텍스트 입력
- 다음 토큰 예측
- 실제 토큰과 비교
- 틀린 정도 계산 (손실)
- 파라미터 수정
- 반복
ex) 대한민국의 수도는? 이란 질문하기
더보기
- 모델 예측: 부산
- 실제 답: 서울
- ✅ 틀렸을 경우 다음에는 서울의 확률이 높아지도록 내부 파라미터를 조정함
- ➡️ 이 과정을 매우 많이 반복하면서 언어 패턴을 학습함
파라미터
- 학습 과정에서 조정되는 모델 내부의 숫자
- ✅ 특정 입력에 어떤 정보가 중요한 지, 다음 토큰의 확률을 어떻게 계산할지를 결정함
3. 작동 과정
- 문장 입력
- 토큰화: 문장을 모델이 처리할 수 있는 작은 단위로 나누고 숫자로 변환하는 과정.
- 벡터화: 토큰을 숫자 벡터로 변환시킴
- 문맥 분석: 트랜스포머에 의해 수행됨
- 다음 토큰 확률 계산
- 토큰을 하나씩 생성
- 문장 생성
4. 프롬프트
- 사용자가 LLM에 입력하는 질문, 명령, 조건, 예시 등의 정보
- ✅ 학습된 모델이 어떤 방식으로 답할지 방향을 정함
5. 멀티모달 모델
- 텍스트 뿐 아니라 이미지, 음성, 영상 등 여러 형태의 데이터를 함께 처리하는 모델
출처
'AI' 카테고리의 다른 글
| [IBM] AI 스택 (0) | 2026.07.17 |
|---|---|
| [IBM] MCP (0) | 2026.07.17 |
| [Wiki] 3. AI Agent (0) | 2026.07.15 |
| [Wiki] 2-2. LLM: RAG (0) | 2026.07.14 |
| [Wiki] 1. AI (0) | 2026.07.14 |