Part 7 · Transformer Architecture - Making Every Layer Stable

각 층의 계산을 안정적으로 만드는 방법

Residual Connection으로 정보는 잘 보존되지만, 숫자의 크기는 층을 지날수록 점점 커지거나 작아질 수 있습니다. Layer Normalization은 하나의 토큰 벡터 안에 있는 값들을 적절한 범위로 정리하여 다음 층이 안정적으로 계산할 수 있도록 도와줍니다.

A Photo Editing Story

사진의 밝기가 너무 들쭉날쭉하면 보기 어렵다

사진 한 장에 너무 밝은 부분과 너무 어두운 부분이 함께 있다고 생각해 봅시다.

정리 전
매우 밝은 곳
200
보통 부분
40
매우 어두운 곳
2
밝기와 대비를 정리한 뒤
가장 밝은 곳
1.2
중간 부분
0.0
가장 어두운 곳
-1.2

사진의 내용이 바뀐 것은 아닙니다. 가장 밝은 부분은 여전히 가장 밝고, 가장 어두운 부분도 그대로 가장 어둡습니다.

전체 밝기 범위만 보기 좋게 정리한 것입니다. Layer Normalization도 벡터의 의미는 유지하면서 숫자 범위를 정리합니다.
Back to Transformer

Residual로 더한 뒤 숫자가 들쭉날쭉해질 수 있다

원래 입력 기존 토큰 벡터
새 계산 결과 Self-Attention 결과
두 벡터를 더함 Residual Add
숫자 범위 정리 Layer Normalization
Residual Connection은 정보를 보존하고, Layer Normalization은 더해진 숫자를 다음 층이 처리하기 좋은 상태로 정리합니다.
One Token at a Time

문장 전체를 섞는 것이 아니라 토큰별로 정리한다

Layer Normalization은 Tom과 lives와 New York을 모두 섞어 하나의 값으로 만들지 않습니다. 각 토큰이 가진 벡터를 따로 정리합니다.

Tom 벡터
12.0 2.5 0.8

Tom 벡터 안의 숫자만 정리

lives 벡터
3.0 9.0 1.5

lives 벡터는 별도로 정리

New York 벡터
7.0 2.0 10.0

New York 벡터도 자체 기준으로 정리

핵심은 이것입니다. 한 토큰 벡터 안의 숫자들을 안정적인 범위로 정리한다.
Before and After

숫자는 바뀌지만 중요한 관계는 남는다

정리 전

[12.0, 2.5, 0.8]

첫 번째 값이 가장 크고 세 번째 값이 가장 작습니다.

정리 후

[1.2, 0.0, -1.2]

숫자 범위는 작아졌지만 크고 작은 순서는 그대로 남아 있습니다.

위 숫자는 개념을 설명하기 위한 예시입니다. 지금은 계산법보다 의미는 유지하고 숫자 범위만 안정적으로 정리한다는 역할이 중요합니다.
The Simple Flow

Transformer 안에서의 위치

Self-Attention 단어 관계 계산
Residual Add 원래 입력 더하기
Layer Normalization 숫자 범위 정리
Feed Forward 표현을 더 깊게 가공
Layer Normalization은 다음 계산이 갑자기 너무 크거나 작은 숫자를 받지 않도록 중간 결과를 정돈하는 역할을 합니다.
Interactive Comparison

정리 전후를 간단히 비교해 보자

아래 버튼을 눌러 정리 전과 정리 후의 차이를 확인해 보세요.

Tom 벡터

값의 차이가 매우 큼

가장 큰 값이 다른 값을 압도할 수 있어 다음 층이 계산하기 까다롭습니다.

[12.0, 2.5, 0.8]
Layer Normalization 전에는 숫자의 범위가 크게 벌어져 있습니다.
Common Misunderstandings

두 가지만 기억하자

모든 값을 똑같게 만든다?

아닙니다. 값의 차이는 남겨 두고 전체 범위만 정리합니다.

문장 전체를 한꺼번에 섞는다?

아닙니다. 각 토큰 벡터를 따로 정리합니다.

What Comes Next?

숫자를 정리한 뒤에는 무엇을 할까?

Self-Attention으로 단어 관계를 찾았고, Residual Connection으로 원래 정보를 보존했으며, Layer Normalization으로 숫자 범위를 안정적으로 정리했습니다.

다음 페이지에서는 각 토큰의 표현을 더 깊게 가공하는 Feed Forward Network를 살펴봅니다.
Summary

핵심 정리

  • Residual Add 뒤에는 벡터 숫자의 범위가 들쭉날쭉해질 수 있습니다.
  • Layer Normalization은 한 토큰 벡터 안의 숫자들을 정리합니다.
  • 가장 큰 값과 가장 작은 값의 관계는 유지합니다.
  • 모든 값을 똑같게 만드는 과정은 아닙니다.
  • 숫자를 다음 층이 다루기 좋은 안정적인 범위로 맞춥니다.
  • Transformer에서는 Residual Add 뒤의 결과를 정리하는 데 사용됩니다.