신경망의 작동 원리를 수학적으로 설명하려는 시도에서 NTK(Neural Tangent Kernel) 이론에만 의존하여 모델을 설계하는 팀과, 실제 가중치 변화를 통한 비선형적 특징 학습(Feature Learning)의 동역학을 깊이 이해하는 팀은 복잡한 데이터셋에서 전혀 다른 결과에 도달합니다. 전자는 이론적 예측 가능성을 얻는 대신 모델의 잠재적 성능을 제한할 위험이 있으며, 후자는 신경망이 데이터의 계층적 구조를 어떻게 스스로 파악하는지를 활용해 압도적인 정확도를 달성합니다. 최근 발표된 연구는 왜 특정 작업에서 무한 너비 신경망의 근사치인 NTK가 실제 훈련된 신경망보다 성능이 떨어지는지를 '지수적 열위'라는 개념으로 명확히 규명했습니다.
1. 5분 안에 확인하는 NTK와 실제 신경망의 성능 차이
개발자가 NTK와 실제 신경망의 성능 차이를 체감하는 가장 빠른 방법은 JAX와 Neural Tangents 라이브러리를 활용해 동일한 아키텍처에서 '커널 회귀'와 '경사 하강법 훈련'을 비교해 보는 것입니다. 연구에 따르면, 데이터가 단순히 평면적인 분포를 가진 것이 아니라 여러 함수가 중첩된 '복합적 구조(Compositional Structure)'를 가질 때 두 방식의 격차는 극명해집니다. NTK는 초기 가중치 근처에서 선형적으로 모델을 근사하기 때문에 데이터의 복잡한 계층을 파악하는 데 한계가 있습니다.
실제로 단위 원(Unit Circle) 위에서 정의된 복합 함수를 학습시켜 보면, NTK 기반 모델은 데이터 샘플 수가 증가하더라도 성능 향상 폭이 매우 더딘 반면, 실제 신경망은 특정 임계점을 넘어서는 순간 에러율이 급격히 감소하는 현상을 보입니다. 이는 신경망이 훈련 과정에서 가중치를 크게 이동시키며 데이터에 최적화된 '특징 공간'을 새롭게 구성하기 때문입니다. 이러한 차이를 이해하는 것이 현대 딥러닝 아키텍처 설계의 첫걸음입니다.
2. 실전 프로젝트를 위한 설정: '게으른 학습'에서 벗어나기
이론적으로 NTK는 신경망의 너비가 무한대로 발산할 때의 동작을 설명하며, 이를 흔히 '게으른 학습(Lazy Training)' 체제라고 부릅니다. 하지만 실제 프로덕션 환경에서 우리가 원하는 것은 모델이 데이터의 핵심 패턴을 학습하는 '활발한 학습(Active Learning)' 체제입니다. 이를 구현하기 위해서는 학습률(Learning Rate)과 가중치 초기화 스케일을 세심하게 조정해야 합니다. 연구에서는 NTK 체제에 머물러 있는 모델이 복합적인 기능을 학습할 때 실제 신경망보다 지수적으로 더 많은 데이터가 필요함을 지적합니다.
실전 프로젝트에서 모델이 특징 학습을 수행하도록 유도하려면, 초기 가중치의 분산을 적절히 낮추거나 학습률을 충분히 높여 가중치가 초기 상태에서 멀리 이동할 수 있는 환경을 만들어야 합니다. 특히 계층적 데이터 구조가 뚜렷한 자연어 처리나 복잡한 이미지 인식 작업에서는 이러한 설정이 모델의 수렴 속도와 최종 정확도에 결정적인 영향을 미칩니다. 단순한 커널 근사에 머물지 않고 신경망의 비선형 동역학을 끌어내는 것이 핵심입니다.
3. 프로덕션 고려사항: 연산 효율과 모델 표현력의 균형
프로덕션 환경에서 NTK와 같은 커널 방법론은 훈련 과정 없이 예측이 가능하다는 비용적 이점이 있지만, 이번 연구에서 밝혀진 '지수적 성능 열위'는 그 비용 절감이 치명적인 성능 저하로 이어질 수 있음을 경고합니다. 데이터가 계층적으로 구성된 경우, NTK 모델이 실제 신경망과 대등한 성능을 내기 위해서는 기하급수적으로 많은 파라미터나 샘플이 필요할 수 있습니다. 이는 결과적으로 인프라 비용과 추론 지연 시간을 오히려 증가시키는 결과를 초래합니다.
따라서 아키텍처를 결정할 때 데이터의 '복합성(Compositionality)'을 먼저 평가해야 합니다. 데이터의 입력과 출력 사이에 여러 단계의 논리적 추론이나 특징 추출이 필요하다면, 계산 비용이 조금 더 들더라도 특징 학습이 가능한 깊은 신경망 구조를 선택하는 것이 장기적으로는 더 효율적입니다. 보안이나 금융 분야처럼 미세한 패턴 변화가 중요한 도메인일수록, 단순 근사 모델보다는 데이터의 비선형적 특성을 직접 학습하는 모델이 훨씬 더 견고한 성능을 보장합니다.
4. 실무자를 위한 팁: 데이터의 계층적 구조 파악하기
전문가로서 모델을 최적화하려면 단순히 레이어를 쌓는 것을 넘어, 해결하려는 문제가 얼마나 '복합적인지'를 분석해야 합니다. 연구에서 제시한 '함수 공간의 이분법(Function-Space Dichotomy)'은 데이터의 구조에 따라 NTK가 잘 작동하는 영역과 그렇지 않은 영역이 명확히 나뉜다는 점을 시사합니다. 만약 데이터가 낮은 차원의 매니폴드에 흩어져 있는 단순한 형태라면 NTK로도 충분하지만, 현실의 데이터는 대부분 고차원적인 복합 구조를 가집니다.
결론적으로, 성능 최적화의 핵심은 모델이 데이터의 계층적 특징을 얼마나 효율적으로 '압축'하여 학습하느냐에 달려 있습니다. 이를 위해 잔차 연결(Residual Connections)이나 어텐션(Attention) 메커니즘을 적극 활용하여 경사 흐름을 원활하게 하고, 가중치 업데이트가 유의미한 특징 공간의 변화를 만들어내고 있는지 모니터링해야 합니다. 딥러닝의 진정한 힘은 단순한 함수 근사가 아니라, 데이터 속에 숨겨진 복잡한 계층 구조를 스스로 찾아내는 동역학에 있음을 잊지 말아야 합니다.
참고: arXiv CS.LG (Machine Learning)