LLM이 5학년 이후의 학습 자료를 전혀 보지 못하면 어떻게 될까?

4 hours ago 8

LittleLearner는 미국 초등학교 K–5 교육과정으로 제한한 880억 토큰 말뭉치만으로 처음부터 훈련해, 사전학습 지식의 경계가 모델 능력에 미치는 영향을 검증함 FineWeb-Edu를 Common Core 기준의 5단계 파이프라인으로 필터링하고, 5학년 이후의 개념·사실·어휘를 명시적으로 제외한 LittleCurriculum을 구축함 0.6B·1.3B·5B 모델을 아키텍처·토큰·훈련 방식이 같은 비필터링 대조군과 비교한 결과, 모델 확장은 교육과정 내부와 같은 학습 궤적의 문제에는 효과가 있었지만 범위 밖의 고급 문제에는 거의 도움이 되지 않았음 범위 밖 데이터로 진행한 GRPO 후속 훈련도 K–5 능력만 크게 높였고, 시험한 프롬프트를 이용한 문맥 내 학습 역시 5B 모델에 새로운 K–5 이후 추론 능력을 부여하지 못함 사전학습 데이터의 경계가 능력의 상한을 정하며, 규모 확장·후속 훈련·문맥 내 학습은 이미 배운 능력을 끌어낼 수는 있어도 범위 밖 지식을 의미 있게 획득시키지는 못함 교육과정으로 통제한 데이터와 모델 LittleCurriculum은 FineWeb-Edu에서 추출한 880억 토큰 말뭉치로, Common Core K–5 표준에 맞춘 5단계 필터링을 거침 5학년보다 높은 학년에서 가르치는 개념·사실·어휘를 명시적으로 배제함 훈련 분포 자체를 제한해 새로운 능력을 실제로 학습한 것인지, 이미 가진 능력을 끌어낸 것인지 구분하도록 설계함 LittleLearner는 0.6B·1.3B·5B 세 규모로 처음부터 훈련됨 각 모델에는 아키텍처·훈련 토큰·훈련 방식을 공유하는 비필터링 Unfiltered 대조군이 있음 Base는 사전학습 모델이며, GRPO는 MathCAMPS로 후속 훈련한 수학 특화 모델이라 수학 중심 출력을 보일 수 있음 Chatty는 일반적인 대화 행동에 맞춰 조정한 변형임 브라우저 데모에서 호스팅된 5B 모델과 대화할 수 있음 모델 체크포인트는 Hugging Face에서 제공됨 0.6B Base · 0.6B GRPO · 0.6B Chatty 1.3B Base · 1.3B GRPO · 1.3B Chatty 5B Base · 5B GRPO · 5B Chatty 사전학습이 정한 능력의 경계 규모 확장은 통제된 지식 범위 안의 성능을 높이고 같은 학습 궤적에 있는 문제까지 제한적으로 확장했지만, 노출 범위 밖의 고급 능력이 필요한 문제에는 거의 효과가 없었음 GRPO 후속 훈련은 K–5...

Read Entire Article