67센트로 ARC-AGI-1에서 44% 달성

1 hour ago 1

소형 Transformer를 RTX 5090에서 1.5시간 동안 처음부터 학습해 전체 학습·추론 비용 67센트로 ARC-AGI-1 44%, ARC-AGI-2 7%를 기록했으며 TRM·HRM과 같은 점수에 도달함 입력·출력 격자를 토큰화하고 과제별 임베딩, 3D RoPE, 색상·이면체 변환 증강을 결합해 여러 퍼즐을 함께 학습하며, 테스트 출력으로 가장 빈번한 후보 2개를 제출함 SwiGLU·RMSNorm·8개 계층·NorMuon·가변 길이 FlashAttention을 도입하고 손실을 출력 토큰에만 적용해 ARC-AGI-1 점수를 약 40%에서 44%로 높이면서 증강과 비용을 줄임 3D RoPE나 과제별 임베딩을 제거하면 점수가 각각 약 24%로 떨어졌으며, 여러 실행에서 해결한 과제의 합집합은 55% 여서 같은 Transformer 체계로 65%에 도달할 여지가 있다고 봄 검증 손실은 나빠졌지만 실제 점수는 높아진 결과가 소규모 데이터에서 최저 검증 손실만 추구하는 방식의 한계를 드러내며, 공개된 코드로 점수 향상·비용 절감·데이터 증강 제거를 실험할 수 있음 표본 효율성을 위한 ARC-AGI 선택 목표는 오늘날 AI의 핵심 문제로 보는 표본 효율성을 개선하는 것임 현재 Transformer와 딥러닝 방식으로 달성할 수 있는 표본 효율성의 한계를 확인함 반복 실험을 빠르고 저렴하게 수행할 수 있도록 비용을 낮춤 이후에는 이 한계를 넘기 위한 새로운 연구 아이디어를 시험할 계획임 ARC는 표본 효율성을 시험하기에 적합한 특성을 가짐 고차원 공간에 퍼즐이 약 1,000개뿐임 퍼즐마다 규칙은 다르지만 공통 개념을 공유하는 메타학습 벤치마크임 평가 세트에 필요한 개념이 훈련 세트에도 있어 필요한 사전 지식이 적음 사람에게는 매우 쉽고 컴퓨팅 자원이 부족한 연구자도 접근할 수 있음 대량의 합성 데이터나 사람이 설계한 귀납 편향을 사용하는 방법을 제외하면 데이터 효율성 측면에서 아직 포화되지 않음 모델과 학습 방식 각 입력·출력 쌍을 토큰 시퀀스로 바꾸고 소형 Transformer가 이를 자기회귀 방식으로 학습함 모델은 테스트 시점에 초기 상태부터 학습됨 훈련 퍼즐과 평가 퍼즐을 함께 사용하지만 평가 퍼즐의 테스트 출력 정답은 숨김 퍼즐 간 학습을 가능하게 하도록 각 퍼즐에 별도의 학습 가능한 과제별 가산 임베딩을 부여함 각 시퀀스에 2개의 2차원 격자가 있으므로 위치 정보에는 3D RoPE 임베딩을 사용함 색상 순열과 ...

Read Entire Article