Qwen에 GPT의 추론 앞부분을 넣자, 최종 답변의 표현도 GPT와 비슷해짐

4 hours ago 3

GPT-5.5 Pro가 문제를 푸는 추론 과정의 첫 1%만 Qwen3.8 A95B에 넣었더니, 스스로 생성한 최종 답변도 GPT의 표현에 더 가까워지는 결과가 나옴 과학/기술 문제와 일반 문제, 합성 퍼즐 등 45개 문제에서 답변의 단어와 구절이 겹치는 점수가 16.79%에서 34.97%로 상승했으며, 정답률을 측정한 것은 아님 앞선 실험에서는 Claude Opus 4.8의 추론을 넣어도 Qwen의 답변이 거의 달라지지 않았지만, 이번 GPT 추론에는 세 범주 모두에서 큰 변화를 보임 같은 조건에서 DeepSeek V4 Flash와 Inkling은 변화가 작았고, Kimi K3는 원래 GPT와 표현이 가장 많이 겹쳤지만 추론을 넣은 뒤 증가 폭은 Qwen보다 작았음 실험자는 Qwen이 GPT-5.5 Pro나 유사한 GPT 모델의 출력으로 학습했을 가능성을 제기하지만, 이 결과만으로 실제 학습 출처를 확정할 수는 없음 실험 방식과 측정 지표 v1.1 실험은 Reasoning prefills on a few open models와 Stolen Thoughts의 후속 실험으로, 교사 모델을 GPT-5.5 Pro로 바꿔 실행함 각 문제에서 대상 모델별로 두 가지 조건의 응답을 생성함 일반 조건에서는 추론을 미리 넣지 않음 프리필 조건에서는 GPT-5.5 Pro 추론의 첫 1% 를 대상 모델의 추론 채널에 넣음 사용자에게 보이는 최종 답변은 두 조건 모두 대상 모델이 자유롭게 생성함 중복 점수는 대상 모델 답변의 첫 100토큰에 교사 모델의 최종 답변이 얼마나 나타나는지를 측정함 유니그램·바이그램·트라이그램의 원문 재현율(source recall) 평균을 사용함 변화량은 상대 증가율이 아닌 절대 퍼센트포인트(%p) 차이임 평가 대상은 45개 문제로, STEM 15개·비STEM 15개·합성 퍼즐 15개로 구성됨 전체 모델 비교 Qwen3.8 A95B는 프리필 전 16.79%에서 프리필 후 34.97%로 +18.18%p 상승해 가장 큰 변화 폭을 보임 Kimi K3의 중복 점수는 31.11%에서 35.65%로 +4.54%p 높아짐 프리필 전후 모두 비교 모델 중 GPT-5.5 Pro와의 중복 점수가 가장 높았음 Inkling의 증가 폭은 +0.46%p로, 19.99%에서 20.45%로 소폭 상승함 DeepSeek V4 Flash는 27.30%에서 26.13%로 −1.17%p 하락함 Qwen의 범주별 반응 STEM 15개 문...

Read Entire Article