Show HN: Jev가 Pokémon Red를 플레이함

2 hours ago 1

Hacker News 의견들 판단은 빠르지만 이리저리 오가는 모습이 무작위 행동처럼 보임. 이전에 내린 결정 중 일부라도 상태 정보에 다시 넣어주고 있는지? 처음 몇 분은 속도와 저렴한 비용에 감탄했지만, 계속 보니 판단이 상당히 나쁘고 같은 문을 끝없이 드나드는 이상한 반복에 빠짐. 방향은 맞지만 아직 충분히 성숙한 기술은 아닌 듯함. 앞으로 나올 결과물은 기대되지만, 당장 이 기술을 기반으로 개발하지는 않을 것 같음. Jev를 둘러싼 열광이 좀 이상하게 느껴짐. 기본적인 의사결정과 분류를 잘하는 신경망에서 출발해 언어 모델을 점점 키워왔는데, 이제는 의사결정을 그럭저럭 하는 작은 모델을 만들었다고 다들 열광하는 셈임. AI가 Pokémon을 서툴게 플레이하는 데 감탄하던 단계는 10년쯤 전에 이미 지나지 않았는지? Jev는 단발성 분류용이지, 보상이 지연되고 탐색과 활용 사이에서 선택해야 하는 다단계 강화학습 환경용이 아님. 입력에 행동 이력을 추가하지 않으면 매번 높은 확신으로 같은 문을 통과할 것 같음. 오늘 아침 친구에게 보낸 메시지도 이 얘기였음. Jev에서 가장 흥미로운 건 정작 얼마나 똑똑한지에는 관심이 없어 보인다는 사실임. 다른 LLM이 직접 분류한 결과와 비교하면 어떤지 한 번도 듣지 못했고, 빠르고 싸다는 얘기뿐이었음. 몇 분간 지켜보니 실제 판단 능력에 조금 더 관심을 가져야 할 것 같음. 단순한 작업에는 Jev, 전략적 사고에는 더 똑똑한 추론 모델을 조합하는 게 최적이라고 봄. 다만 이번 실험은 전적으로 Jev만 사용하므로 가끔 꽤 멍청하게 행동하기도 함. 배경에 틀어놓고 보기 편안함. 암 치료 같은 문제를 풀고 있는 최상위 모델의 실시간 추론 방송도 있으면 좋겠음. 실제로 해결하는 순간 채팅창이 얼마나 열광할지 상상하게 됨. AI를 실시간으로 방송하는 사람이 더 많아져야 함! 그런 용도라면 사람 목숨이 걸리니, 별다른 노력 없이 재미로 만들어봤다는 가벼운 분위기는 사라질 것임. 멋진 프로젝트지만, 하네스의 안내가 과한 편이라고 봄. 길 찾기나 텍스트로 된 중간 목표 등이 제공됨. 다만 제작자가 README에서 이 점을 아주 명확하게 밝히고 있기는 함. 일반적인 vLLM과 결합하면 정말 흥미로울 듯하며, 특히 추론 로그를 보고 싶음. 최신 공개 모델에서 Pokémon에 관한 사전 학습 지식을 모두 제거해, Pokémon이라는 개념조차 모르는 지적인 존재로서 추론하게 만들면 더 재미있을...

Read Entire Article