100달러 AI 뮤직비디오 제작 대결: Claude Fable 5 vs. GPT-5.6 Sol

4 days ago 17
  • Claude Fable 5와 GPT-5.6 Sol에 같은 곡과 가사, 25·100달러 예산, 웹 검색과 ffmpeg를 제공하고 조사부터 영상 생성·편집까지 맡긴 결과, 네 번 모두 원곡을 결합한 완전한 길이의 영상을 자율적으로 완성함
  • 생성 모델과 제작 방식도 스스로 선택했으며, 네 번 중 세 번은 텍스트-투-비디오를 사용하고 Sol의 25달러 실행만 정지 이미지를 먼저 만든 뒤 애니메이션하는 파이프라인을 구성함
  • 100달러 실행의 생성 비용은 Sol 36.57달러, Fable 48.60달러에 그쳤고, LLM 토큰 비용을 포함하면 각각 39.82달러와 73.65달러로 Fable이 더 빨리 끝났지만 비용은 더 높았음
  • 모든 결과물에서 캐릭터와 이야기의 일관성, 영상 내부 동작과 음악의 템포 동기화, 생성한 클립을 다시 평가·편집하는 자기 검토가 부족했으며 가사를 지나치게 문자 그대로 영상화하는 경향도 나타남
  • Sol의 25달러 실행은 텍스트 오버레이와 정지 이미지 효과를 활용해 가장 창의적인 편집을 보여줬지만, 전반적으로는 생성 클립을 단순 연결하는 데 머물렀고 100달러 예산과 Replicate도 충분히 활용하지 못함

자율 뮤직비디오 제작 실험

  • 소형 에이전트 하네스에 곡, 고정된 달러 예산, 도구를 제공하고 전체 뮤직비디오 제작을 자율적으로 수행하도록 설계함
    • 사용할 영상 생성 모델과 API를 조사함
    • 클립을 생성하고 직접 확인함
    • ffmpeg로 편집해 최종 영상을 조립함
  • 모델별 도구 사용 방식의 차이를 확인하기 위해 조사 대상, 생성 콘텐츠, 편집법을 각 모델이 결정하는 개방형 장기 작업으로 구성함
  • 모든 도구 호출을 기록해 모델별 작업 과정을 확인할 수 있으며, 전체 하네스는 music-video-arena에 공개함
  • Claude Fable 5GPT-5.6 Sol을 각각 25달러와 100달러 예산으로 실행해 총 네 번을 비교함
  • 모든 실행에 Bruno Mars와 Mark Ronson의 “Uptown Funk”, 짧은 텍스트 설명, 타임스탬프가 포함된 가사 기록을 동일하게 제공함

6개 도구와 예산 제약

  • 각 모델은 자율적인 도구 호출 루프에서 다음 6개 도구를 사용함
    • plan: 비용이나 실제 동작 없이 사고를 정리함
    • web_search: 생성 모델과 API를 조사하고 필요하면 뮤직비디오 정보를 검색함
    • get_budget: 남은 예산을 확인함
    • generate_image, generate_video: 예산을 사용하는 유일한 도구로, 모델이 FAL 또는 Replicate 모델과 매개변수를 직접 선택함
    • run_command: ffmpeg와 ffprobe로 오디오 분석, 클립 절단·연결, 최종 영상 결합을 수행하는 로컬 셸임
  • 예산이 0이 되면 유료 생성 요청은 거부되지만 후속 편집은 계속할 수 있음
  • 모델 메시지와 도구 호출뿐 아니라 비용 청구와 오류까지 모두 기록함

네 번의 실행 결과

  • 모든 실행이 단계나 시간 제한에 걸리지 않고 스스로 종료했으며, 원곡을 결합한 완전한 길이의 유효한 영상을 생성함
  • 실행 시간과 생성 결과는 다음과 같음
    • Fable 5 · 25달러: 39분 10초, 54개 클립, 실패 1회, 24.30달러, 1280×720
    • Sol · 25달러: 42분 52초, 46개 클립, 실패 10회, 23.18달러, 1280×720
    • Sol · 100달러: 49분 39초, 70개 클립, 실패 2회, 36.57달러, 1280×720
    • Fable 5 · 100달러: 38분 56초, 80개 클립, 실패 없음, 48.60달러, 1920×1080
  • 생성 비용은 FAL의 계량 비용만 가리키며, 모델 실행 자체의 토큰 비용은 포함하지 않음
  • 25달러 실행에서는 두 모델이 예산을 거의 소진했지만, 100달러 실행은 Sol이 36.57달러, Fable이 48.60달러만 사용함
  • 예산이 커지자 생성한 영상 분량도 늘어났으며, 실행별 고유 클립 수는 46~80개였음
  • 벽시계 시간에는 모델의 재시도와 제공업체 대기열에서 기다린 시간까지 포함됨

모델별 생성 파이프라인

  • 도구 선택을 모델에 맡기자 네 번 중 세 번은 텍스트-투-비디오만 사용했고, Sol의 25달러 실행만 이미지-투-비디오 파이프라인을 구성함
  • Fable 5 · 25달러
    • 이미지 모델 없이 Wan 2.5 t2v를 선택함
    • 출력 영상 1초당 0.05달러인 텍스트-투-비디오 방식임
  • Sol · 25달러
    • 이미지당 0.003달러인 FLUX schnell로 키프레임을 생성함
    • 초당 0.10달러인 Wan 2.2-5b i2v로 정지 이미지를 애니메이션함
  • Sol · 100달러
    • 이미지 모델 없이 Wan 2.5, Veo 3.1 Lite, Hailuo 2.3 Standard 등 세 가지 영상 모델을 한 실행에서 혼합함
    • Wan 2.5는 초당 0.05달러, Veo 3.1 Lite는 초당 0.10달러, Hailuo 2.3 Standard는 약 6초 클립당 0.28달러임
  • Fable 5 · 100달러
    • 이미지 모델 없이 Seedance 1.0 Pro t2v만 사용함
    • 1080p 5초 클립당 약 0.62달러인 토큰 기반 가격으로, 초당 약 0.12달러에 해당함
  • 두 서비스의 키를 모두 제공했지만 네 번 모두 FAL만 사용했으며 Replicate에는 접근하지 않음

도구 호출과 오류

  • 도구 호출 집계에는 성공한 요청뿐 아니라 실패한 생성 시도도 포함됨
  • 실행별 전체 계획과 호출·명령 기록은 다음 전사본에서 확인할 수 있음
  • 실패 호출은 주로 제공업체와의 일시적인 네트워크 오류 때문에 발생함
  • 실패한 요청에는 비용이 청구되지 않았지만, 재시도 과정에서 작업 단계를 소비함

토큰 사용량과 실제 총비용

  • 실행별 토큰 사용량은 다음과 같음
    • Fable 5 · 25달러: 입력 1,476,900개, 출력 44,341개, 캐시 입력 없음
    • Sol · 25달러: 입력 2,956,270개, 출력 33,220개, 추론 9,656개, 캐시 입력 2,558,029개
    • Sol · 100달러: 입력 2,097,572개, 출력 31,715개, 추론 12,330개, 캐시 입력 1,819,050개
    • Fable 5 · 100달러: 입력 2,264,610개, 출력 48,029개, 캐시 입력 없음
  • 토큰 가격은 Fable 5가 입력·출력 100만 개당 각각 10달러·50달러, Sol이 각각 5달러·30달러
  • 생성비와 LLM 토큰 비용을 합친 실행별 총비용은 다음과 같음
    • Fable 5 · 25달러: 생성 24.30달러 + LLM 16.99달러 = 41.29달러
    • Sol · 25달러: 생성 23.18달러 + LLM 4.27달러 = 27.45달러
    • Sol · 100달러: 생성 36.57달러 + LLM 3.25달러 = 39.82달러
    • Fable 5 · 100달러: 생성 48.60달러 + LLM 25.05달러 = 73.65달러
  • Fable의 토큰 비용만 16.99~25.05달러로 총비용의 약 30~40% 를 차지함
  • Sol은 비슷한 토큰 규모에도 토큰 비용이 약 3~4달러에 머물렀음
  • 생성 비용은 모델별 가격표를 기준으로 산출한 최선 추정치

결과물에서 드러난 한계

  • 네 영상 모두 반복 등장하는 캐릭터의 외형이 장면마다 달라졌고, 처음부터 끝까지 이어지는 일관된 이야기를 유지하지 못함
  • 가사를 지나치게 문자 그대로 해석하는 경향이 나타남
    • “Make a dragon wanna retire, man”이라는 가사에서 실제 용을 화면에 등장시킴
    • 일부 장면에서는 흥미롭지만 같은 방식이 반복되면서 어색해짐
  • 모든 실행이 ffmpeg로 비트를 감지해 컷은 박자에 맞췄지만, 춤과 카메라 이동 같은 클립 내부 동작은 곡의 템포와 거의 맞지 않았음
    • “gotta kiss myself I’m so pretty” 장면에서는 주인공의 키스 동작이 지나치게 느렸음
  • Sol의 25달러 실행은 텍스트를 오버레이하고 영상 효과로 정지 이미지를 움직이는 등 다른 실행에서 볼 수 없던 편집법을 사용함
  • 나머지 실행은 대부분 생성 클립을 단순 연결했으며, Sol의 100달러 실행만 Fable과 달리 여러 영상 모델을 함께 시도함

자기 검토와 예산 활용의 한계

  • 클립을 생성한 뒤 연결하고 음원을 결합했지만, 다시 잘라내거나 효과를 추가하는 편집 반복은 거의 없었음
  • 생성한 클립의 품질을 본격적으로 점검하지 않았으며, Sol의 100달러 결과에는 품질이 낮은 AI 클립도 포함됨
  • Fable 5는 우연히 더 일관된 출력을 내는 모델을 선택함
  • Fable은 Sol보다 빨리 끝났지만 실행별 비용이 더 높았고, 전체 최고 비용도 기록함
  • 주관적으로는 Fable의 100달러 영상이 약간 더 선호됐지만, 네 결과물 모두 뛰어난 수준에는 이르지 못함
  • 100달러 예산에서도 두 모델 모두 상한에 가까운 금액을 쓰지 않았고 작업 단계 수도 많지 않았음
    • 남은 예산으로 일관된 캐릭터 이미지를 먼저 생성한 뒤 애니메이션할 수 있었지만, 어느 모델도 이 방식을 선택하지 않음
  • 주관적이고 스타일 중심인 작업에서는 최전선급 모델도 개선할 여지가 여전히 큼

직접 실행하기

  • music-video-arena에서 원하는 곡과 예산을 지정하고 비교 모델을 교체해 같은 실험을 실행할 수 있음
  • 프로젝트는 오픈소스이며 이슈, PR, 실험 구성에 관한 피드백을 받음
Read Entire Article