중고 GPU 클러스터의 가치는 아무도 모른다

3 hours ago 2

xAI가 채무불이행하면 대주단은 20만 개 GPU로 구성된 Colossus를 인수해 임대할 수 있지만, 실제 가치는 장비보다 운영 상태와 팀의 암묵지에 크게 좌우됨 xAI와 CoreWeave를 중심으로 GPU 담보 금융이 확산됐으나 가격 산정 인프라가 부족해, 기준금리보다 약 8.5%포인트 높은 대출 금리 등에 측정하기 어려운 위험이 반영됨 H100 임대료는 2024년 초 시간당 약 8달러에서 2025년 10월 1.70달러로 하락했다가 2026년 3월 2.35달러로 반등해 잔존가치와 미래 임대수익을 예측하기 어려움 동일한 GPU의 내용연수도 CoreWeave는 6년, Nebius는 4년으로 잡으며, NVIDIA의 제품 주기가 2년에서 1년으로 단축돼 장부가치와 회수가치의 격차가 커질 수 있음 GPU 담보에는 장부상 액면가, 긴급 매각가, 정상 운영가라는 서로 다른 가치가 존재하며, 운영 인계에 실패하면 계약상 인수한 클러스터를 수익 자산으로 유지하기 어려움 운영팀이 떠나면 달라지는 담보 가치 GPU 클러스터는 건물과 달리 프로비저닝 방식과 현재 성능, 장비 특성을 아는 운영팀의 잔류 여부에 따라 가치가 달라짐 Meta의 Llama 3 기술 보고서는 H100 16,384개로 54일간 학습하면서 예상하지 못한 중단 419건을 기록함 GPU 장애 148건과 HBM3 메모리 장애 72건이 포함됐으며, 현대 데이터센터 GPU의 연간 장애율은 약 9% 로 계산됨 GPU 20만 개 규모에서는 하루 약 50개가 고장 나며, xAI가 목표로 한 100만 개 규모에서는 Epoch AI가 약 3분마다 한 번의 장애를 예상함 신용 위험에서 중요한 것은 명백한 고장만이 아님 무음 데이터 손상(SDC) 은 GPU가 멈추지 않은 채 잘못된 결과를 만들어, 며칠간의 학습을 정상적으로 마친 뒤에도 모델 가중치를 손상시킬 수 있음 GPU 하나가 수천 개 장비에 걸친 학습 작업을 중단시키는 연쇄 장애는 며칠치 연산을 잃게 함 열 스로틀링, ECC 메모리 오류, NVLink 불안정, 버스에서 GPU가 사라지는 문제도 지속적으로 발생함 NVIDIA NVSentinel은 기존 모니터링이 문제를 감지하고도 해결하지 못하는 한계를 다루며, Crusoe AutoClusters는 클러스터 유효 처리량에서 통제 가능한 가장 큰 변수인 대기열 시간을 줄임 이런 도구가 없으면 복구에 수시간에서 수일이 걸릴 수 있음 운영팀은 여름에 과열되는 랙, 펌웨어 업데이트 ...

Read Entire Article