코딩 에이전트(Claude Code, Codex, Pi, OpenCode) 세션 로그를 기부받아 CC0 공개 데이터셋으로 만드는 도구와 허브입니다. 한국어 에이전트 궤적(툴콜, 가져오기, 테스트 결과가 포함된 세션) 공개 데이터가 거의 없어서 시작했습니다.
동작 방식
에이전트 안에서 /take-my-data 실행
로컬에서 gitleaks로 시크릿 스캔, 정규식으로 이메일·경로·사용자명 제거, 에이전트가 이름·내부 호스트명 같은 문맥 정보 2차 마스킹
제거된 내용을 diff로 보여주고, 기부자가 승인한 것만 업로드
업로드 스크립트는 스캔 리포트와 승인 해시가 없으면 실행 거부. SKILL.md 지시가 아니라 스크립트가 문지기
서버는 정제본만 받고 같은 스캐너로 재검사 후 accept/reject, 원본은 서버에 도착하지 않음
세션이 작업한 리포가 공개 리포인지 확인, 아니면 거부
라이선스와 데이터
기부자가 권리를 가진 부분(프롬프트, 본인 코드)은 CC0. 세션에 포함된 기존 리포 코드는 원래 라이선스 유지, repo.license 필드에 기록
월 1회 HF 데이터셋 릴리스, 삭제 요청은 인증 없이 가능
기여자는 원장에 기록되고 리더보드와 모델 카드에 남음
왜 만들었나
데이터센터 없이 소비자 GPU를 인터넷으로 모아 LLM을 프리트레이닝부터 만드는 프로젝트의 데이터 부분입니다. 사전학습은 공개 코퍼스(FineWeb-Edu, FineWeb-2 ko, The Stack)로 하고, 이 허브는 포스트트레이닝용 한국어 궤적을 모으는 용도입니다.
비슷한 프로젝트로 Trace Commons, DataClaw가 있고 형식 호환을 맞추려고 합니다. 두 프로젝트가 스킬까지 갖추고도 세션 수십 개 수준이라, 설치 후 첫 기부까지 걸리는 시간을 줄이는 데 집중했습니다.
원본이 서버에 안 온다는 주장은 코드로 확인해 주세요. 정제 파이프라인에서 새는 게 있으면 이슈로 알려주시면 감사하겠습니다.
팀은 중학생 두 명입니다.
한국은 고품질 데이터 셋이 참 부족합니다.
한국어 사후 학습 데이터셋 구축에 기여해주시면 감사하겠습니다.
추가로
26.09.18일까지 데이터셋 구축에 참여해주신 분중 5분을 추첨해
감사의 의미를 담아 약소하지만 커피 기프티콘을 드릴려고 합니다.. 많은 관심 부탁드립니다.
글 읽어주셔서 감사합니다..!

1 hour ago
4

![[TODAY엔비디아]다음주 실적 발표 앞둔 기대감…UBS "예상치 상회"](https://image.edaily.co.kr/images/content/defaultimg.jpg)

![제니, 옷 입은 거야? 천 조각 두른 듯..역대급 파격 노출[스타이슈]](https://image.starnewskorea.com/cdn-cgi/image/f=auto,w=1200,h=1471,fit=cover,q=high,sharpen=2/21/2026/08/2026081118260855049_1.jpg)





English (US) ·