
안녕하세요. 특허법률사무소 엘프스입니다.
AI 서비스를 준비하는 기업 대표님들을 만나면 거의 빠지지 않고 나오는 질문이 있습니다.
"인터넷에 돌아다니는 자료를 모아서 모델을 학습시키는 건데, 이게 저작권 문제가 되나요?"
지금까지는 "가능성은 있습니다" 정도로 답할 수 밖에 없었습니다.
그런데 2026년 7월, 미국 법원이 이 질문에 구체적인 숫자를 붙인 결론을 내놨습니다.
15억 달러, 우리 돈으로 약 2조 2천억 원입니다.
그런데 이 사건에서 법원이 실제로 문제를 삼은 지점은, 많은 분들이 예상하시는 것과 조금 다릅니다.
이번 글에서는 이 사건이 정확히 무엇을 문제 삼았는지, 그리고 AI 학습 데이터를 다루는 기업이 지금 무엇을 점검해야 하는지 정리해 보겠습니다.
1. 2024년 제소에서 2026년 최종 승인까지, 사건의 흐름
사건의 시작은 2024년입니다.
베스트셀러 스릴러 소설 "우리는 여기에 없었다"의 저자 안드레아 바츠를 비롯한 작가들이 AI 기업 앤트로픽이 자신들의 저작물을 무단으로 이용해 AI 모델 '클로드'를 학습시켰다며 미국 캘리포니아 북부연방지방법원에 집단소송을 제기했습니다.
쟁점은 두 갈래로 나뉘었습니다.
하나는 'AI 학습에 저작물을 쓰는 행위 자체가 침해인가', 다른 하나는 '그 저작물을 어떤 경로로 확보했는가' 였습니다.
1심을 맡았던 윌리엄 알섭 판사는 이 둘을 분리해서 판단했고 결과적으로 전자에 대해서는 기업 측 손을, 후자에 대해서는 작가 측 손을 들어줬습니다.
공정이용이 인정된 부분은 재판에서 빠지고, 침해 가능성이 인정된 부분만 손해배상 재판으로 넘어갔습니다.
그리고 그 재판을 앞둔 시점에 양측이 합의에 이르렀고, 2026년 7월 20일(현지시간) 아라셀리 마르티네스-올긴 판사가 합의안을 최종 승인하는 명령을 내리면서 사건이 마무리됐습니다.
합의금은 15억 달러. 미국 저작권 소송 역사상 최대 규모이고, AI 학습을 둘러싼 여러 저작권 분쟁 가운데 미국에서 처음으로 최종 합의가 확정된 사례입니다.
그래서 이 사건은 단순한 한 건의 소송이 아니라, 이후 분쟁의 기준점 역할을 하게 될 가능성이 큽니다.

2. 법원이 그은 선 ① 학습 행위 자체는 문제 삼지 않았다
많은 분들이 이 뉴스를 "AI 학습은 저작권 침해"로 읽으셨을텐데, 판단 내용은 오히려 반대에 가깝습니다.
법원은 합법적으로 구매한 도서를 AI 학습에 이용한 부분에 대해서는 미국 저작권법상 공정이용(fair use)에 해당한다고 봤습니다.
논리는 이렇습니다.
AI 모델이 책을 학습한다는 건 그 책의 문장을 그대로 저장했다가 다시 내놓기 위한 것이 아니라, 언어의 통계적 패턴을 익히기 위한 것이라는 결론입니다.
원저작물의 표현을 대체하는 이용이 아니라 성격이 전혀 다른 이용, 즉 변형적 이용(transformative use)에 해당한다는 판단입니다.
기업 입장에서 이 부분은 상당히 중요한 의미가 있습니다.
"AI 학습에 저작물을 쓰면 무조건 침해"라는 전제 자체가 미국 법원에서는 받아들여지지 않았다는 뜻입니다.
실제로 이 판단은 이후 다른 AI 관련 저작권 사건에서도 반복해서 인용되고 있습니다.
다만 여기에는 분명한 전제가 붙어 있습니다.
판단의 대상이 된 건 어디까지나 합법적으로 구매한 도서였다는 점입니다.
정당하게 확보한 자료를 학습에 쓴 경우에 한정된 판단이지, 자료를 어떻게 얻었든 학습이면 괜찮다는 의미가 아닙니다.
또한 이는 미국 법원의 판단이고 사안과 데이터 성격에 따라 결론이 달라질 수 있다는 점은 염두에 두셔야합니다.
3. 법원이 그은 선 ② 문제는 "어떻게 가져왔는가" 였다
그렇다면 2조 원은 어디서 나온걸까요?
법원이 침해 가능성을 인정한 건 학습이 아니라 취득 경로였습니다.
해당 기업은 학습용 도서 가운데 상당량을 이른바 '해적 사이트'에서 내려받아 자체 저장소에 보관하고 있었습니다.
법원은 이 부분을 학습 행위와 완전히 분리해서 보았습니다.
정당한 대가를 치르지 않고 불법 복제물을 확보해 대량으로 쌓아둔 것 자체가 별개의 복제권 침해라는 것입니다.
실제로 손해배상 재판도 이 부분에 한정해서 진행됐고, 그 재판을 앞두고 양측이 합의에 이른 것이 이번 15억 달러입니다.
이 구조를 꼭 기억하실 필요가 있습니다.
분쟁의 승패가 'AI를 학습시켰는가'가 아니라 '데이터를 어떻게 손에 넣었는가'에서 갈렸다는 뜻입니다.
모델을 아무리 잘 설계해도 데이터 수집 단계에서 남긴 흔적 하나로 전체 사업이 흔들릴 수 있다는 이야기입니다.
그리고 데이터 수집은 보통 개발 초기, 법무 검토가 가장 얇을 때 이루어집니다.
4. 2조원은 어떻게 계산됐을까, 건 당 3천 달러의 곱셈
합의 내용을 뜯어보면 금액이 만들어진 방식이 더 무섭습니다.
이번 합의에서 집단소송 구성원들은 저작물 1건당 약 3,000달러(약 440만원)을 받게 됩니다.
이는 미국 저작권 침해 사건에서 인정되는 법적 최소 손해배상액 750달러의 4배 수준입니다.
여기에 대상 저작물 수가 곱해집니다.
문제가 된 도서가 약 50만 권 규모였고 3,000달러를 곱하니 15억 달러라는 총액이 나온겁니다.
개별 저작물 하나로 보면 440만원이라는 금액이 그렇게 커 보이지 않지만, 건수가 곱해지는 순간 기업이 감당할 수 있는 범위를 넘어섭니다.
배상 청구도 실제로 활발하게 이루어졌습니다.
2026년 4월 기준으로 대상 목록 가운데 44만 490건, 비율로는 91.3%에 대해 청구가 접수된 것으로 알려졌습니다.
권리자들이 청구를 포기하지 않는다는 것, 그리고 집단소송 구조에서는 개별 권리자가 소송 비용을 따로 부담하지 않아도 된다는 점이 함께 확인된 셈입니다.
국내 기업에도 남의 일이 아닙니다.
미국 시장에 서비스를 출시하는 순간 미국 저작권법의 법정손해배상 구조에 그대로 노출되기 때문입니다.
매출 규모와 무관하게 '보유한 데이터 건 수'만으로 배상액이 결정될 수 있다는 점은, 데이터를 많이 모을수록 위험이 비례해서 커진다는 뜻이기도 합니다.
참고로 우리 저작권법에도 법정손해배상 제도가 있습니다.
저작권법 제125조의2는 실제 손해액을 갈음해 침해된 각 저작물마다 1천만원(영리를 목적으로 고의로 침해한 경우에는 5천만원) 이하의 범위에서 배상을 청구할 수 있도록 하고 있습니다.
다만 같은 조 제3항에 따라 침해행위가 일어나기 전에 그 저작물이 등록되어 있어야 청구가 가능합니다.
구조 자체는 미국과 비슷하게 '저작물 단위로 곱해지는' 방식이라는 점을 기억해두실 필요가 있습니다.
5. 합의로 끝나지 않는 것들
이번 합의는 돈만 오가고 끝난 것이 아닙니다.
법원은 해당 기업에 해적 사이트에서 내려받은 저작물과 그 복제물을 파기하라는 명령도 함께 내려졌습니다.
이미 학습에 쓰인 데이터를 폐기해야 한다는 건, 금전 배상과는 성격이 다른 부담입니다.
또 하나 눈여겨볼 지점은 집단소송 구성원 일부가 배상액이 너무 적다며 이의를 제기했다는 사실입니다.
법원은 합의안이 공정하고 합리적이라고 보아 이 이의를 기각했지만, 합의 대상에서 빠진 권리자들은 여전히 개별 소송을 이어갈 수 있습니다.
실제로 이 사건과 별개로 여러 저작권 분쟁이 진행 중이고요.
즉 이번 합의는 '해당 집단소송 구성원들의 과거 청구'를 정리한 것이지, AI 학습데이터를 둘러싼 법적 위험 전제를 해소한게 아닙니다.
한 건을 큰 돈으로 막아도 같은 데이터에서 비롯된 다른 청구가 이어질 수 있다 점, 이것도 리스크를 계산할 때 반드시 반영해야 할 부분입니다.
6. 한국 저작권법이라면 어떻게 볼까
그럼 같은 일이 국내에서 벌어지면 어떻게 될까요?
우리 저작권법에도 미국의 fair use에 대응하는 포괄적 조항이 있습니다.
저작권법 제35조의5(저작물의 공정한 이용)입니다.
저작물의 일반적인 이용 방법과 충돌하지 않고 저작자의 정당한 이익을 부당하게 해치지 않는 경우에는 저작물을 이용할 수 있다고 규정하고 있습니다.
같은 조 제2항은 공정한 이용에 해당하는지를 판단할 때 고려할 요소로 네 가지를 들고 있습니다.
① 이용의 목적 및 성격
② 저작물의 종류 및 용도
③ 이용된 부분이 저작물 전체에 차지하는 비중과 그 중요성
④ 저작물의 이용이 그 저작물의 현재 또는 잠재적 시장이나 가치에 미치는 영향
조문 구조만 보면 미국과 비슷해 보이지만, 우리 제35조의5는 다른 저작재산권 제한 규정이 적용되지 않는 경우에 보충적으로 적용되는 성격이 강하고, AI 학습을 정면으로 다룬 국내 판례도 아직 충분히 쌓이지 않았습니다.
미국 법원이 공정이용을 인정했다고 해서 국내에서도 같은 결론이 나온다고 단정하기는 어렵습니다.
다만 이번 사건에서 침해로 본 부분, 즉 불법 복제물을 대량으로 확보해 보관한 행위는 어느 법제에서도 방어하기 쉽지 않습니다.
취득 경로 관리가 중요한 이유가 여기에 있습니다.

7. AI 학습 데이터, 지금 점검해야 할 5가지
실무에서 바로 확인해 보실만한 항목을 정리했습니다.
- 첫째, 취득 경로별로 데이터를 분류하고 대장을 만드세요 : 직접 구매, 정식 라이선스, 공개 데이터셋, 자체 크롤링, 외부 구매 등으로 나눠 각 데이터가 어디서 왔는지 기록해두는 것이 출발점입니다. 분쟁이 생겼을 때 "우리는 이 경로로 확보했다"를 입증할 수 있어야 합니다.
- 둘째, 공개 데이터셋의 원출처를 확인하세요 : 무료로 배포된다고 해서 권리 관계가 정리된 데이터는 아닙니다. 데이터셋 내부에 불법 수집물이 섞여 있다면 그 위험은 이용자에게 넘어옵니다. 라이선스 표기와 수집 방식을 반드시 확인하시기 바랍니다.
- 셋째, 크롤링 전에 이용약관과 robots.txt를 검토하세요 : 웹에 공개돼 있다는 사실이 자유 이용을 뜻하지는 않습니다. 사이트 이용약관에서 자동 수집을 금지하고 있다면 저작권과 별개로 계약 위반 문제가 생길 수 있습니다.
- 넷째, 외부 모델·데이터 공급사와의 계약에 보증·면책 조항이 있는지 확인하세요 : 파운데이션 모델이나 데이터를 외부에서 도입할 경우, 그 출처에 문제가 생겼을 때 책임을 누가 지는지가 계약서에 적혀 있어야 합니다. 면책 조항이 아예 없는 경우도 적지 않습니다.
- 다섯째, 취득 시점의 증빙과 로그를 보존하세요 : 구매 영수증, 라이선스 계약서, 크롤링 로그, 데이터셋 다운로드 기록 같은 자료는 시간이 지나면 복원이 어렵습니다. 이번 사건에서도 기업 내부에 남아 있던 데이터 수집 관련 자료가 그대로 증거로 제출됐습니다. 분쟁을 대개 몇년 뒤에 시작된다는 점을 감안해, 어떤 자료를 얼마나 보관할지 정책을 미리 세워두는 편이 좋습니다.
덧붙이자면, 위 다섯 가지는 법무 부서만의 일이 아닙니다.
데이터를 실제로 수집하는 건 개발팀이고, 대장 관리와 로그 보존도 개발 프로세스 안에 들어가 있어야 지켜집니다.
데이터 수집 단계에 간단한 체크리스트 하나를 넣어두는 것만으로도 나중에 확인할 수 있는 범위가 크게 달라집니다.

이번 사건이 남긴 메시지는 비교적 선명합니다.
쟁점은 더 이상 "AI를 학습시켰는가"가 아니라 "데이터를 정당하게 확보했는가"로 옮겨갔습니다.
학습 행위 자체는 변형적 이용으로 인정받을 여지가 생긴 반면, 취득 경로에 하자가 있으면 건 당 배상액에 데이터 건수가 곱해지는 방식으로 위험이 실현됩니다.
그리고 이 위험은 모델을 공개하는 시점이 아니라, 데이터를 처음 모으는 시점에 이미 결정됩니다.
이후에 아무리 정교하게 보완해도 그때 남은 기록을 되돌리기는 어렵습니다.
지금 학습 데이터를 다루고 계신다면, 개발 일정과 별개로 데이터 취득 경로를 한 번 정리해 두시길 권합니다.
사업이 커진 뒤 정리하려면 비용이 훨씬 많이 듭니다.
분쟁은 시장된 뒤보다 시작되기 전에 대응하는 편이 비용이 훨씬 적게 듭니다.
저희 특허법률사무소 엘프스는 저작권·영업비밀 이슈부터 침해 경고장 대응, 심판·소송까지 분쟁 단계별로 대응해왔습니다.
특히 인공지능·빅데이터 분야는 기술 이해가 있어야 데이터 구조와 권리 관계를 함께 짚을 수 있는 영역이고, 필요하다면 법무법인 엘프스와 함께 IP와 법률 이슈를 한 번에 검토할 수 있습니다.
학습 데이터나 AI 서비스와 관련해 상황 정리가 필요하시면 언제든 편하게 당소로 연락 부탁드립니다.
감사합니다.
