같은 이름 뒤에 붙은 낯선 꼬리표

로컬에서 돌릴 가벼운 오픈소스 모델을 찾다 보면 같은 이름 뒤에 'uncensored'나 'abliterated'가 붙은 버전이 줄줄이 나옵니다. 용량은 비슷하고 다운로드 수도 적지 않은데, 무엇을 받아야 할지 손이 멈춘 경험이 있으실 겁니다. 이름만 보고는 원본과 무엇이 다른지 알기 어렵습니다.

이 꼬리표는 모델에 내장된 안전장치를 걷어냈다는 표시입니다. 개발사가 넣어 둔 거절 규칙을 제거해, 원본이라면 답하지 않을 요청에도 답하도록 손을 본 것입니다. 혼자 사업을 꾸리는 분이라면 고객 응대 챗봇이나 문서 요약 도구에 이런 모델이 섞여 들어가도 알아채기 어렵습니다.

10a Labs 연구진이 arXiv에 올린 이 논문은 검열 해제 오픈소스 AI 모델이 누구 손에서 만들어지고, 어떤 경로로 퍼지며, 어디에 쓰이는지를 실측했습니다.

어떤 연구인가

연구진이 던진 질문은 세 가지입니다. 안전장치를 벗긴 모델은 얼마나 많고, 누가 만들며, 한번 퍼진 뒤에는 어떻게 되는가입니다. 이를 확인하려고 2024년 1월부터 2026년 3월까지 허깅페이스에 올라온 모델을 훑어 원본 검열 해제 모델을 가려내고, 그 원본을 다시 압축해 올린 재배포본까지 추적했습니다.

여기서 그치지 않고 깃허브에서 이런 모델을 끌어다 쓰는 응용 프로그램도 찾아 성격을 분류했습니다. 제작자, 재배포자, 사용처라는 세 층을 한 번에 본 셈입니다.

무엇을 발견했나

연구진은 조사 기간 동안 허깅페이스에서 원본 검열 해제 모델 3,471개를 확인했습니다. 이 원본은 각각 평균 2.4회 재포장되어 다시 올라갔고, 압축 재배포본은 모두 8,164개에 이릅니다. 원본보다 사본이 훨씬 많은 구조입니다. 더 눈여겨볼 대목은 집중도입니다. 재배포본 8,164개 가운데 52%를 단 3개 주체가 만들었습니다. 시장은 넓어 보이지만 공급의 절반은 몇 사람 손에서 나옵니다.

퍼지는 방식도 특징적입니다. 원본이 양자화되어 용량이 줄고, 여러 계정과 파일 형식, 그리고 Ollama 같은 별도 레지스트리에 복사되고 나면 원본이 허깅페이스에서 내려가도 사본은 남습니다. 연구진은 이 재배포 구조를 모델이 사라지지 않게 붙드는 층으로 봅니다. 아래 도식은 원본이 만들어져 응용 프로그램에 실리기까지의 경로입니다.

가드레일 벗긴 모델이 살아남는 경로원본 3,471개재포장 평균 2.4회계정·포맷·레지스트리 분산양자화·미러링원본 삭제돼도 잔존25%는 명백히 악성앱 1,643개에 탑재

재포장과 분산 저장이 한 번 끝나면 되돌리기 어렵고, 그 끝에는 실제 응용 프로그램이 있습니다. 연구진이 깃허브에서 찾아낸 관련 응용 프로그램은 1,643개였고, 그중 25%는 명백히 악의적인 용도로 분류됐습니다.

실무에 적용하면

1인 사업자나 기획자에게 이 결과는 모델 고르는 습관을 바꾸라는 신호입니다. 검색 결과 상단이나 다운로드 수만 보고 고르는 방식은 이제 위험합니다. 사본이 원본보다 많은 구조에서는 인기가 곧 신뢰가 아닙니다. 모델 카드에서 원본 개발사와 올린 계정이 같은지, 이름에 안전장치 제거를 뜻하는 꼬리표가 없는지 먼저 확인하는 편이 안전합니다.

Ollama처럼 명령 한 줄로 모델을 받는 도구를 쓸 때도 같은 기준을 적용해야 합니다. 편할수록 출처를 건너뛰기 쉽고, 연구진이 지목한 잔존 경로가 그런 레지스트리이기 때문입니다.

외주 개발자나 프리랜서에게 챗봇 제작을 맡겼다면 어떤 모델을 썼는지 파일명과 출처를 문서로 받아 두시기 바랍니다. 고객 앞에 나가는 응답이 안전장치 없는 모델에서 나온다면 책임은 업체가 아니라 사업자 본인의 이름으로 돌아옵니다.

가드레일을 벗긴 모델이 필요한 정당한 경우도 있습니다. 소설 창작이나 보안 연구처럼 거절이 잦은 작업이 그렇습니다. 다만 그때도 내부 실험용과 고객 대면용을 구분하고, 고객 대면 서비스에는 넣지 않는다는 선을 미리 정해 두는 편이 좋습니다.

주의할 점

이 연구는 허깅페이스와 깃허브, Ollama 같은 공개 창구에서 관찰할 수 있는 범위만 다룹니다. 비공개로 오가는 모델이나 개인 서버에 보관된 사본은 집계에 없으므로 실제 규모는 더 클 수도, 성격이 다를 수도 있습니다.

응용 프로그램의 25%가 악의적이라는 분류도 연구진의 기준에 따른 것입니다. 초록에는 그 기준의 세부가 나오지 않으므로, 나머지 75%가 모두 안전하다는 뜻으로 읽어서는 안 되고, 반대로 검열 해제 오픈소스 AI 모델을 쓰는 것 자체가 곧 위법이라는 뜻으로 읽어서도 안 됩니다.

숫자를 하나만 기억하신다면 재배포본의 절반이 세 주체에서 나왔다는 사실입니다. 모델을 받는 창구는 넓어 보여도 그 뒤의 공급망은 좁고, 좁은 만큼 출처를 한 번 확인하는 습관의 효과도 큽니다.