OpenAI의 2024 회계연도 적자는 약 50억 달러였습니다. 같은 해 우버, 테슬라, 아마존, 스포티파이 넷의 손실을 합쳐도 이보다 적었습니다. 그런데 ChatGPT Plus는 여전히 월 20달러입니다.
이 두 사실이 어떻게 동시에 성립하는지가 의문이었습니다. 손실이 저 규모라면 진작 가격을 올렸어야 합니다. 올리지 않는 게 아니라 올리지 못하는 것이라면, 그 이유는 원가 구조 어딘가에 있습니다.
비용이 어디서 발생하고 어디로 빠져나가는지
AI 서비스의 원가에서 가장 큰 항목은 GPU 연산 비용입니다. 텍스트 생성, 이미지 분석, 음성 처리가 전부 GPU 위에서 돌아갑니다. 그리고 이 GPU 시장의 90% 이상을 엔비디아가 쥐고 있습니다.
2026년 상반기 기준 엔비디아의 데이터센터 부문 분기 매출은 약 440억 달러, 전체 매출의 92%입니다. 영업이익률은 78%입니다. OpenAI, 앤스로픽, 구글 딥마인드, 미스트랄이 전부 적자를 내는 사이, 이들에게 칩을 파는 회사는 78% 마진을 올립니다. AI 서비스 생태계에서 수익이 어느 쪽으로 모이는지는 이 숫자들에서 먼저 드러납니다.
ChatGPT Plus 사용자가 한 달에 주고받는 대화량을 기준으로, 연산 비용이 수십 달러에 달한다는 분석들이 있습니다. 20달러를 받고 수십 달러를 쓰는 셈입니다. 엔비디아의 시가총액은 2026년 9월 기준 약 5조 4,000억 달러입니다. AI 산업이 만들어낸 가치가 어느 쪽에 더 많이 쌓이는지는 이 수치에서 드러납니다.
마진이 78%라는 숫자를 보면 '경쟁자가 들어와 가격이 내려가지 않을까'라는 생각이 먼저 옵니다. 마진이 높은 곳에는 경쟁이 따라오고, 경쟁이 오면 가격이 내려가는 것이 일반적입니다. AMD가 MI300 시리즈를 출시했고, 메타와 마이크로소프트도 일부 수요를 AMD 쪽으로 옮겼습니다.
그런데 점유율은 수년이 지나도 엔비디아 90%, AMD 6~7%에서 크게 움직이지 않았습니다.
CUDA가 가격 경쟁을 느리게 만드는 이유
GPU 가격이 잘 내려가지 않는 이유는 하드웨어보다 소프트웨어에 있습니다. CUDA는 엔비디아 GPU를 위해 10년 넘게 쌓인 개발 생태계입니다. AI 연구에서 쓰는 학습 프레임워크인 PyTorch·TensorFlow의 최적화 코드, 공개된 사전 학습 모델 수천 개, 논문에 딸려 나오는 실험 코드들이 전부 CUDA를 기반으로 합니다.
AMD 칩이 하드웨어 성능 지표에서 격차를 줄이더라도, 기존 학습 파이프라인을 AMD 위에서 돌리려면 ROCm(AMD의 소프트웨어 계층)에 맞게 코드를 조정해야 합니다. 데이터센터 규모에서 이 작업은 수개월에서 수년이 걸립니다. 대형 모델 학습은 한 번에 수십억 달러를 태우는 프로젝트이기 때문에, 그 중간에 인프라를 교체하는 것은 현실적으로 어렵습니다. 전환 비용이 크면 가격 경쟁이 느리게 작동합니다.
한 가지 구분이 이 그림을 복잡하게 만듭니다. AI 개발 작업은 '학습'과 '추론'으로 나뉩니다. 학습은 모델을 새로 만들거나 업데이트하는 단계로, CUDA 의존도가 높습니다. 추론은 이미 완성된 모델로 응답을 생성하는 단계로, 여기서는 구글 TPU나 아마존 Inferentia 같은 대안이 이미 실전에 쓰입니다. 구글이 Gemini를 TPU 위에서 추론할 수 있는 것도 이 때문입니다.
그러나 ChatGPT나 Claude처럼 모델을 계속 갱신하는 서비스는 학습과 추론을 둘 다 해야 합니다. 학습 단계에서 엔비디아를 벗어나기 어렵기 때문에, 원가 핵심은 CUDA에 묶여 있습니다.
GPU 가격이 잘 안 내려가면 AI 서비스 원가도 쉽게 내려가지 않습니다. 이 지점에서 처음 질문이 달라졌습니다. "가격이 왜 안 내려가는가"를 이해하고 나면, 자연스럽게 다음이 나옵니다. 구독료가 오르는 것은 시간문제인가. 오른다면 언제인가.
낮은 구독료를 지금 유지시키는 것
ChatGPT·Claude·Gemini의 현재 구독료는 원가보다 낮게 책정된 금액입니다. 그 차이를 메우는 것이 투자자 자금입니다. OpenAI는 2025년 한 해에만 수백억 달러 규모의 투자를 유치했고, 앤스로픽은 구글과 아마존에서 수십억 달러를 조달했습니다.
투자자들이 이 적자를 감수하는 근거는 "지금은 점유율을 쌓는 시기, 시장이 정리되면 가격 결정권을 갖게 된다"는 판단입니다. 낮은 가격으로 사용자를 묶어두고, 경쟁이 줄어든 뒤에 수익성을 확보한다는 시나리오입니다. 지금 사용자들이 내는 월 20달러는 실제 원가의 일부이고, 나머지는 투자금이 채우고 있습니다.
이 흐름이 바뀌는 시점이 가격 인상의 조건입니다.
구독료 인상이 시작될 조건
VC 자금 속도가 먼저 바뀔 수 있습니다. 투자자들도 영원히 적자를 메워주지 않습니다. 수익성 증명을 요구하는 압박이 강해지면, AI 서비스들은 가격을 올리거나 서비스 범위를 줄여야 합니다. OpenAI가 이미 ChatGPT Pro 요금을 인상한 것이나, 앤스로픽이 Claude Pro 요금을 조정한 것은 이 방향이 시작됐다는 신호로 읽을 수 있습니다. 아직 기본 구독 요금은 묶여 있지만, 고가 구간부터 먼저 올리는 패턴은 시작됐습니다.
경쟁 구도가 정리되는 방향도 있습니다. ChatGPT, Claude, Gemini, Perplexity가 동시에 경쟁하는 동안은 한 쪽이 먼저 가격을 올리기 어렵습니다. 이들 모두 엔비디아 GPU를 쓰므로 원가가 비슷합니다. 어느 서비스든 먼저 올리면 경쟁자에게 구독자를 내주게 됩니다. 그런데 이 중 하나라도 품질이 뚜렷하게 뒤처지거나 서비스 규모를 줄이면, 나머지가 가격을 올릴 여지가 생깁니다.
이 두 조건이 얼마나 가까운지를 가늠할 때 기업 재무 공시가 단서가 됩니다. 구글(Alphabet), 메타, 마이크로소프트의 연간 보고서(10-K)나 분기 보고서에는 AI 인프라 관련 설비투자(CapEx)가 전년 대비 얼마나 늘었는지, AI 관련 매출이 비용 증가를 따라가고 있는지가 수치로 나옵니다. CapEx가 급증하는데 AI 매출 성장이 더디면 투자 압박이 커지는 신호입니다. 반대로 AI 부문 영업이익이 흑자로 돌아서는 분기가 나타나면, 그때부터는 가격 인상 없이도 버틸 여력이 생기는 편입니다.
지금 해두면 나중이 달라지는 것
가격이 정확히 언제 오를지는 알 수 없습니다. 그러나 위의 수치들은 오를 가능성을 낮게 보기 어렵게 만듭니다.
현재 API 가격이 낮을 때 작업 흐름을 먼저 설계해두면 도움이 됩니다. 자동화 파이프라인을 지금 만들어두면, 나중에 단가가 오를 때 같은 결과를 내면서 토큰 수를 줄이는 방향으로 최적화할 수 있습니다. 가격이 오른 뒤 처음부터 설계하면 비용과 시간이 두 배로 드는 경우가 많습니다.
서비스별 GPU 의존도도 미리 확인해두는 것이 의미가 있습니다. 구글 Gemini는 자체 TPU를 상당 부분 활용하므로, 엔비디아 GPU 가격이 올라도 다른 서비스보다 충격이 덜할 수 있습니다. 아마존 Bedrock은 Inferentia 칩을 지원하는 모델을 포함합니다. 반면 엔비디아 GPU에 전적으로 의존하는 중소형 AI API 서비스들은 GPU 가격이 오를 때 비용을 가장 빠르게 전가합니다. 자체 칩을 개발 중인 회사들—구글, 아마존, 메타—의 서비스와 그렇지 않은 서비스 사이에는 나중에 가격 차이가 날 가능성이 높습니다.
어떤 서비스를 핵심 업무 흐름에 넣느냐가 나중에 감당할 가격 리스크를 미리 정합니다.




