AI 서비스를 운영할 때는 모델 성능과 함께 작업당 비용과 처리 속도를 계산해야 합니다. 같은 요청을 반복해서 처리하는 서비스일수록 API 단가 차이가 전체 운영비에 크게 반영됩니다.
OpenAI는 9월 22일 GPT‑6 Sol과 GPT‑6 Luna를 공개했습니다. Sol은 고난도 추론, Luna는 대량 반복 작업을 맡으며 두 모델 모두 GPT‑5.6 프로모션 가격보다 API 비용이 50% 낮습니다.
Sol은 고난도 추론, Luna는 대량 작업 담당
Sol은 강한 추론이 필요한 업무를, Luna는 빠르고 비용에 민감한 대량 작업을 맡도록 설계됐습니다. 두 모델은 텍스트와 이미지 입력을 받고 Responses API와 Chat Completions API에서 사용할 수 있습니다.
OpenAI는 Sol과 Luna의 API 가격이 GPT‑5.6 프로모션 가격보다 50% 낮아졌다고 밝혔습니다. Luna의 가격은 입력 100만 토큰당 0.10달러, 출력 100만 토큰당 0.50달러입니다.
공개된 AutomationBench 그래프는 성능 점수와 작업당 비용을 함께 비교합니다. Sol은 높은 추론 성능이 필요한 작업, Luna는 처리량과 비용이 중요한 반복 작업에 배치할 수 있습니다.
작업에 따라 Sol과 Luna를 나눠 배치
에이전트형 제품에서는 모든 단계가 같은 수준의 추론을 요구하지 않습니다. 문서 분류, 정보 추출, 반복 응답처럼 규모가 큰 작업과 예외 상황을 판단하거나 여러 도구를 조율하는 작업은 필요한 능력과 실패 비용이 다릅니다.
이번 구성은 하나의 에이전트 안에서도 작업 난도에 따라 모델을 바꿔 쓸 수 있게 합니다. 복잡한 판단은 Sol에 맡기고, 분류·정리처럼 반복되는 작업은 Luna로 처리하는 방식입니다.
이런 분리는 서비스 안에서 한 모델의 답을 다른 모델이 검토하거나, 단순한 전처 리와 중요한 최종 판단을 나누는 선택으로 이어질 수 있습니다. 사용자는 모델 이름을 직접 고르지 않더라도 그 차이를 응답 속도와 사용 한도에서 경험하게 됩니다.
Luna 입력 가격은 100만 토큰당 0.10달러
저렴한 모델이 나왔다고 자동으로 더 많은 일을 맡기는 것은 안전한 전략이 아닙니다. 비용이 낮아질수록 서비스는 더 자주, 더 긴 작업을 자동 실행하고 싶어집니다. 그때 중요한 것은 모델의 단가보다 어느 단계에서 사람의 확인이 필요한지를 정하는 일입니다.
모델 라우팅*을 실제 제품에 넣을 때는 가격표만 비교해서는 충분하지 않습니다. 실패했을 때 더 강한 모델로 다시 시도할지, 처음부터 사람이 검토할지, 실행 전 미리보기와 변경 이력을 어떻게 보여줄지까지 함께 정해야 합니다. 모델 선택은 사용자가 체감하는 속도·가격·통제감의 균형을 만드는 결정입니다.
따라서 자동화 범위를 넓히기 전에는 작업별 실패 비용을 먼저 구분해야 합니다. 되돌릴 수 있는 반복 작업과 결과의 책임이 큰 작업을 같은 기준으로 처리하면, 낮아진 단가가 오히려 검토 비용을 키울 수 있습니다.
D.Flick Note
Sol과 Luna의 가격 차이는 에이전트 전체를 하나의 고성능 모델로 돌리지 않아도 된다는 선택지를 만듭니다. 다만 중요한 판단이나 외부 실행 단계에는 별도의 확인 절차가 필요합니다.
References
- 모델 라우팅: 작업의 난도·비용·응답 시간에 따라 서로 다른 모델을 배치하는 방식입니다.