AI

SKT A.X K2, IMO 금메달 수준 성능 기록

디플릭 Editorial

🗓️ 2026.08.11

⏱️ 5

국제수학올림피아드와 MathArena AIME 평가에서 확인된 A.X K2의 수리 추론 성능
©AI Image

AI 모델의 경쟁은 이제 말의 유창함만으로는 설명되지 않습니다. 숫자를 맞히는 능력, 단계가 많은 문제를 끝까지 밀고 가는 능력이 모델의 신뢰도를 가늠하는 기준으로 올라오고 있습니다.

이번 발표는 그런 흐름 속에서 국내 독자 모델이 어디까지 왔는지를 보여줍니다. 단순히 성능 순위를 확인하는 데서 끝나지 않고, AI가 산업 현장에서 어떤 기준으로 평가받게 될지를 다시 보게 합니다.

A.X K2가 수학 추론 지표에서 상위권에 오른 성과

SK텔레콤은 독자 AI 모델 A.X K2가 국제수학올림피아드(IMO) 2026 평가에서 42점 만점에 29점을 기록했다고 밝혔습니다. 올해 금메달 기준선에 해당하는 점수이며, MathArena AIME 2026 리더보드에서도 97.1% 정확도로 공동 최고점을 기록했습니다.

A.X K2는 지난해 IMO 2025 기출문제에서도 35점을 기록했고, 한국수학올림피아드(KMO) 2026 2차에서는 만점을 받았습니다. SK텔레콤은 직전 모델인 A.X K1보다 규모를 키운 A.X K2로 수학과 과학 추론, 한국 지식, 장문 추론 능력을 강화했다고 설명했습니다.

수학 추론 평가에서 모델의 답 정확도를 비교하는 리더보드와 점수 구조
©AI Image

이번 결과에서 눈에 띄는 지점은 단순히 점수가 높다는 사실이 아닙니다. 수학 추론은 모델이 복잡한 문제를 얼마나 일관되게 풀어내는지 보여주는 지표로 읽히기 때문에, 산업용 AI의 신뢰도를 판단하는 출발점에 가깝습니다.

수학 점수가 산업용 AI의 신뢰 기준이 되는 이유

수학 성능이 중요한 이유는 계산을 잘한다는 뜻만은 아닙니다. 정답과 오답이 분명한 영역에서 실수 없이 결과를 내는지 확인할 수 있기 때문에, AI가 얼마나 검증 가능한 방식으로 작동하는지 가늠하는 단서가 됩니다.

그래서 수학 추론은 금융, 회계, 물류, 제조처럼 오류 비용이 큰 환경에서 더 민감하게 읽힙니다. 대화는 그럴듯할 수 있어도 결과가 틀리면 의미가 없기 때문입니다. AI가 실제 업무로 들어갈수록 사용자는 편리함보다 정확성과 재현성을 먼저 보게 됩니다.

AI를 볼 때 기능보다 먼저 확인해야 할 기준

앞으로 AI 서비스를 볼 때는 무엇을 할 수 있는지만 보지 않는 편이 좋습니다. 그 기능이 어떤 검증 방식 위에 놓여 있는지, 결과가 흔들릴 가능성을 얼마나 줄였는지도 함께 살펴봐야 합니다.

특히 정밀한 계산이나 다단계 판단이 필요한 서비스라면, 성능 수치가 높다는 말보다 그 수치가 어떤 평가에서 나왔는지 확인하는 일이 중요합니다. 같은 AI라도 어디에서 강한지에 따라 실제 신뢰도는 크게 달라집니다.

D.Flick Perspective

D.Flick Note

A.X K2의 의미는 국내 모델의 순위 상승에만 있지 않습니다. 수학 추론이 전면에 나온 순간, AI 경쟁은 문장을 잘 만드는 문제에서 벗어나 결과를 얼마나 믿을 수 있는지 증명하는 쪽으로 더 기울었습니다.

SK텔레콤이 이번 성능을 바탕으로 제조, 바이오, 국방과 같은 영역의 활용을 넓히겠다고 밝힌 것도 같은 맥락입니다. 산업 현장에서 중요한 것은 화려한 데모가 아니라, 실제 조건에서 흔들리지 않는 판단을 내릴 수 있느냐입니다.

References

  • International AI Safety Report: 2025년 10월 중국, 영국, 프랑스, 독일, 일본, 캐나다, 대한민국 등 30여 개국이 참여해 범용 AI의 능력·위험·안전에 관한 국제 공동 과학 보고서
다양한 아티클을 확인해보세요