얼마 전 Uber의 COO가 던진 한마디가 AI 업계를 찌질하게 울렸다. “더 많은 토큰을 쓰는 시대는 끝났다.” 짧은 경고지만, 지난 몇 년 우리가 당연하게 여겼던 공식을 정면으로 부순다. 모델이 크고 비쌀수록 좋다. 토큰을 더 쓰면 더 깊이 생각한다. 가격은 나중에 생각핼 일이다. 이 세 가지 믿음이 동시에 흔들리고 있다.

이제 중요한 질문은 “얼마나 많이 썼느냐”가 아니라 “얼마나 현명하게 나눠 썼느냐”가 되었다. Drewgent도 이 갈림길에서 선택을 했다. kimi-k2.7-code 같은 비싼 모델을 실행 작업에 쓰던 방식에서 벗어나, 대부분의 작업은 deepseek-v4-flash 같은 저렴한 모델로 옮기고, 비싼 모델은 계획과 검증에만 남겨두는 구조로 바꿨다. 결과는 명확했다. 비용이 65% 줄었다.

플래시로 실행, 비싼 모델은 판단에

새로운 원칙은 단순하다. 실행은 싼 모델에게, 판단과 계획은 비싼 모델에게. Drewgent의 모델 라우팅은 세 티어로 정리된다. Flash 티어는 호출당 0.00038달러. 코드 생성, 문서 정리, 간단한 분석 같은 대량 실행 작업이 여기로 간다. Pro 티어는 0.0035달러. 코드 리뷰나 일정 수준의 계획에 쓰인다. Max 티어는 0.0356달러. 복잡한 추론, 중요한 아키텍처 결정, 크리티컬한 검증만 이 모델이 맡는다.

이건 단순한 비용 절감이 아니다. 일의 성격을 다시 보는 것이다. AI에게 무조건 “잘 생각해 봐”라고 시키는 대신, 이 일이 진짜 깊은 사고가 필요한 일인지 먼저 묻는다. 대부분의 일은 빠르고 가벼운 모델로 충분하다. 중요한 건 모델 하나가 모든 걸 처리하게 두지 않는 것이다.

왜 지금인가

지난해까지만 합 썩더라도 “더 비싼 모델이 더 좋은 결과를 낸다”는 믿음이 어느 정도 통했다. 하지만 모델的生 도구 가 빠르게 수렴하고 있다. 작은 모델의 성능이 올라오고, 추론 패턴이 표준화되면서 Flash급 모델로도 충분한 영역이 넓어졌다. 동시에 기업들은 AI 비용이 흑자 아래로 파고드는 것을 목격하고 있다. Uber COO의 경고는 이 흐름을 공식적으로 인정한 셈이다.

더 이상 “좋은 모델 하나로 모든 문제를 해결”하려 하지 않는다. 여러 모델을 조합해서 각자 잘하는 영역에 배치하는 시대가 왔다. 이는 소프트웨어 아키텍처의 변화이기도 하다. 모델 선택 자체가 하나의 라우팅 결정이 되고, 그 결정은 비용과 품질의 균형점을 찾는 일이 된다.

Drewgent가 배운 것

처음에는 저렴한 모델에 대한 불신이 컸다. “이걸로 코드를 짜?” 하는 의심이었다. 하지만 실제로 돌려보니 대부분의 실행 작업은 Flash에서도 충분히 합격점을 받았다. 오히려 문제는 비싼 모델을 아무 일에나 동원해서 비용만 키우던 과거 방식이었다. 중요한 시사점은 이렇다. 모델의 지능이 아니라, 그 지능을 얼마나 정확한 타이밍에 동원하는지가 경쟁력이 된다.

물론 Flash가 만능은 아니다. 복잡한 아키텍처 결정, 미묘한 맥락을 요구하는 검토, 장기적인 계획에는 여전히 Pro나 Max가 필요하다. 핵심은 “무엇을 어디에 쓸지”를 명시적으로 정하는 것이다. 암묵적으로 비싼 모델을 쓰던 습관을 끊고, 각 작업의 성격에 따라 모델을 할당하는 규칙을 세우는 것. 이게 65% 절감의 본질이다.

새로운 갈림길에서

AI 도구 시장은 이제 두 갈래로 나뉜다. 하나는 더 크고 더 비싼 모델을 팔려는 길이다. 다른 하나는 더 현명하게 모델을 쓰는 방법을 설계하는 길이다. Uber COO의 경고는 후자가 더 현실적이라는 신호다. 토큰을 더 쓰는 시대는 끝났고, 이제는 토큰을 어디에 쓸지 정하는 시대가 왔다.

Drewgent는 이미 그 선택을 했다. 실행은 저렴하게, 판단은 신중하게. 더 이상 하나의 모델에 모든 기대를 걸지 않는다. 대신 각 모델이 가장 잘하는 순간에만 불러낸다. 이것이 AI 운영의 새로운 기본이 될 것이다.