NeMo Switchyard 공개: AI 에이전트는 ‘한 모델’ 대신 라우팅을 고른다
NVIDIA가 공개한 NeMo Switchyard는 에이전트의 작업 단계마다 비용·지연·성능 신호를 보고 적합한 모델을 선택한다. 공개 벤치마크와 프리알파 제약을 함께 살펴본다.
NVIDIA가 AI 에이전트의 요청을 여러 모델에 동적으로 배분하는 오픈소스 라우팅 계층 ‘NeMo Switchyard’를 공개했다. 모든 단계를 가장 비싼 프런티어 모델에 맡기는 대신, 작업 난도와 진행 상태·비용·지연시간에 따라 경량 모델과 고성능 모델을 오가는 접근이다. NVIDIA가 인용한 LangChain 평가에서는 프런티어 모델 단독 기준보다 비용을 74% 줄였지만 정확도는 약 6포인트 낮아져, 절감 수치만큼 품질 손실도 함께 봐야 한다. 공개 저장소는 아직 프리알파이므로 지금 당장 운영 표준이라기보다 실제 트래픽으로 라우팅 정책을 검증할 수 있는 실험 도구에 가깝다.
에이전트의 ‘한 모델 고정’ 문제를 겨냥하다
긴 에이전트 작업은 한 가지 난도로 이어지지 않는다. 초기 탐색과 오류 복구에는 강한 추론 능력이 필요할 수 있지만, 테스트가 통과한 뒤 반복 수정이나 정형화된 도구 호출은 더 작고 저렴한 모델로 처리할 수 있다. Switchyard는 요청 내용뿐 아니라 최근 도구 실행 결과, 반복 오류, 세션 상태, 예상 비용과 지연시간 같은 신호를 보고 어느 모델로 보낼지 결정한다.
구조적으로는 모델의 의미상 이름과 실제 공급자 엔드포인트를 분리한다. 참조 서버가 OpenAI Chat Completions·Responses API와 Anthropic Messages 형식을 받아 서로 다른 백엔드로 전달하고, 선택한 모델·판단 근거·토큰·지연·오류를 기록한다. 애플리케이션 코드를 특정 공급자에 단단히 묶지 않은 채 모델 풀과 라우팅 정책을 바꾸려는 설계다.
세 가지 라우팅 방식과 공개 벤치마크
기본 제공 방식에는 요청을 분류해 모델을 고르는 LLM 분류기, 최근 도구 사용과 오류로 작업 단계를 판단하는 스테이지 라우터, 저비용 모델로 시작해 어려움이 누적되면 강한 모델로 넘기는 에스컬레이션 라우터가 있다. 팀이 자체 데이터로 학습한 라우터나 별도 정책을 끼울 수도 있다.
NVIDIA 발표에 따르면 LangChain은 145개의 다중 단계 에이전트 과제를 다섯 차례 평가했다. Nemotron 3.5 Lightning과 Claude Opus 4.8을 에스컬레이션 방식으로 조합했을 때 프런티어 모델 호출은 전체의 7%였고, 프런티어 모델만 쓴 기준 대비 비용은 74% 감소했다. 다만 정확도는 약 6포인트 낮았다. 특정 모델 조합과 평가 세트에서 나온 결과이므로 모든 업무에 그대로 적용되는 보편 수치로 해석해서는 안 된다.
왜 중요한가: 모델 경쟁에서 시스템 경쟁으로
기업용 에이전트의 비용은 단일 응답 가격보다 긴 작업 중 몇 번의 모델 호출과 도구 호출이 발생하는지에 크게 좌우된다. 라우팅이 안정적으로 작동한다면 고성능 모델은 판단이 어려운 구간에만 집중하고, 나머지는 더 빠른 모델이 맡는 ‘시스템 오브 모델’ 구성이 현실적인 운영 선택지가 된다.
동시에 라우터는 새로운 실패 지점을 만든다. 어려운 요청을 약한 모델에 잘못 배정하면 뒤늦은 재시도로 비용과 시간이 더 들 수 있고, 서로 다른 공급자 사이에서 컨텍스트·도구 호출·안전 정책의 의미가 어긋날 수 있다. 라우팅 기록과 품질 회귀 테스트가 모델 자체 평가만큼 중요해지는 이유다.
도입 전에 확인할 실무 포인트
- 업무별 기준선을 먼저 만든다. 단일 프런티어 모델의 성공률·비용·지연을 측정해야 라우팅의 이득을 비교할 수 있다.
- 비용과 품질을 함께 본다. 평균 비용뿐 아니라 재시도율, 실패 복구 시간, 최악 지연시간과 품질 하락폭을 같은 대시보드에서 추적한다.
- 에스컬레이션 조건을 보수적으로 시작한다. 반복 오류, 도구 실패, 긴 탐색처럼 관찰 가능한 신호부터 사용하고 업무별로 임계값을 조정한다.
- 공급자 간 데이터 경계를 점검한다. 어떤 요청과 컨텍스트가 어느 모델·지역으로 이동하는지 기록하고 민감 데이터 정책을 라우팅 규칙에 포함한다.
- 프리알파 상태를 감안한다. 공식 저장소가 API와 알고리즘의 큰 변경 가능성 및 운영 사용 비권장을 명시한 만큼, 격리된 시험 환경에서 시작하는 편이 안전하다.
전망
모델 성능 차이가 업무 유형마다 달라지고 공급자 선택지가 늘수록, 에이전트 경쟁력은 ‘어떤 모델을 쓰는가’에서 ‘언제 어떤 모델로 넘기는가’로 이동할 가능성이 크다. Switchyard의 의미는 74%라는 단일 절감 수치보다 라우팅 정책을 코드와 관측 데이터로 다룰 수 있게 했다는 데 있다. 다음 단계는 각 조직이 자체 업무 분포에서 절감폭과 품질 저하를 함께 재현할 수 있는지 확인하는 일이다.