AMD, Taalas 인수 추진: AI 모델을 실리콘에 넣는 추론 전략

AMD가 모델 전용 AI 추론 실리콘을 개발하는 Taalas 인수 계약을 발표했습니다. 범용 GPU와 맞춤형 칩을 결합하려는 전략의 의미와 기술적 trade-off를 살펴봅니다.

AMD, Taalas 인수 추진: AI 모델을 실리콘에 넣는 추론 전략

AI 경쟁의 중심이 모델 학습에서 대규모 추론 비용으로 이동하자, 반도체 설계도 다시 전문화되고 있습니다. AMD는 8월 6일 모델 전용 AI 추론 실리콘을 개발하는 캐나다 스타트업 Taalas를 인수하기 위한 최종 계약을 체결했다고 발표했습니다. Taalas의 기술을 AMD Instinct GPU와 결합한 시스템 수준 솔루션으로 발전시키겠다는 구상입니다. 다만 거래는 통상적인 종결 조건과 규제 승인을 남겨두고 있으며, 성능 수치도 현재로서는 Taalas가 공개한 시험 결과를 중심으로 봐야 합니다.

AMD가 사들이는 것은 또 하나의 범용 가속기가 아니다

Taalas는 2023년 토론토에서 설립됐습니다. 회사가 내세우는 핵심은 하나의 칩으로 가능한 많은 모델을 처리하는 범용성보다, 특정 모델의 데이터 흐름에 맞춰 실리콘을 설계하는 모델 전용 추론입니다. AMD의 공식 설명에 따르면 이 기술은 범용 아키텍처에서 발생하는 연산과 메모리 병목을 줄이는 데 초점을 맞춥니다.

일반적인 AI 가속기는 모델 가중치를 외부 고대역폭 메모리에서 반복해서 읽고 연산 장치로 옮깁니다. 이 이동은 성능과 전력, 패키징 비용을 좌우합니다. Taalas는 저장과 연산을 한 칩 안에서 더 밀접하게 결합하고, 모델의 구조와 가중치에 맞춘 회로를 구성해 데이터 이동 자체를 줄이겠다는 접근을 택했습니다. 회사가 “모델이 곧 컴퓨터”라고 표현하는 이유입니다.

첫 시연은 Llama 3.1 8B를 칩에 맞췄다

Taalas가 공개한 HC1 기술 시연 제품은 Llama 3.1 8B 실행에 맞춰 설계됐습니다. 공식 제품 페이지에는 TSMC 6나노 공정, 815제곱밀리미터 다이, 530억 개 트랜지스터, 2.5킬로와트 서버라는 사양이 적혀 있습니다. 회사는 사용자 한 명 기준 초당 1만7천 토큰을 생성한다고 주장합니다.

이 수치는 가능성을 보여주지만 독립적인 제품 평가와 같지는 않습니다. Taalas가 직접 실행한 시험이며, 비교 대상마다 측정 주체와 환경이 다릅니다. 입력과 출력 길이, 배치 크기, 정확도 손실, 동시 사용자 수가 바뀌면 결과도 달라질 수 있습니다. 특히 1세대 제품은 3비트와 6비트 매개변수를 혼합한 공격적 양자화 때문에 GPU 기준과 비교해 일부 품질 저하가 있다고 회사가 스스로 밝혔습니다.

그럼에도 한 사용자에게 매우 낮은 지연시간을 제공하는 설계는 의미가 있습니다. 실시간 음성·코딩 보조·검색·에이전트처럼 응답 대기시간이 작업 흐름을 깨뜨리는 서비스에서는 총처리량뿐 아니라 개별 요청의 지연시간이 제품 경험을 결정하기 때문입니다.

AMD는 GPU를 버리는 대신 전용 칩을 묶으려 한다

이번 발표에서 눈여겨볼 대목은 Taalas 기술이 Instinct GPU를 대체한다고 설명하지 않았다는 점입니다. AMD는 이를 Helios 랙스케일 시스템, Instinct GPU, EPYC CPU, ROCm 소프트웨어와 AI 생태계를 보완하는 기술로 규정했습니다. 인수 후에는 가속기 로드맵에 통합하고 Instinct GPU와 함께 시스템 수준 솔루션을 개발할 계획입니다.

이는 추론 시장이 하나의 칩 종류로 수렴하기보다 계층화될 가능성을 보여줍니다. 빠르게 바뀌거나 고객별로 다른 모델은 프로그래밍 가능한 GPU가 맡고, 수요가 크고 구조가 안정된 모델은 전용 실리콘이 처리하는 방식입니다. AMD는 범용 연산 플랫폼과 모델 맞춤형 경로를 모두 제공함으로써 워크로드에 따라 적합한 계산 방식을 고르게 하려는 셈입니다.

Reuters도 이번 거래를 AMD가 빠르게 성장하는 AI 추론 시장에서 입지를 넓히려는 움직임으로 평가했습니다. 다만 AMD는 인수 금액과 구체적인 제품 출시 시점은 공개하지 않았습니다. 따라서 당장 상용 서버의 가격이나 성능이 바뀐다고 단정하기보다, 장기 로드맵에 새로운 설계 선택지가 들어온 것으로 보는 편이 정확합니다.

모델 전용 실리콘의 장점은 곧 제약이 된다

전문화가 주는 이점은 명확합니다. 불필요한 제어 회로와 데이터 이동을 줄일 수 있고, 특정 모델에서 지연시간과 전력 효율을 크게 개선할 여지가 있습니다. 고정된 모델을 막대한 규모로 반복 실행하는 서비스라면 칩 설계 비용을 많은 요청에 나눠 부담할 수도 있습니다.

반대로 모델이 바뀔 때의 비용이 큽니다. 새로운 아키텍처나 가중치 전체를 적용하려면 소프트웨어 업데이트가 아니라 설계와 제조 주기를 다시 거쳐야 할 수 있습니다. Taalas는 처음 보는 모델을 약 두 달 안에 맞춤형 실리콘으로 구현할 수 있고, 문맥 길이 설정과 LoRA 미세조정 같은 일부 유연성도 유지한다고 주장합니다. 그러나 이는 GPU에서 체크포인트를 바꾸는 수준의 범용성과는 다릅니다.

또 하나의 위험은 모델 수명입니다. 칩이 생산되는 동안 더 나은 모델이 등장하거나 서비스 요구가 바뀌면 전용화의 경제성이 흔들릴 수 있습니다. 어떤 모델이 충분히 오래, 충분히 많이 호출될지를 예측하는 능력이 반도체 기술만큼 중요해집니다.

기업과 개발자가 볼 실무 포인트

  • 총처리량과 단일 사용자 지연시간을 구분합니다. 초당 토큰 수를 볼 때 배치 크기와 동시 사용자 수, 첫 토큰 지연을 함께 확인해야 합니다.
  • 품질을 같은 조건에서 재측정합니다. 양자화 비트 수와 출력 품질, 도구 호출 정확도, 긴 문맥 성능을 실제 업무 데이터로 비교합니다.
  • 모델 교체 주기를 계산합니다. 모델이 자주 바뀌는 서비스라면 전용 칩의 효율 이득보다 전환 비용이 커질 수 있습니다.
  • 시스템 전체 전력을 봅니다. 칩 효율뿐 아니라 메모리, 네트워크, 냉각, 유휴 시간까지 포함한 요청당 에너지와 비용을 측정합니다.
  • 공급망과 소프트웨어를 함께 평가합니다. 제조 수율, 배포 가능 시점, ROCm 및 서빙 도구 호환성, 장애 시 GPU로 되돌리는 경로가 필요합니다.

전망: 추론 칩의 경쟁 기준이 ‘범용성’ 하나에서 벗어난다

생성형 AI가 실험 단계를 지나 상시 서비스가 되면 같은 모델을 반복 실행하는 비용이 기업의 손익에 직접 연결됩니다. 이때 최고 성능의 범용 GPU만 늘리는 방식보다, 워크로드의 안정성과 규모에 따라 전용 칩을 섞는 구성이 경제적일 수 있습니다. AMD의 Taalas 인수 추진은 이런 변화에 선제적으로 대응하는 선택입니다.

성패는 Taalas의 인상적인 시연 수치를 실제 제품으로 재현하고, 모델 전용 칩의 경직성을 AMD의 범용 플랫폼으로 얼마나 보완하느냐에 달려 있습니다. 규제 승인과 거래 종결, 로드맵 통합, 독립 성능 검증이 차례로 남아 있습니다. 지금 확인된 것은 인수 계획과 기술 방향이며, 상용 효과는 이후 공개될 제품과 고객 배치에서 판단해야 합니다.

출처