차이나모바일 후베이·화웨이, 중국 통신업계 최초 ‘AI 추론 가속 솔루션’ 상용망 검증 완료
- MWC 상하이 2026서 발표… 장문(long-sequence) AI 추론에서 토큰 처리량 최대 372% 향상
- 화웨이 OceanStor A800 스토리지·어센드 A3 슈퍼팟·통합 캐시 관리자(UCM) 기반 솔루션
- MiniMax M2.5·GLM-5.1 등 주요 모델로 검증… 통신사 AI 컴퓨팅 서비스의 효율적 배포 지원
[MWC 상하이 2026 화웨이 부스 전경]
화웨이가 장문(long-sequence) AI 추론의 토큰(생성형 AI의 연산·과금 단위) 처리량을 최대 372%까지 끌어올리는 ‘AI 추론 가속 솔루션(AI Inference Acceleration Solution)’을 중국 통신업계 최초로 상용망에서 검증하는 데 성공했다. 화웨이는 6월 24일부터 26일까지 중국 상하이에서 열린 ‘MWC 상하이 2026’에서 차이나모바일 후베이(중국이동통신그룹 후베이, China Mobile Hubei)와 공동으로 이 같은 검증 성과를 공개했다고 밝혔다. 이번 솔루션은 화웨이의 OceanStor A800 스토리지와 어센드 A3 슈퍼팟(Ascend A3 SuperPoD), 통합 캐시 관리자(UCM, Unified Cache Manager)를 기반으로 하며, 통신사가 AI 컴퓨팅 서비스를 효율적으로 배포할 수 있는 핵심 기술 토대를 마련했다는 점에서 의미가 크다.
기술 혁신: UCM으로 장문 추론 병목 해소
AI 응용이 빠르게 AI 에이전트 중심으로 옮겨가면서 코드 생성과 멀티턴(multi-turn) 대화처럼 긴 문맥을 다루는 장문 시나리오가 늘고 있다. 하지만 기존 온칩 메모리와 D램(DRAM)의 제한된 용량은 KV 캐시(키-값 캐시) 적중률을 크게 떨어뜨려 전체 성능의 발목을 잡아 왔다.
화웨이는 이러한 한계를 풀기 위해 2025년 UCM을 선보였다. UCM은 외부 고성능 스토리지를 활용해 온칩 메모리와 D램의 용량 한계를 넘어선 페타바이트(PB)급 KV 캐시를 구현한다. 또한 KV 캐시를 전(全) 주기에 걸쳐 계층적으로 관리·스케줄링함으로써 단일 대화의 컨텍스트 창을 크게 넓히고, 멀티턴 대화에서는 과거 KV 캐시를 재사용해 중복 연산을 없애 더 낮은 비용으로 최적화된 추론 경험을 제공한다.
성능 향상: TTFT·TPS 동반 개선, 다중 모델 검증
이번 검증은 차이나모바일 후베이의 상용망 환경에 vLLM-Ascend 프레임워크를 배포하고, MiniMax M2.5와 GLM-5.1 등 주요 모델에서 8K부터 190K 토큰에 이르는 장문 입력을 시뮬레이션하는 방식으로 이뤄졌다. 주요 결과는 다음과 같다.
▲MiniMax M2.5는 UCM 적용 시 첫 토큰 생성 시간(TTFT, Time To First Token)이 26~62% 개선되고 NPU당 초당 토큰 수(TPS, Tokens Per Second)가 크게 향상됐다. 시퀀스 길이별로는 64K에서 TPS가 58%, 128K 장문 환경에서 78% 높아졌다. ▲GLM-5.1은 TTFT가 51~93% 개선되고 TPS가 56~372% 향상됐으며, 64K에서 313%, 128K 장문 환경에서 372% 상승했다.
이번 결과는 컨텍스트 길이가 길어질수록 AI 추론 가속 솔루션의 강점이 더욱 뚜렷해진다는 점을 보여준다. 해당 솔루션은 장문 추론에서 흔히 나타나는 KV 캐시 용량 병목을 효과적으로 해소한다.
가치 확대: 에이전트 시대의 미션 크리티컬 서비스 지원
차이나모바일 후베이 관계자는 “후베이는 전국 8대 컴퓨팅 파워 허브와의 지연시간이 10밀리초에 불과한 핵심 지역에 위치해 있다”며 “이번 검증은 스토리지·컴퓨팅·네트워크 협력의 필요성을 입증했다. AI 에이전트 상호작용과 코드 생성 같은 시나리오에서 AI 추론 가속 솔루션은 처리량을 50% 이상 높일 수 있어, 차이나모바일 후베이 AI 서비스의 대규모 배포를 위한 견고한 기반을 마련했다”고 말했다.
산업 전망: AI 데이터 인프라의 재편
마이클 추(Michael Qiu) 화웨이 글로벌 데이터 스토리지 마케팅·솔루션 세일즈 부문 사장은 “주요 통신사들이 토큰 패키지를 출시하면서 AI 에이전트의 대규모 도입이 분명히 새로운 국면에 접어들었고, 향후 토큰 소비는 기하급수적으로 늘어날 전망”이라며 “AI 추론 가속 솔루션은 TTFT를 크게 줄일 뿐 아니라 토큰 비용 절감에도 기여해, 통신사가 효율적이고 친환경적인 AI 컴퓨팅 인프라를 구축하도록 지원한다”고 밝혔다.
이번 검증 성공은 통신사를 위한 AI 컴퓨팅 인프라의 협력적 최적화에서 의미 있는 진전으로, 글로벌 AI 산업에 복제 가능한 기술 모델을 제시했다.
한편 ‘MWC 상하이 2026’은 6월 24일부터 26일까지 중국 상하이 신국제엑스포센터(SNIEC) N1홀에서 열렸으며, 화웨이는 행사 기간 동안 최신 제품과 솔루션을 선보였다. 화웨이 관계자는 “ICT 산업이 빠르게 토큰 수익화 시대로 이동하고 있다”며 “강화된 연결성과 컴퓨팅을 바탕으로 글로벌 통신사·파트너와 함께 5G-A 고속 업링크 및 경험 수익화, AI 기반 비즈니스 고도화를 모색하고 토큰 수익화가 제시하는 기회를 함께 선점해 나갈 것”이라고 밝혔다.