选择区域/语言
- Australia - English
- Brazil - Português
- China - 简体中文
- Europe - English
- France - Français
- Germany - Deutsch
- Ireland - English
- Italy - Italiano
- Japan - 日本語
- Kazakhstan - Қазақ тілі
- Kazakhstan - Pусский
- Kenya - English
- Korea - 한국어
- Malaysia - English
- Mexico - Español
- Mongolia - Mонгол
- New Zealand - English
- Netherlands - Nederlands
- Poland - Polski
- Romania - Română
- Singapore - English
- South Africa - English
- Spain - Español
- Switzerland - Deutsch
- Switzerland - Français
- Switzerland - Italiano
- Switzerland - English
- Tanzania - English
- Thailand - ภาษาไทย
- Turkiye - Türkçe
- Ukraine - Українська
- United Kingdom - English
- Uzbekistan - Pусский
- Uzbekistan - O’zbek
- Vietnam - Tiếng Việt
- Global - English
AI正从以训练为主的上半场,转向以推理规模化应用为核心的下半场。作为国家数字基础设施的主力军,运营商凭借完备的“云—网—边—端”基础设施能力,在AI驱动的产业变革中迎来新机遇。在政务、教育、医疗、工业制造及互联网等领域,运营商已率先开启了Token经营新模式,包括推出Token套餐包、提供全栈式算力托管服务等,同时依托AI一体机等产品快速交付与规模化部署。
在AI推理应用中,推理效率与体验、算力资源调度、安全韧性等是企业客户的核心关切。华为数据存储携手运营商围绕“数据湖、知识与记忆平台、算力、模型、Agent框架、数据韧性”六大核心方向共建AI数据基础设施,助力运营商为企业客户提供优质、安全的Token服务,加速运营商迈向Token经营新时代。
图:AI数据基础设施架构
在AI数据基础设施建设中,业界对算力的论述已非常丰富和深入,本文不再赘述。
接下来章节将围绕数据湖、知识与记忆平台、模型、Agent框架、数据韧性进行详细阐述。
数据湖:高质量数据汇聚与供给
企业想让AI落地,首先需要跨越“数据量大、数据管理难”的鸿沟。以工业质检为例,单台超高清工业相机每天会产生数万张高精度图像,一条产线每月新增PB级数据、年累计达数十PB已是常态。然而,当发生客诉需要质量追溯时,企业需要在百亿级数据中检索特定缺陷,传统方式长达数小时的检索时长,严重拖慢了生产和售后响应效率。
为此,华为推出AI数据湖方案,通过部署OceanStor Pacific全闪分布式存储,以11PB/2U业界领先的高容量密度,实现最优TCO存储海量数据;同时,依托DME Omni-Dataverse统一数据空间,使能多模态、跨站点数据实时入湖与全局可视可管;此外,方案还具备千亿千维向量数据的秒级检索能力,实现了高质量数据汇聚与供给。
知识与记忆平台:让检索更精准、让推理更高效、让模型越用越聪明
针对推理业务中幻觉频发、响应体验不佳及推理记忆缺失等瓶颈,华为首创“3+1”AI数据平台,针对知识、KV Cache和记忆进行存储与优化,并通过UCM技术实现调度与管理,助力运营商toB客户推理体验提升。
-
知识库提供高精度多模知识,让检索更精准
在企业级AI应用中,检索的精准度直接决定了业务系统的可用性。以智能查询为例,客户日常需要处理海量信息,涵盖产品手册、行业白皮书、政策文件等。传统关键词检索只能匹配文档标题或摘要,无法穿透图片和表格提取有效信息,这导致检索结果往往“答非所问”。
基于OceanStor AI存储构建的知识库能力,通过多模无损解析、Token级编码等方式,将非结构化的文本、图片、视频等资源转化成海量细粒度的知识单元,结合多维度语义检索与比对,能够实现对用户意图的精准理解。实测数据显示,该方案可将检索准确率提升至95%以上,为客户提供“有据可依、拒绝幻觉”的高精准检索查询体验。
-
PB级KV Cache容纳海量历史数据,让推理更高效
在医疗文献分析、互联网搜推等场景中,长文本、长序列、多用户多并发的推理已成为典型负载特征。随着输入序列的增长,产生的KV Cache(键值缓存)数据量呈指数级上升。如果基础设施无法支撑大规模的缓存存储,系统响应就会变得迟缓,导致推理体验恶化。
基于OceanStor AI存储或者OceanDisk智能盘框提供的PB级KV Cache扩展能力,系统能够完整保留大规模、多轮次的缓存数据。在新请求到达时,系统可以直接复用历史缓存,大幅减少推理过程中的重复计算,显著降低推理时延,提升推理吞吐与用户体验,为长序列、复杂逻辑的智能体推理提供关键性能支撑。
-
记忆库提供上下文记忆管理,让模型越用越聪明
大模型在处理复杂商业逻辑时,往往面临“转瞬即忘”的困境。以商业数据洞察为例,企业每月需处理销售数据、促销效果反馈、产品库存周转率等大量业务数据。这就要求模型的推理不能每次都从零开始,而是需要记住过去半年甚至一年的营销成败经验,并能够在新策略生成时主动调用这些历史记忆进行对比与校准。
基于OceanStor AI存储提供的记忆库能力,华为通过上下文状态保持、上下文凝练等技术,可精准萃取历史数据与经验,并将其沉淀成可召回的记忆。模型记得更多,推理就更精准,进而实现“越用越聪明”的持续进化,让商业洞察从“事后复盘”真正走向“智能决策”。
-
UCM推理记忆数据管理技术,全生命周期管理与调度记忆数据
为进一步优化Token在各业务环节的流转效率,提升推理效率与体验,华为推出了UCM推理记忆数据管理器(Unified Cache Manager)。其核心逻辑是通过“推理框架、算力、存储”三层协同,对知识库、KV Cache和记忆库进行分级管理与智能调度。在实测中,实现了首Token时延最高降低90%、系统吞吐量最大提升22倍的突破性性能提升。
作为软件系统,UCM主要由三部分构成:顶层是连接器,与业界主流推理框架(如vLLM/SGLang/MindIE等)对接,实现良好协同;中间部分是运行在计算服务器中的加速程序,负责对缓存记忆数据进行分级缓存管理;底层是与专业共享存储相结合的协同器,它能提升专业存储的直通效率并降低时延。
模型工程与资源调度:模型开箱即用、算力资源精细化管理
在运营商B2B业务中,智能服务往往需要同时支撑多个行业场景,且不同场景对模型的架构、精度及推理性能要求各异。此外,当业务场景切换时,还需要频繁进行模型换入换出。
华为ModelEngine具备模型开箱即用与模型网关的能力,可支持模型一键部署。此外,结合算力资源细粒度切分与智能调度,可将单张算力卡切分为多份虚拟算力单元,最大可实现1:10的XPU卡切分。通过这种“一卡变多卡”的模式,大幅提升资源利用率。
Agent框架:低代码高效开发、智能体自主演进
当前,政务、医疗等行业智能体(Agent)正加速普及,逐步成为常态化的“数字员工”。然而,传统的Agent开发高度依赖高门槛的专业编程;在Agent上线后,面对业务规则的变更与用户交互习惯的演变,还需要依赖人工反复调参与提示词优化,导致维护成本居高不下。
华为ModelEngine Nexent智能体平台可通过自然语言交互方式直接生成Agent,大幅降低开发门槛,使Agent上线周期缩短80%。此外,平台支持对Skill、提示词及记忆的自动优化,助力Agent持续演进、越用越聪明。
数据韧性:可信数据空间保障全流程数据可信流通、数据安全合规
在医疗、制造等行业场景中,数据共享常陷入“信任困局”:数据提供方因担心数据分享出去后不可控、无法追踪或使用权被滥用而“不愿共享”;数据使用方则因难以核实数据的真实性和安全性而“不敢使用”。华为依托全局数据管理技术,构建可信数据空间。针对数据可信管控和高效安全传输两大行业痛点,华为提供了超过30种使用控制策略(涵盖访问权限、有效期限、查看次数等),确保数据消费方必须严格按照数据提供方的策略和认证使用数据,让数据使用记录全流程可查证、可溯源。
运营商智算平台实践
华为携手中国某运营商联合打造的“智算服务平台”,目前已作为AI能力底座在集团内规模部署,全面支撑自用IT系统及toC、toB、toH等多维业务创新。该平台以KV Cache存储建设为核心,显著提升存储资源效率,并全面兼容运营商自研模型、DeepSeek/千问等开源大模型推理应用。针对研究报告分析等长序列输入场景,平台通过算法优化,成功攻克“推不动”、KV Cache命中率低等工程难题。实测数据显示,平台整体吞吐率提升10倍以上,推理成本降低约50%,响应时间缩短至1秒以内,为大规模、多业务并发推理提供了高效、稳定的性能支撑。
AI为运营商打开了Token经营全新增长模式,华为愿与全球运营商携手,共建AI数据基础设施,全面提升AI推理效率与体验、保障数据安全,助力运营商B2B业务新增长,实现从“流量经营”到“Token经营”的跨域式发展。
- 标签: