華為推出OceanStor M900 AI記憶存儲,加速超大規模數據中心AI推理
上海2026年9月17日 /美通社/ -- 華為全聯接大會2026期間,華為副董事長、輪值董事長汪濤在主題演講中,正式推出OceanStor M900 AI記憶存儲。面向超大規模數據中心AI推理場景,該產品為超節點提供PB級大容量、TB級高性能的全共享記憶空間,推動AI基礎設施從以計算為中心,邁向計算、網絡與存儲深度協同的新階段,進一步釋放超節點算力潛能。
2026年,人工智能加速從技術突破走向規模應用,AI應用從Chatbot對話進一步演進為能夠自主完成複雜任務的智能體,並加速進入科研、醫療、金融和公共服務等關係國計民生的重要領域,人類社會由此進入Agentic AI時代。
隨著大模型邁向10T級參數規模,超節點成為AI基礎設施建設的必然選擇,同時業界主流大模型的上下文窗口已突破百萬詞元,多輪推理和複雜任務成為常態,推理過程中產生的KV Cache數據規模持續增長,顯存和內存容量與性價比均已無法滿足需求。構建顯存、內存與SSD協同的多級存儲體系,打造大容量的全共享記憶空間,已成為行業共識。
為了突破超長上下文、多輪推理場景的內存容量瓶頸,華為全新推出的OceanStor M900 AI記憶存儲,利用靈衢網絡構建了「一跳直通」的PB級全局KV Cache多級緩存方案,充分釋放超節點的算力潛能,加速超大規模數據中心AI推理,其具備三大核心能力:
打破容量邊界,讓大規模AI擁有更充足的記憶
依托靈衢高速互聯網絡,實現KV Cache的全局池化共享和分級存儲,將超節點的KV Cache從顯存與內存擴展至SSD,單集群可提供64PB容量,單NPU可用KV Cache容量從GB級提升至TB級,讓更多上下文得以保存、共享和復用,大幅提升KV Cache緩存命中率。
躍升推理性能,讓算力釋放更充分
業界首創的CPU、網絡、盤控三芯合一架構,提供原生KV語義,實現超節點的NPU一跳直通到SSD,避免協議轉換和CPU轉發,訪問時延由ms級降至60μs,縮短90%;單集群可提供40TB/s聚合訪問帶寬,相比業界方案提升1.5倍。在典型AI編程場景中,可實現推理集群Token吞吐率翻倍、首Token時延縮短一半,讓算力更快轉化為生產力。
降低Token成本,讓AI規模化應用更經濟
採用業界首創的KV-Aware自適應存儲技術,根據KV Cache數據價值預測生命週期,對多模介質上的數據排布進行智能調度,實現最高24 DWPD,使得SSD介質壽命提升16倍,支撐三年穩定運行;通過減少介質更換和運維投入,降低大規模AI推理基礎設施的長期成本,加速人工智能規模化普及。
面向未來,隨著人工智能加速進入各行業核心生產系統,AI基礎設施將由單純追求算力規模,進一步邁向算力、網絡與存力的系統協同,AI記憶存儲將成為持續提升超大規模推理KV Cache容量與訪問效率的必然選擇。華為將不斷推進軟硬件協同和系統級創新,打造開放、高效、可持續的AI基礎設施,為人工智能技術進步、產業智能化升級提供堅實支撐。








