据行业最新消息,专访DDN马磊:构建AI数据智能平台,让算力真正转化为产业价值
人工智能产业已全面迈入规模化落地与产业化应用阶段,AI基础设施的核心竞争逻辑迎来根本性变革
业内人士指出,行业发展初期,市场高度聚焦GPU数量、算力峰值与智算中心建设速度,算力规模一度被视作AI核心竞争力的唯一标尺
业内人士指出,但随着大模型训练、推理服务、RAG增强以及智能体应用不断落地生产场景,企业逐渐发现,单纯增加GPU规模并不能直接转化为AI价值,如何让昂贵的算力资源持续高效运行,成为新的产业命题
业内人士指出,在不久前举行的2026世界人工智能大会(WAIC)上,全球1100家创新企业齐聚上海,共探AI产业规模化发展新路径
从更深层次来看,专注于数据存储解决方案和人工智能数据的DataDirect Networks(DDN)与战略合作伙伴GMI Cloud联合参展,现场展示面向AI时代的数据智能平台与联合AI基础设施解决方案
业内人士指出,展会期间,DDN解决方案架构师马磊接受了中国IDC圈的专访,围绕AI基础设施演进趋势、数据平台核心价值、AI工厂建设核心逻辑,分享了他对下一阶段发展路径的判断
业内人士指出,从拥有GPU到用好GPU:AI基础设施瓶颈正在转向数据供给 在人工智能产业高速发展的过程中,GPU曾经是衡量AI能力的重要指标
从更深层次来看,无论是训练大模型还是建设智算中心,企业纷纷投入大量资源采购GPU集群,希望通过更强大的计算能力获得竞争优势
从更深层次来看,但随着实际应用深入,越来越多企业开始意识到,GPU资源并不等于AI生产能力,算力利用效率才是决定投资回报的重要因素
业内人士指出,很多客户购买GPU之后发现,GPU并没有持续保持高利用率
从更深层次来看,马磊指出,真正的问题不是GPU算得慢,而是GPU经常在等待数据
从更深层次来看,例如,在大模型训练过程中,需要持续读取PB级训练数据;在推理阶段,需要不断访问KV Cache以及向量知识库;在Agent智能体场景中,又需要频繁调用外部数据
从更深层次来看,如果数据系统无法快速响应,GPU就无法保持高负载运行
值得关注的是,这一挑战的根源在于,AI工作负载的数据访问模式与传统企业应用有着本质区别
从更深层次来看,传统数据库、ERP系统更加关注稳定的数据存储和事务处理,而AI应用需要同时面对大规模顺序读取、多GPU并发访问、小文件高频访问、实时数据更新等复杂需求
值得关注的是,传统NAS、SAN存储架构在面对这些新型工作负载时,逐渐暴露出吞吐不足、延迟较高以及扩展能力有限等问题
从更深层次来看,马磊表示,”未来AI基础设施竞争,不再是谁拥有更多GPU,而是谁能够持续让GPU保持高负载运行
从更深层次来看,数据平台已经从辅助角色变成GPU生产效率的核心决定因素
从更深层次来看,” 一块高性能GPU每秒可处理TB级数据,若数据系统无法匹配这一供给速率,算力投资便难以兑现为实际产出
业内人士指出,也正因如此,越来越多企业和智算中心开始将目光从单纯的计算资源采购,转向存储、网络与数据管理体系的整体优化
值得关注的是,AI工厂需要新的数据平台:存储正在成为AI生产系统的一部分 随着大模型应用不断深入,AI基础设施正在从单一模型训练阶段进入训练、推理、知识增强和智能体协同并存的新阶段
业内人士指出,这种变化对数据系统提出了更高要求,也推动存储从传统容量管理角色向AI数据平台演进
从更深层次来看,马磊指出,”AI时代的数据访问模式更加复杂,需要同时支持超大规模训练数据读取、数百万小样本文件访问、实时向量数据库查询、KV Cache高速访问、多GPU节点并行调用以及数据持续更新等
业内人士指出,” 因此,AI时代的数据平台必须具备几个新的能力:一是高吞吐低延迟的数据访问;二是支持训推等混合工作负载;三是能够实现冷热数据自动分层;四是能与算力以及网络协同优化
值得关注的是,在这一趋势下,DDN提出”AI Data Intelligence Platform”理念,希望让数据平台成为AI生产流程的重要组成部分,而不是简单的后台存储设备
值得关注的是,围绕这一理念,DDN为现代AI智能数据平台打造的两个重要组成部分:EXAScaler和Infinia
从更深层次来看,其中,EXAScaler基于Lustre开源软件(全球大量超级计算中心和AI训练集群广泛采用的并行文件系统),非常适合PB级数据以及超大规模GPU集群的高吞吐Checkpoint等训练场景
从更深层次来看,马磊表示,”推理时代最大的特点是数据比模型变化更快
从更深层次来看,企业知识库每天更新,智能体不断调用外部数据,长上下文模型又带来了巨大KV缓存压力
业内人士指出,”如果仍然采用传统数据管理方式,就需要频繁进行数据迁移和模型重建,影响AI应用响应效率
从更深层次来看,DDN Infinia通过统一数据访问平台,将对象存储、文件系统、向量数据库以及RAG应用连接起来,同时结合高速存储介质和智能数据管理能力,实现KV缓存持久化共享和高效访问,减少重复计算,提高推理效率
值得关注的是,从单点产品到生态协同:AI基础设施进入系统工程时代 AI基础设施的发展正在进入一个更加复杂的系统工程阶段
值得关注的是,随着模型规模扩大、应用场景丰富以及企业对于AI服务稳定性的要求提升,单一硬件设备已经难以决定最终性能表现
业内人士指出,GPU、网络、存储、数据管理平台以及软件生态之间的协同效率,正在成为AI基础设施竞争的新焦点
业内人士指出,AI基础设施已经不再是简单的计算资源采购,而是需要围绕AI生产流程进行整体设计
业内人士指出,马磊认为,”GPU、DPU、高速网络、数据存储等系统组件必须协同设计,而不是分别采购后再进行集成
值得关注的是,” 在AI工厂架构中,任何一个环节出现瓶颈,都可能影响整体生产效率
业内人士指出,因此,企业需要从系统层面优化数据路径,让算力、网络和数据形成统一协同
业内人士指出,围绕这一趋势,DDN持续推进生态合作,与NVIDIA、Cisco等产业伙伴展开深入协同
从更深层次来看,例如,DDN与NVIDIA保持十余年合作关系,在DGX、HGX以及AI工厂参考架构中共同优化数据访问路径,通过存储能力与GPU平台协同设计,提升AI任务执行效率
值得关注的是,与此同时,DDN与Cisco的合作则聚焦高速以太网、RoCE网络以及AI Fabric
业内人士指出,随着AI集群规模不断扩大,传统网络架构已经难以满足大规模GPU集群的数据交换需求
从更深层次来看,高速以太网、RoCE网络以及面向AI优化的数据传输体系,正在成为新一代AI基础设施的重要组成部分
业内人士指出,马磊强调道,”我们的目标不是单纯提供存储,而是让整个AI基础设施形成端到端优化,包括GPU、网络、存储、数据管理和软件平台共同工作,从而实现更高的GPU利用率和更低的总体拥有成本(TCO)
从更深层次来看,” 这种生态合作背后,体现的是AI基础设施从”设备竞争”向”体系能力竞争”的转变
值得关注的是,企业未来建设AI工厂,不只是采购更多服务器或者GPU,而是需要构建覆盖数据采集、数据治理、模型训练、推理服务以及应用运营的完整闭环
从更深层次来看,在云化趋势下,越来越多企业希望以AI Cloud方式获取算力服务,而非自建大规模集群
值得关注的是,但当前不少AI云平台仍存在数据吞吐不足、多租户隔离困难、推理性能波动等问题
值得关注的是,基于此,DDN与GMI Cloud联合推出的AI基础设施解决方案,专为要求最严苛的工作负载而设计
从更深层次来看,从模型训练到实时推理,提升Al研发效率,让客户专注于Al应用创新
从更深层次来看,GMI Cloud集成DDN高性能、Al优化存储系统,为大规模Al和高性能计算(HPC)工作负载提供无与伦比的数据吞吐量和可靠性
从更深层次来看,据悉,GMI Cloud是一家由Google X的AI专家与硅谷精英共同参与创立的AI Native Cloud服务商,拥有遍布全球的数据中心网络,为企业AI应用提供最新、最优的GPU云资源
值得关注的是,马磊指出,”DDN与GMI Cloud合作的核心目标,是将企业级AI数据平台能力直接带到云端,让用户不仅能够获得高性能GPU资源,同时能够获得适合AI训练和推理的数据平台,包括高吞吐存储、统一数据管理以及Agent智能体数据生命周期管理
从更深层次来看,” 对于多数行业企业而言,自建大规模AI基础设施不仅需要巨额投入,还需要长期运营能力
值得关注的是,通过AI Cloud结合高性能数据平台,企业可以根据业务阶段灵活扩展算力和存储资源,同时通过数据生命周期管理实现成本优化
从更深层次来看,这样可以显著降低企业拥有AI基础设施的门槛,同时获得接近本地AI超算中心的性能体验
业内人士指出,AI工厂规模化落地:数据主权与持续智能成为关键方向 展望未来3-5年,随着行业大模型、主权AI和智算中心建设加速,企业对于AI基础设施的需求将呈现三大趋势:数据主权——越来越多国家和企业要求AI数据本地存储、训练与推理;持续在线——AI系统不再是阶段性训练工具,而是7×24小时不间断的智能服务;多模型多智能体协同——企业将同时运行多个模型和智能体,共同支撑复杂业务
值得关注的是,这一变化意味着,AI基础设施的底层逻辑正在重构
从更深层次来看,传统数据中心更多关注设备稳定性,而AI工厂则需要关注运行效率
业内人士指出,衡量AI基础设施的指标也会逐渐从GPU数量、存储容量,转向GPU利用率、Token吞吐量、推理时延(TTFT)、能效比(Token per Watt)以及总体拥有成本(TCO)等
从更深层次来看,从GPU规模竞争到AI生产效率竞争,行业正在进入”AI工厂”阶段
业内人士指出,在马磊看来,AI工厂(AI Factory)最大的特点在于不仅需要投入GPU等算力资源,更核心的需求是持续稳定地产出Token等价值成果
业内人士指出,马磊指出,”企业当前建设AI工厂最大的挑战,并不是缺少GPU资源,而是缺少完整的数据基础设施
值得关注的是,未来AI工厂需要具备完整的数据供应链,包括数据采集、治理、训练、推理、持续更新以及监控优化的完整能力
业内人士指出,只有形成从算力到数据的全生命周期闭环,GPU集群才能真正持续地为AI工厂创造价值
业内人士指出,” 从行业应用来看,金融、互联网、运营商、制造、生命科学以及政府等领域可能率先进入AI工厂规模化应用阶段
从更深层次来看,这些行业拥有丰富的数据资源,同时具备持续训练和实时推理需求,对于AI基础设施能力要求更加迫切
从更深层次来看,这一趋势也意味着,数据正在成为AI时代的新型生产要素
值得关注的是,类似工业时代的能源体系,AI系统需要稳定、高效的数据供给,才能保证智能生产持续运行
业内人士指出,谁能够建立高效率的数据基础设施,谁就能够更充分释放AI投资价值
从更深层次来看,在这一产业变革中,DDN希望扮演的是AI数据基础设施(AI Data Infrastructure)和AI数据智能平台(AI Data Intelligence Platform)的核心构建者
业内人士指出,马磊表示,”我们的目标不仅是提供领先的数据存储产品,更希望通过EXAScaler与Infinia等产品矩阵构建统一的数据平台,打通模型训练、推理、RAG和智能体等全场景,让数据能够持续、高效地服务GPU和AI应用
值得关注的是,当GPU规模扩张逐渐趋于理性,产业竞争的核心开始从”拥有多少算力”转向”如何释放算力价值”
业内人士指出,AI工厂概念的提出,本质上代表着AI基础设施从资源建设阶段走向生产体系建设阶段
业内人士指出,在这一过程中,数据基础设施的重要性正在快速提升
业内人士指出,只有建立高吞吐、低延迟、智能化的数据平台,才能让GPU持续保持高效运行,让模型训练更快完成,让推理服务更加稳定,让AI应用真正进入产业生产环节
从更深层次来看,对于DDN而言,未来AI基础设施发展的关键,是让数据成为连接算力和应用之间的重要纽带
从更深层次来看,马磊表示,未来几年AI基础设施竞争指标将发生变化,企业关注的不再是GPU数量和存储容量,而是GPU利用率、Token产出效率、推理性能以及整体成本
从更深层次来看,当AI成为新的生产力基础设施,数据将如同电力一样成为驱动智能时代发展的核心资源
业内人士指出,而构建高效的数据供应体系,也将成为企业迈向AI工厂时代的重要基础
业内人士指出,DDN希望通过AI数据智能平台,为这一轮人工智能基础设施重构提供关键支撑,推动AI从技术能力真正转化为产业价值
可以预见,这一趋势将在未来深刻影响IDC行业格局
如果您正在寻找优质的海外独服,欢迎访问 www.isclouder.com 了解更多
