一、词元供应产业现状及痛点
• 多元算力环境增加适配与编排复杂度,词元质量及生產效率有待提升
从AI芯片体系来看,全球算力供应主要由英伟达及国产厂商等支撑。不同芯片在硬件架构、软件生态、性能边界、适配成熟度及成本结构方面存在显著差异,一方面抬升同一模型跨芯片的部署适配、算子优化与性能调优门槛;另一方面跨芯片混合集群进一步加大全局算力资源编排难度,异构算力池难以均衡编排推理任务,极易出现硬件忙閒分化、资源閒置浪费。
若企业不具备成熟的跨芯片适配、推理引擎深度优化与全链路工程调优能力,词元吞吐量、集群资源利用率、效率、用户体验及单位词元成本等核心指标都会出现大幅波动,这会导致底层算力无法充分释放峰值性能,难以稳定承接海量AI的推理需求,进而推高词元生產综合成本,大幅削弱企业客户规模化採购词元服务的商业经济性。由此,AI基础设施层的竞争重点正从单纯囤积算力资源,转向比拼词元生產效率。
• 模型与部署生态高度多样化,需保证词元服务的稳定性
从模型体系来看,当前市场并存DeepSeek、Qwen、GLM、Kimi等多款AI模型,各模型在参数规模、架构设计、推理效率、上下文长度及部署要求上各有差异,应用场景上也有所区分。叠加企业客户在部署方式、数据安全、模型选型上的多元化诉求,行业逐步形成跨芯片、多模型、多部署方式共存的推理基础设施格局。对於企业客户而言,词元服务的实际价值不仅取决於模型能力本身,也取决於词元能否被稳定、连续、低延迟地调用,并在不同业务场景中保持稳定体验。因此需要中间基础设施层通过集中管理、统一部署和编排各类异构算力和AI模型,保证词元的生產速度、运行稳定性与场景适配性。
二、词元供应平台在词元生產全生命週期中的赋能
在多元算力、多模型及多部署方式并存的行业环境下,针对词元生產效率波动、资源利用不均及服务稳定性要求提升等行业痛点,词元供应平台作為连接算力、模型与应用的系统软件层,对词元生產和交付全过程进行组织、编排和优化。
• 词元生產全生命週期:涉及基础资源接入、应用需求接入、模型选型、异构算力编排、推理执行、词元封装及结果交付
词元生產是由算力资源编排、模型部署和应用交付共同组成的连续服务流程。首先,词元生產需要接入能源、数据、模型及算力集群、高速互联、液冷系统等基础设施,形成可供调用的底层资源基础。随后,用户通过API、应用接口、智能体或各类应用系统发起词元调用需求,平台根据请求内容、任务类型、模型能力、上下文长度、响应时延及服务等级要求,完成模型选型、任务路由、资源匹配等。
进入推理环节后,平台进一步将任务分配至适配的异构算力资源、推理实例和运行环境,由推理引擎调用底层芯片、服务器及模型执行环境,并基於用户请求生成输出词元。最后,生成结果被封装為可计量、可定价、可交付的标準化词元服务,并通过各种AI应用交付到用户侧,同时平台持续监控服务质量、资源利用效率及单位词元成本,反向优化模型部署、算力编排和运营策略。
• 词元供应平台赋能词元生產全生命週期:具备提升词元供应效率、稳定性与可扩展性的重要战略价值
在词元生產链路中,词元供应平台承担连接底层算力资源、模型和应用的中枢作用,通过跨芯片适配、模型部署、推理优化、异构算力资源编排、弹性扩缩容、服务分发、计量计费及服务监控等能力,对词元供应平台生產和交付进行全流程赋能,将复杂推理需求转化為标準化、可管理、可规模化交付的词元服务,从而提升词元供应效率、降低跨芯片和多模型适配复杂度,并增强服务响应的稳定性和连续性。
对於客户而言,词元供应平台提供的不只是底层算力资源或单一模型调用能力,而是具备成本可控、稳定响应和多场景适配能力的封装好、易用的词元供应服务;对於算力和模型生态而言,平台则通过工程化优化和服务化交付,使底层异构算力和多模型能力更高效地转化為可被上层应用持续调用的词元生產能力。因此,词元供应平台成為支撑AI应用规模化落地的关键基础设施环节。
三、市场驱动因素分析
• 需求:差异化模型能力催生多元调用需求不同模型
在领域专长、能力与适用场景上存在显著差异,单一模型难以满足全部业务需求。同一企业、同一业务线甚至单一產品,往往需要同时调用多款模型,以匹配不同任务的能力要求与适配场景。企业多元化的模型调用需求也推动词元调用规模持续增长,催生对高适配性、多模型词元服务的需求。
• 供应:降本增效需求推动专业化词元供应服务发展
随著企业级AI应用进入生產环境,客户对词元获取成本、响应速度、服务稳定性及调用效率的要求不断提高。专业化词元供应平台可通过推理优化、资源编排、缓存机制和服务运营等能力,提高词元產出效率,降低词元生成及调用成本,帮助客户更高效地获取AI能力。
• 技术:异构算力资源与多模型生态并存推动适配需求提升
市场同时存在英伟达及多款国產AI芯片等异构算力,以及DeepSeek、Qwen、Kimi、GLM、Wan等多元模型生态。產业政策导向、国產AI芯片发展、多元技术路线竞争及客户部署需求分化共同塑造了长期多元异构格局,使跨芯片适配、模型部署、推理优化和编排能力的重要性进一步提升。
• 生态:企业级部署需求分化推动独立生态价值提升
企业客户对公有╱本地部署╱运营、资源与访问隔离以及场景化适配的需求日益多样化,推动词元供应服务由单一服务模式向多模式发展。独立生态词元供应平台能够连接多类型算力、多元模型及差异化企业客户部署需求,在多方竞合格局中提供更灵活的模型选择、部署方式和词元服务能力。
思瀚产业研究院提供行研报告、可研报告(立项审批备案、银行贷款、投资决策、集团上会)、产业规划、园区规划、商业计划书(股权融资、招商合资、内部决策)、专项调研、建筑设计、境外投资报告等相关咨询服务方案。
四、行业主流服务模式
词元供应平台的服务模式通常与客户调用规模、资源佔用方式、服务性能要求及部署方式密切相关。根据服务形式差异,行业内主要形成无服务器词元服务、专属实例及本地部署解决方案三类服务模式。在该等服务模式中,无服务器词元服务以共享资源的方式提供词元服务,一般按所消耗词元的使用量计费,主要面向寻求灵活且具成本效益的AI能力接入途径的开发者、中小型企业及其他客户。专属实例在公有云基础设施上提供预留或专属的算力,定价基於预留算力及底层基础设施成本,旨在满足对性能、稳定性有较高要求的客户。本地部署解决方案将我们的推理引擎及算力资源调度系统部署於客户自身的数据中心或专属算力环境中,使客户能够在其自有算力资源上使用广泛模型的词元服务,主要面向大型企业及机构客户。
五、词元供应市场规模
2024年,中国词元吞吐量约為142.5万亿次,2025年快速提升至约2,426.3万亿次,2024年至2025年增长率达到1,602.6%。这一增长主要源於AI模型能力持续提升后,AI使用形态由单次问答和内容生成,逐步向连续任务执行、复杂目标拆解、多步骤工具调用及多模态交互延伸,推理调用频次、上下文长度、併发需求和任务复杂度同步提升。进入2026年后,词元消耗量预计将进一步跃升至约50千万亿次水平;预计在2030年,中国词元消耗量将达到约53.2百亿亿个,2025年至2030年复合增长率约為638.3%。在此背景下,词元供应市场将释放长期、高确定性的市场增长潜力。
六、市场发展趋势分析
• 算力供应:算力持续呈现多样化
未来的算力供应将维持多样化的格局,其特徵為国外与国產AI芯片并存,以及存在多个供货商及多种并行硬件架构(如GPU及NPU)。随著算力异构性及生态系统适配持续发展,多源、多供货商及多架构的异构算力资源编排能力将成為行业的核心焦点。
• 服务模式:词元供应服务将由单一无服务器词元服务向多模式并行发展
随著企业客户从测试调用走向生產级部署,其对调用规模、响应稳定性、延迟容忍度及资源与访问隔离能力的要求不断分化。词元供应平台的服务模式将从共享资源池下的词元吞吐量,逐步扩展至词元吞吐量、专属实例及本地部署并行,以满足弹性伸缩、稳定供应和私有部署等不同需求。
• 產品能力:词元生產能力将围绕推理效率和服务稳定性持续深化
在多模型、多芯片、多部署方式并存的环境下,词元供应平台需要围绕词元生產全流程提升技术能力。推理引擎层将提升词元產出效率,集群编排层将优化算力资源利用率,MaaS及API分发╱运营层将强化多模型接入、统一调用、服务监控及客户运营能力,从而提升词元服务的效率、稳定性和可扩展性。
• 生态:独立生态平台将在多元异构格局下承担更重要的连接作用
云服务厂商、大型科技企业及模型厂商多依托自有资源构建封闭生态,服务体系优先适配自身算力、模型及应用;独立生态词元供应平台则秉持中立定位,不向单一算力或模型倾斜资源,而是连接多类型算力、AI模型及產业链各方主体,在跨芯片、多模型、多部署环境的服务交付中,形成独特的价值。