OpenAI新技术:KV Cache,AI模型推理成本将50%+

2026-07-01 13:07:297

OpenAI采用KV Cache(键值缓存)新技术,AI模型推理成本降低50%以上


据知情人士透露,在一个此前未公开的案例中,OpenAI工程师通过新发现的优化方法,成功将推理(即运行现有模型)成本降低了一半以上,据推测,OpenAI实现模型推理最新效率提升,或采用了AI新技术:KV Cache(键值缓存)。



开普云688228:公司针对大模型推理降本增效需求,围绕推理加速引擎、KVCache键值缓存技术优化开展专项技术攻关,推出开悟大模型一体机,将AI算力和大模型软件融为一体,实现KVCache技术、高效低比特量化在AI算力大模型的高效应用和落地交付。


海量数据603138:自研分布式内存数据库、分布式存储架构,建多级KV‑Cache键值缓存体系,通过存算分离模式把非热点键值缓存卸载到外部高速存储,优化缓存调度逻辑,减少HBM显存消耗,提升大模型对话、长文档解析场景的服务并发量,降低硬件采购成本,适配国产化及英伟达算力平台,可面向政企、算力中心开展商业化落地。


星环科技688031:NV英伟达存储架构合作商+KV Cache键值缓存。公司为大模型推理打造GPU原生数据库,底层内置动态KV Cache分层管理引擎,实现三级KV缓存自动调度,解决长上下文、多并发推理显存瓶颈,深度适配英伟达GPU生态;产品配套LLM推理平台,内置上下文KV Cache键值缓存优化模块,私有化智算集群批量落地政务、金融AI场景。


品高股份688227:公司与深圳江原在KV Cache多级缓存优化、SR-1OVGPU虚拟化驱动 KV Cache 多级缓存优化 + 软硬件融合,KV Cache 多级缓存 + 软硬件融合做的是 降低了存储使用率。


江波龙301308:公司布局AI KVCache键值缓存赛道,量产 PCIe5.0 企业级SSD、DDR5内存模组及CXL内存扩展硬件,自研 HLC缓存调度技术,可将大模型推理产生的温冷KV缓存从GPU显存下沉至SSD与扩展内存,缓解显存瓶颈,适配vLLM 推理框架,已进入头部算力厂商供应链。



特别声明:文章内容根据公开信息整理,不作为买卖参考,如有不妥请联系删改。

作者声明: 本文转载自第三方,旨在提供资讯参考,并非证券推荐或投资建议。作者对内容的真实性、准确性不承担保证责任。本文不构成任何投资建议或证券推荐。截至发文日,作者与文中提及的标的不存在持仓关系。

标签: 深圳英伟达

合规声明:本站发布的所有文章及观点均系个人研究共享,投资心得交流,不代表本站立场,且不构成任何形式的投资建议。投资者据此操作,风险自担,请务必保持独立审慎的决策态度。