英伟达实现缓存跨模型复用,DeepSeek和Kimi优化KV Cache
By: t.me|2026/08/10 04:14:22
0
分享
过去两年,大模型推理优化聚焦于 KV Cache,模型在读取上下文后留下的中间计算结果,内容越长,显存和带宽消耗越大。DeepSeek-V2 通过 MLA 技术将 KV Cache 减少 93.3%,Kimi Linear 则最多减少 75%。各方努力降低长上下文的成本。 但现有方案存在限制:缓存通常只能在同一模型内部复用,切换模型时需重新计算前面几万甚至几十万 Token,频繁模型路由导致重复计算难以避免。 英伟达最新论文提出解决方案,发现同一家族、KV 结构匹配的不同大小模型之间,缓存存在明显线性关系。通过 500 段、每段 1024 Token 的文本校准,可以将一个模型的 KV Cache 转移至另一个模型使用。 Qwen3-14B 切换到 32B 时,32K 上下文重新计算约需 7 秒,而转换缓存仅需约 0.28 秒,速度快约 25 倍。这意味着小模型可以先处理长上下文生成 KV Cache,待需要更强能力时再将缓存转给大模型进行生成。 这种跨模型 KV Cache 的成熟应用将使模型路由节省更多算力,简单任务可由小模型完成,复杂问题再调用大模型,避免每次都从头读取上下文。
-- 价格
--
--
--
本内容仅供参考,不构成任何金融、投资、法律或税务建议。文中提及的任何活动、奖励、线上活动或相关信息,不应被视为对购买、出售或交易任何加密资产的推荐、招揽或邀请。加密资产具有高波动性,存在价值损失风险。WEEX服务、产品及相关活动的可用性可能因地区而异。用户在参与前有责任确保符合当地适用法律法规。
猜你喜欢

Anthropic 超四成收入来自云厂商间接渠道

瑞银调研中国AI产业链:大模型加速迭代,资金开始涌向半导体

中国AI模型下载占41%,对美国市场施加压力
中国的开放式AI模型预计将在2026年春季占全球下载量的41%,对美国企业级AI市场施加压力。竞争的焦点是最高性能的竞争...

GoPlus DeepScan全面升级:推出AI智能合约安全全生命周期防护体系

DeepSeek涨价首日全球分叉:国内大厂跟价分三派,海外厂商还在打折

数字资产投资指标 xRev 计算方法论及分析工具

超过53,000名加密货币持有者在本周失去了非金钱的东西

ZCode 免费送 1 亿 GLM-5.3 Token 活动上线一小时暂停

小红书模型比美国开放权重高出4.9分
中国小红书AI实验室dots.studio发布了开源模型‘dots3-note preview’。该模型拥有2800亿个参数规模的MoE结构和51.2万个token的上下文窗口...

模型可替换、工具可插拔:DeepSeek把Agent竞争从“大脑”推向“操作系统”

法国AI初创Kog押注软件提速GPU推理

Temple在Token Terminal上市,公开Canton应用活动指标
机构用非托管交易平台Temple在Token Terminal上市,Canton网络的应用活动指标开始公开。

AI时代未来最重要的5个习惯

广东首个词元经济金融产品 Token 贷 发布

K25.ai 启动 KXXV 代币社区轮,认购额度为 20 万美元

闪迪投资者日的口号,高盛如何解读

OpenAI 上线 Computer History 替代 Chronicle













