英伟达 Qwen3.8-Flash-Next 在 GB300 NVL72 上实现超 1.6 万 Token/秒吞吐
By: www.theblockbeats.info|2026/08/26 17:14:34
0
分享
英伟达发布文章称,阿里巴巴最新预览模型 Qwen3.8-Flash-Next 已获得英伟达 GB300 NVL72 平台支持。该模型总参数规模达 1760 亿,每 Token 激活约 60 亿参数,原生支持 26.2 万 Token 上下文,并可通过 YaRN 扩展至 100 万 Token,主要面向智能编程、文档处理及工具调用等长上下文 Agent 应用。英伟达表示,Qwen3.8-Flash-Next 采用 Gated DeltaNet(GDN)与 Qwen Sparse Attention(QSA)混合架构,以降低长上下文场景下的计算和 KV 缓存开销。测试显示,在 GB300 NVL72 上,该模型单 GPU 吞吐量超过 1.6 万 Token/秒,单用户吞吐超过 200 Token/秒;同时支持 SGLang、vLLM 及 TensorRT-LLM 等推理框架。
-- 价格
--
--
--
本内容仅供参考,不构成任何金融、投资、法律或税务建议。文中提及的任何活动、奖励、线上活动或相关信息,不应被视为对购买、出售或交易任何加密资产的推荐、招揽或邀请。加密资产具有高波动性,存在价值损失风险。WEEX服务、产品及相关活动的可用性可能因地区而异。用户在参与前有责任确保符合当地适用法律法规。
猜你喜欢

中国开源大模型核心 ARR 约 60-80 亿美元

朴永善:AI经济第二幕开启……代理人、稳定币、物理AI

DGrid AI:用 PoQ 与验证节点重构 AI 基础设施信任机制

200个AI交易产品全没用?前Foresight Ventures联创做了一个不一样的

高通发布 IMSDK 2.0 推动边缘 AI 应用开发

为什么你的文章读起来像AI?a16z编辑教你如何找回“人味”

苹果推出 M6 芯片 Mac mini,起售价 899 美元
搭载 M6 芯片的新款 Mac mini 起售价为 US$ 899,比被替代的型号高出 US$ 100 • Apple 更新了 Mac Studio,并将这两条产品线定位于在设备本地运行的 AI 任务 • 预售于周二开始,发货预计在9月22日进行

CFTC正在审议GPU计算中的永续期货合约的可行性【最新动态指南】
CFTC正在征集关于“永续计算期货”的意见,意见提交截止日期为2026年10月20日。请通过官方网站参与。

汤森路透投资4000万美元开发法律AI模型‘汤森’
汤森路透(Thomson Reuters)投入4000万美元(约553亿元)开发了自家的大型语言模型(LLM)‘汤森(Thomson)’。与直接使用通用AI模型不同,法律...

OpenAI 联创 Andrej Karpathy 加入 Anthropic
ChainCatcher 消息,OpenAI 联合创始人、前特斯拉人工智能总监 Andrej Karpathy 官宣加入 Anthropic,并表示“我认为,未来几年将是大语言模型(LLM)前沿发展尤其关键的阶段。我非常高兴能加入这里的团队,并重新回到研发工作中。
我依然对教育领域充满热情,并计划在未来适当的时候继续推进相关工作。”

高概率关闭部分餐厅

2026 最野 DeFi 收益策略:不赌暴涨,吃尽链上投机手续费

贝森特提到数字资产可能成为对伊朗制裁的新目标

以太坊与索拉纳:哪个L1能捕获更多价值?

Fables 积分十月收官,「短平快」美股做市协议值得参与吗?

Robinhood Chain 热度持续爆发,微软首度单列 Azure 营收|WEEX TradFi 每日市场简报(2026年9月3日)
本篇简报聚焦 Robinhood Chain 链上交易热度持续升温及其对 Arbitrum 生态收入的直接传导,微软提升 Azure 与 AI 基础设施收入透明度,以及博通在 AI 半导体高增长背景下面临的预期博弈。同时,市场也将把关注点转向美国8月非农就业报告与 Ciena 财报对宏观利率路径和光通信景气度的进一步验证。

股票代币化究竟还面临着哪些挑战?











