2026年10月9日,芯展速发布AI90方案,通过“存—连—管”全栈技术让消费级GPU可承载企业级大模型推理任务。

该方案基于存算协同架构,支持单卡显存扩展至192GB,推理吞吐较原生方案提升约3倍。芯展速表示:“企业可更灵活、低成本地构建自有Token工厂。”

显存扩展至192GB后,单张消费级GPU即可承载百亿参数大模型推理,中小企业本地化AI部署成本进一步下探。

来源:CSDN AI