下载
登录/ 注册
主页
论坛
视频
热股
可转债
下载
下载

智能体浪潮:3项硬件短板谁来补齐?

26-09-26 07:19 289次浏览
月影千江
+关注
博主要求身份验证
登录用户ID:
大家可能都会有一种体验,BOSS给你交办个任务,比如整理个项目资料,或者汇总个报表。他只简短地说了几分钟,但你干活,来回忙活半天,可能还要更长时间才能完成。

造成这样的结果,可能也不是你的能力问题。而是说着容易,执行则需要经历很多过程。

智能体也有着类似的逻辑。用户给出一个最终目标,智能体就自主拆解任务、检索信息、调用工具、复核结果,就像老板安排你独立完成整套工作。但支撑智能体跑起来的底层硬件,存在三大短板,制约着它的效率。接下来,我们就来聊一聊这个话题。

“CPU。”

在之前的文章中聊到过CPU,它是指挥中心,拆解任务、调用工具、访问数据库、协调多个子任务同时运转。GPU很多时候可能在闲着等指令,CPU可能就已经忙得不可开交了。GPU用来计算,CPU用来指挥。

康奈尔大学的研究团队在五大代表性智能体工作负载中做了测试,发现CPU端的工具处理、逻辑调度、数据预处理环节,占端到端总延迟的比例高达43.8%到90.6%,远远超过GPU模型推理本身花的时间。在工具调用密集的RAG检索场景中,CPU处理甚至占总延迟的90%以上。

换句话说,有时感觉AI反应慢,大概率不是模型算不过来,而可能是管调度的忙不过来。

这种现象还在持续。IDC预测,全球活跃智能体数量将从2026年的约7940万个增长到2030年的22.16亿个。当几亿个智能体同时在线干活,对CPU调度能力的要求会是现在的几十倍。

“临时缓存。”

如果把智能体的记忆,看成一个不断收到信息的收件箱。每次跟它对话,每次它调用一个工具、思考,都会往这个收件箱里塞新东西。它得记住之前聊了什么、查到了什么、下一步要做什么。这些东西圈内叫“KV缓存”。

传统聊天AI,对话三五轮就结束了,收件箱里没多少东西。但智能体是长任务模式,上下文越来越长,收件箱就会越堆越满。

在今年下半年的全球内存创新峰会上,业内人士也指出,智能体带来的变化不是更大的模型,而是海量、反复变动的KV缓存。长上下文、多轮对话、循环推理,让这些缓存从用完就扔的临时数据变成了需要反复读写的核心资产。

如果全用最贵的高速显存来存这些东西,成本会高到没法商用。所以行业正在想各种办法,把数据按冷热分层,最热的放在最快的内存里,不太常用的往下沉。这就像手机相册,最常看的照片放在本地,其他的存云盘,很久不用的就归档。

“芯片连接。”

智能体干活的时候,可能同时调动几十甚至上百颗芯片,有的负责推理,有的负责存储,有的负责执行代码。这些芯片之间需要不停地互传数据。

以前用铜缆连接就够了,但当芯片数量增加到几百上千颗,铜缆的短板就会凸显。高速电信号在铜缆里,单通道速率提升至224G之后,有效传输距离会大幅压缩;大规模千卡集群互联场景下,铜缆的功耗、带宽瓶颈会凸显。而且,智能体之间的通信有个特点,单个数据包不大,但交互极其频繁。

解决方案是把电信号换成光信号。行业正在从传统的可插拔光模块,过渡到近封装光学(NPO)和共封装光学(CPO)技术。对比传统可插拔光模块架构,CPO方案系统功耗最多可降低50%,带宽密度最高提升10倍。

但这条路也并非一帆风顺。良率还不够高、算法有待完善、芯片与交换机之间存在兼容性问题,都还在解决中。

“谁来补短板?”

单独看,CPU是调度的事,内存是记忆的事,连接是信号传输的事。

但放在一起看,似乎还是一个整体,智能体的工作方式变了,硬件需要持续跟上。

过去的AI硬件是围绕训练大模型来优化的,核心可能是算。比谁的GPU算得快。但智能体时代,核心来到了调度、协作。它考验的不是单点算力,而是整个系统能不能高效地传数据、分任务、存记忆。

那么,谁来补齐这些短板?

目前来看,补齐短板需要整个产业链一起干。

CPU这边,英特尔在2026年推出了至强6+系列,最高288个能效核,专门针对智能体的调度需求做了优化。AMD也有关于这方面的动作。

内存这边,行业正在从一种内存转向分层存储的思路。比如,把最活跃的数据放在离GPU最近的HBM里,不太活跃的层层下沉,用架构设计来化解内存墙。

互联这边,有的架构,将十余种互联协议统一,互联带宽从百GB级提升到TB级,通信延迟从7微秒压缩到2微秒。一个4096卡的集群用这种方案,可以节省196公里铜缆。

在更前沿的方向上,存算一体技术正在被探索,试图从根本上改变计算和存储分开的传统架构。

“写在最后。”

所以,这样看,可能就是,智能体要真正普及,光靠堆GPU是不够的。它需要一整套系统的均衡配合,CPU能高效调度、内存能装下足够多的上下文、芯片之间能高速通信。这三块短板,任何一块拖后腿,整个系统都可能会被卡住。

不过,从芯片厂商到云服务商,整个产业链都已经意识到这个问题,并且在加速行动。当然,这些也都不是一朝一夕能解决的工程难题。

但话说回来,发现了调度延迟和内存带宽等这些问题,也说明这产业正在向前,不然可能谁也不至于发现和关心这些细节。

参考资料:
新浪 网.野村:1.6T光模块加速放量,电芯片正成为新瓶颈.2026年9月24日.
打开淘股吧APP
0
评论(0)
收藏
展开
热门 最新
提交