2026 年 9 月 23 日 星期三
  • 登录
  • 注册
周天财经
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金
没有结果
查看所有结果
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金
没有结果
查看所有结果
周天财经
没有结果
查看所有结果
首页 黄金

从"单点优化"到"规模化提升" 百度智能云构建 Agent 时代推理基础设施

2026 年 9 月 23 日
在 黄金
阅读时间: 1 min read
阅读:733
A A

【TechWeb】9 月 22 日,百度智能云联合 SGLang 社区举办 「Agent 时代的推理基础设施:百度百舸 × SGLang 生产级实践」Meetup,围绕多芯适配、上下文缓存、KV Cache 优化、显存优化、MoE 专家压缩和推理服务治理等议题,探讨 Agent 走向生产环境所需要的推理底座。

从多芯适配到上下文复用 让 Agent 更快地跑起来

当前,Agent 不再只是生成一次回答,而是需要理解目标、拆解任务、调用工具,并在多轮交互中持续推进。上下文能否复用、超大模型能否高效部署、复杂请求能否稳定调度,都将影响 Agent 的任务完成效率和规模化应用成本。

一次真实的 Agent 任务,往往包含多轮推理和工具调用。随着任务推进,输入上下文持续增长,不同轮次之间也存在大量重复内容。如果每轮交互都从头计算,响应速度和推理成本都会受到影响。

公开基准数据显示,在 393 条真实 Agentic Coding 任务轨迹中,输入输出比中位数达到 213∶1,极端情况下输入序列长度可达 67.5 万 Token。Agent 工作负载正在呈现长输入、多轮次、强复用的特征。

因此,Agent 时代的推理基础设施不能只关注模型一次 「答得多快」,还要关注一项任务能否连续、稳定、低成本地完成。要实现这一目标,推理基础设施需要从底层硬件适配、计算效率优化到上下文管理进行系统性升级。

在多芯适配方面,sglang-kunlun 插件打通 SGLang 与昆仑芯,降低模型迁移和适配门槛。百度百舸还推动 SGLang 社区建立硬件可插拔插件机制,并从芯片算子、任务下发和通信等层面进行优化。

在上下文缓存方面,SGLang 社区分享了从 RadixAttention 到 Unified Radix Cache 的技术演进。通过统一缓存管理体系,不同类型的 KV Cache 可以实现高效复用。在现场分享的实践数据中,FULL 与 SWA 混合模型在多轮 HiCache 场景下命中率达到 96.8%,平均首字时延为 1.23 秒。

不止模型跑得快 也要让整套服务稳定可控

面对超大模型部署,百度百舸通过权重零冗余分布式部署、显存占用优化和 MoE 专家压缩,释放更多显存空间,为长上下文和高并发任务提供资源支撑。

在相关测试中,MoE 专家压缩 50% 后,长输出和高并发场景下的输出吞吐峰值可达到原来的 2.23 倍。对 Agent 而言,这不仅意味着节省显存,也意味着相同算力资源可以承载更多任务。

当 Agent 进入生产环境,仅仅提高模型速度还不够。百度百舸从流量、负载和集群缓存三个层面进行服务治理,通过动态调度、变长行为感知分桶和 KV Cache 无感热迁移,让请求进入更加合适的推理实例。

同时,百度百舸构建多级缓存体系,并通过全链路命中率漏斗定位缓存损失环节,提升复杂负载下的服务稳定性。

模型能力之外 看见 Agent 的真实问题

本次活动还设置了闪电演讲环节。SGLang 核心贡献者张晓雨围绕推理服务部署和 AI Infra 工程自动化展开分享;元神智算 CEO 蓝衣剑客从标准与生态角度分享 Agent 发展趋势;万涂幻象社区主理人李祥瑞则聚焦上下文与主体连续性,讨论 Agent 如何在真实系统中保持状态、完成交付并应对故障恢复。

三位嘉宾的分享共同指向一个变化:Agent 的价值不只是 「更会回答」,而是能够在连续上下文中理解任务、调用能力并完成交付。百度智能云将继续与 SGLang 等技术社区及更多开发者开展技术共建,助力 Agent 从单点尝试走向规模化落地。

模型能力决定 Agent 能够解决什么问题,推理基础设施则决定这些能力能否被稳定、低成本地交付。百度百舸正在把推理能力从单点性能优化,扩展为覆盖模型适配、上下文复用、资源管理和服务治理的完整体系,帮助 Agent 跑得更快、更省、更稳。

广告

【TechWeb】9 月 22 日,百度智能云联合 SGLang 社区举办 「Agent 时代的推理基础设施:百度百舸 × SGLang 生产级实践」Meetup,围绕多芯适配、上下文缓存、KV Cache 优化、显存优化、MoE 专家压缩和推理服务治理等议题,探讨 Agent 走向生产环境所需要的推理底座。

从多芯适配到上下文复用 让 Agent 更快地跑起来

当前,Agent 不再只是生成一次回答,而是需要理解目标、拆解任务、调用工具,并在多轮交互中持续推进。上下文能否复用、超大模型能否高效部署、复杂请求能否稳定调度,都将影响 Agent 的任务完成效率和规模化应用成本。

一次真实的 Agent 任务,往往包含多轮推理和工具调用。随着任务推进,输入上下文持续增长,不同轮次之间也存在大量重复内容。如果每轮交互都从头计算,响应速度和推理成本都会受到影响。

公开基准数据显示,在 393 条真实 Agentic Coding 任务轨迹中,输入输出比中位数达到 213∶1,极端情况下输入序列长度可达 67.5 万 Token。Agent 工作负载正在呈现长输入、多轮次、强复用的特征。

因此,Agent 时代的推理基础设施不能只关注模型一次 「答得多快」,还要关注一项任务能否连续、稳定、低成本地完成。要实现这一目标,推理基础设施需要从底层硬件适配、计算效率优化到上下文管理进行系统性升级。

在多芯适配方面,sglang-kunlun 插件打通 SGLang 与昆仑芯,降低模型迁移和适配门槛。百度百舸还推动 SGLang 社区建立硬件可插拔插件机制,并从芯片算子、任务下发和通信等层面进行优化。

在上下文缓存方面,SGLang 社区分享了从 RadixAttention 到 Unified Radix Cache 的技术演进。通过统一缓存管理体系,不同类型的 KV Cache 可以实现高效复用。在现场分享的实践数据中,FULL 与 SWA 混合模型在多轮 HiCache 场景下命中率达到 96.8%,平均首字时延为 1.23 秒。

不止模型跑得快 也要让整套服务稳定可控

面对超大模型部署,百度百舸通过权重零冗余分布式部署、显存占用优化和 MoE 专家压缩,释放更多显存空间,为长上下文和高并发任务提供资源支撑。

在相关测试中,MoE 专家压缩 50% 后,长输出和高并发场景下的输出吞吐峰值可达到原来的 2.23 倍。对 Agent 而言,这不仅意味着节省显存,也意味着相同算力资源可以承载更多任务。

当 Agent 进入生产环境,仅仅提高模型速度还不够。百度百舸从流量、负载和集群缓存三个层面进行服务治理,通过动态调度、变长行为感知分桶和 KV Cache 无感热迁移,让请求进入更加合适的推理实例。

同时,百度百舸构建多级缓存体系,并通过全链路命中率漏斗定位缓存损失环节,提升复杂负载下的服务稳定性。

模型能力之外 看见 Agent 的真实问题

本次活动还设置了闪电演讲环节。SGLang 核心贡献者张晓雨围绕推理服务部署和 AI Infra 工程自动化展开分享;元神智算 CEO 蓝衣剑客从标准与生态角度分享 Agent 发展趋势;万涂幻象社区主理人李祥瑞则聚焦上下文与主体连续性,讨论 Agent 如何在真实系统中保持状态、完成交付并应对故障恢复。

三位嘉宾的分享共同指向一个变化:Agent 的价值不只是 「更会回答」,而是能够在连续上下文中理解任务、调用能力并完成交付。百度智能云将继续与 SGLang 等技术社区及更多开发者开展技术共建,助力 Agent 从单点尝试走向规模化落地。

模型能力决定 Agent 能够解决什么问题,推理基础设施则决定这些能力能否被稳定、低成本地交付。百度百舸正在把推理能力从单点性能优化,扩展为覆盖模型适配、上下文复用、资源管理和服务治理的完整体系,帮助 Agent 跑得更快、更省、更稳。

Related articles

今日 24k99 黄金行情 (2026 年 9 月 21 日)

2026 年 9 月 23 日

今日黄金首饰价格多少钱一克 (2026 年 9 月 21 日)

2026 年 9 月 23 日

【TechWeb】9 月 22 日,百度智能云联合 SGLang 社区举办 「Agent 时代的推理基础设施:百度百舸 × SGLang 生产级实践」Meetup,围绕多芯适配、上下文缓存、KV Cache 优化、显存优化、MoE 专家压缩和推理服务治理等议题,探讨 Agent 走向生产环境所需要的推理底座。

从多芯适配到上下文复用 让 Agent 更快地跑起来

当前,Agent 不再只是生成一次回答,而是需要理解目标、拆解任务、调用工具,并在多轮交互中持续推进。上下文能否复用、超大模型能否高效部署、复杂请求能否稳定调度,都将影响 Agent 的任务完成效率和规模化应用成本。

一次真实的 Agent 任务,往往包含多轮推理和工具调用。随着任务推进,输入上下文持续增长,不同轮次之间也存在大量重复内容。如果每轮交互都从头计算,响应速度和推理成本都会受到影响。

公开基准数据显示,在 393 条真实 Agentic Coding 任务轨迹中,输入输出比中位数达到 213∶1,极端情况下输入序列长度可达 67.5 万 Token。Agent 工作负载正在呈现长输入、多轮次、强复用的特征。

因此,Agent 时代的推理基础设施不能只关注模型一次 「答得多快」,还要关注一项任务能否连续、稳定、低成本地完成。要实现这一目标,推理基础设施需要从底层硬件适配、计算效率优化到上下文管理进行系统性升级。

在多芯适配方面,sglang-kunlun 插件打通 SGLang 与昆仑芯,降低模型迁移和适配门槛。百度百舸还推动 SGLang 社区建立硬件可插拔插件机制,并从芯片算子、任务下发和通信等层面进行优化。

在上下文缓存方面,SGLang 社区分享了从 RadixAttention 到 Unified Radix Cache 的技术演进。通过统一缓存管理体系,不同类型的 KV Cache 可以实现高效复用。在现场分享的实践数据中,FULL 与 SWA 混合模型在多轮 HiCache 场景下命中率达到 96.8%,平均首字时延为 1.23 秒。

不止模型跑得快 也要让整套服务稳定可控

面对超大模型部署,百度百舸通过权重零冗余分布式部署、显存占用优化和 MoE 专家压缩,释放更多显存空间,为长上下文和高并发任务提供资源支撑。

在相关测试中,MoE 专家压缩 50% 后,长输出和高并发场景下的输出吞吐峰值可达到原来的 2.23 倍。对 Agent 而言,这不仅意味着节省显存,也意味着相同算力资源可以承载更多任务。

当 Agent 进入生产环境,仅仅提高模型速度还不够。百度百舸从流量、负载和集群缓存三个层面进行服务治理,通过动态调度、变长行为感知分桶和 KV Cache 无感热迁移,让请求进入更加合适的推理实例。

同时,百度百舸构建多级缓存体系,并通过全链路命中率漏斗定位缓存损失环节,提升复杂负载下的服务稳定性。

模型能力之外 看见 Agent 的真实问题

本次活动还设置了闪电演讲环节。SGLang 核心贡献者张晓雨围绕推理服务部署和 AI Infra 工程自动化展开分享;元神智算 CEO 蓝衣剑客从标准与生态角度分享 Agent 发展趋势;万涂幻象社区主理人李祥瑞则聚焦上下文与主体连续性,讨论 Agent 如何在真实系统中保持状态、完成交付并应对故障恢复。

三位嘉宾的分享共同指向一个变化:Agent 的价值不只是 「更会回答」,而是能够在连续上下文中理解任务、调用能力并完成交付。百度智能云将继续与 SGLang 等技术社区及更多开发者开展技术共建,助力 Agent 从单点尝试走向规模化落地。

模型能力决定 Agent 能够解决什么问题,推理基础设施则决定这些能力能否被稳定、低成本地交付。百度百舸正在把推理能力从单点性能优化,扩展为覆盖模型适配、上下文复用、资源管理和服务治理的完整体系,帮助 Agent 跑得更快、更省、更稳。

广告

【TechWeb】9 月 22 日,百度智能云联合 SGLang 社区举办 「Agent 时代的推理基础设施:百度百舸 × SGLang 生产级实践」Meetup,围绕多芯适配、上下文缓存、KV Cache 优化、显存优化、MoE 专家压缩和推理服务治理等议题,探讨 Agent 走向生产环境所需要的推理底座。

从多芯适配到上下文复用 让 Agent 更快地跑起来

当前,Agent 不再只是生成一次回答,而是需要理解目标、拆解任务、调用工具,并在多轮交互中持续推进。上下文能否复用、超大模型能否高效部署、复杂请求能否稳定调度,都将影响 Agent 的任务完成效率和规模化应用成本。

一次真实的 Agent 任务,往往包含多轮推理和工具调用。随着任务推进,输入上下文持续增长,不同轮次之间也存在大量重复内容。如果每轮交互都从头计算,响应速度和推理成本都会受到影响。

公开基准数据显示,在 393 条真实 Agentic Coding 任务轨迹中,输入输出比中位数达到 213∶1,极端情况下输入序列长度可达 67.5 万 Token。Agent 工作负载正在呈现长输入、多轮次、强复用的特征。

因此,Agent 时代的推理基础设施不能只关注模型一次 「答得多快」,还要关注一项任务能否连续、稳定、低成本地完成。要实现这一目标,推理基础设施需要从底层硬件适配、计算效率优化到上下文管理进行系统性升级。

在多芯适配方面,sglang-kunlun 插件打通 SGLang 与昆仑芯,降低模型迁移和适配门槛。百度百舸还推动 SGLang 社区建立硬件可插拔插件机制,并从芯片算子、任务下发和通信等层面进行优化。

在上下文缓存方面,SGLang 社区分享了从 RadixAttention 到 Unified Radix Cache 的技术演进。通过统一缓存管理体系,不同类型的 KV Cache 可以实现高效复用。在现场分享的实践数据中,FULL 与 SWA 混合模型在多轮 HiCache 场景下命中率达到 96.8%,平均首字时延为 1.23 秒。

不止模型跑得快 也要让整套服务稳定可控

面对超大模型部署,百度百舸通过权重零冗余分布式部署、显存占用优化和 MoE 专家压缩,释放更多显存空间,为长上下文和高并发任务提供资源支撑。

在相关测试中,MoE 专家压缩 50% 后,长输出和高并发场景下的输出吞吐峰值可达到原来的 2.23 倍。对 Agent 而言,这不仅意味着节省显存,也意味着相同算力资源可以承载更多任务。

当 Agent 进入生产环境,仅仅提高模型速度还不够。百度百舸从流量、负载和集群缓存三个层面进行服务治理,通过动态调度、变长行为感知分桶和 KV Cache 无感热迁移,让请求进入更加合适的推理实例。

同时,百度百舸构建多级缓存体系,并通过全链路命中率漏斗定位缓存损失环节,提升复杂负载下的服务稳定性。

模型能力之外 看见 Agent 的真实问题

本次活动还设置了闪电演讲环节。SGLang 核心贡献者张晓雨围绕推理服务部署和 AI Infra 工程自动化展开分享;元神智算 CEO 蓝衣剑客从标准与生态角度分享 Agent 发展趋势;万涂幻象社区主理人李祥瑞则聚焦上下文与主体连续性,讨论 Agent 如何在真实系统中保持状态、完成交付并应对故障恢复。

三位嘉宾的分享共同指向一个变化:Agent 的价值不只是 「更会回答」,而是能够在连续上下文中理解任务、调用能力并完成交付。百度智能云将继续与 SGLang 等技术社区及更多开发者开展技术共建,助力 Agent 从单点尝试走向规模化落地。

模型能力决定 Agent 能够解决什么问题,推理基础设施则决定这些能力能否被稳定、低成本地交付。百度百舸正在把推理能力从单点性能优化,扩展为覆盖模型适配、上下文复用、资源管理和服务治理的完整体系,帮助 Agent 跑得更快、更省、更稳。

相关 文章

今日 24k99 黄金行情 (2026 年 9 月 21 日)

来自 周天财经
2026 年 9 月 23 日
0

今日 24k99 黄金行情 (2026 年 9 月 2...

今日黄金首饰价格多少钱一克 (2026 年 9 月 21 日)

来自 周天财经
2026 年 9 月 23 日
0

今日黄金首饰价格多少钱一克 (2026 年 9...

黄仁勋解释每天都穿黑皮衣:能集中精力在重要事项上

黄仁勋解释每天都穿黑皮衣:能集中精力在重要事项上

来自 周天财经
2026 年 9 月 23 日
0

【TechWeb】9 月 23 日消息,据新京...

今日中国黄金基础金价 (2026 年 9 月 21 日)

来自 周天财经
2026 年 9 月 23 日
0

中国黄金实时基础金价 (2026 年 9 月 21...

金至尊今天黄金价格多少一克 (2026 年 9 月 21 日)

来自 周天财经
2026 年 9 月 23 日
0

金至尊今天黄金价格多少一克 金至尊金店铂...

加载更多
广告
  • 热门
  • 评论
  • 最新
「我们也深陷残酷价格战」,德资巨头中国区高管警告

「我们也深陷残酷价格战」,德资巨头中国区高管警告

2025 年 8 月 4 日
一周产业基金|上海市人工智能CVC基金发布;湖北百亿人形机器人母基金来了

一周产业基金|上海市人工智能 CVC 基金发布;湖北百亿人形机器人母基金来了

2025 年 8 月 4 日
「硬科技」指数携手上涨,半导体设备ETF易方达(159558)、芯片ETF易方达(516350)等产品助力布局板块龙头

基民懵了!这个火爆的板块年内涨超 37%,主力却借道 ETF 狂抛逾 400 亿元

2025 年 9 月 20 日
pt999铂金回收价格今日多少钱一克(2025年06月27日)

期货在什么情况下会被强行平仓

2025 年 8 月 4 日
Lesson 1: Basics Of Photography With Natural Lighting

The Single Most Important Thing You Need To Know About Success

4
Lesson 1: Basics Of Photography With Natural Lighting

Lesson 1: Basics Of Photography With Natural Lighting

3
Lesson 1: Basics Of Photography With Natural Lighting

5 Ways Animals Will Help You Get More Business

2
Lesson 1: Basics Of Photography With Natural Lighting

New Cryptocurrency That Will Kill Of Bitcoin

2
智联网时代的iPhone时刻 ——鸿途「智车」从长兴传化公路港正式上路

智联网时代的 iPhone 时刻 ——鸿途 「智车」 从长兴传化公路港正式上路

2026 年 9 月 23 日

中金公司今日复牌,东兴证券、信达证券将终止上市;财通证券与阿里云签署战略合作协议 | 券商基金早参

2026 年 9 月 23 日
周靖人走下主舞台

周靖人走下主舞台

2026 年 9 月 23 日

创业板软件 ETF 华夏 (159256) 持仓股深信服盘中涨超 0.8%

2026 年 9 月 23 日
  • 隐私政策
  • 联系我们
  • 关于周天
  • 登录
  • 注册
投诉建议:+86 13326565461

© 2025 广州小舟天传媒有限公司 by 周天财经 - 粤 ICP 备 2025452169 号-1

没有结果
查看所有结果
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金

© 2025 广州小舟天传媒有限公司 by 周天财经 - 粤 ICP 备 2025452169 号-1

欢迎回来!

在下面登录您的帐户

忘记密码? 注册

创建新帐户!

填写以下表格进行注册

所有项目需要填写。 登录

重置您的密码

请输入您的用户名或电子邮件地址以重置密码。

登录

用户登录

还没有账号?立即注册

用户注册

已有账号?立即登录