【TechWeb】9 月 22 日,百度智能云联合 SGLang 社区举办 「Agent 时代的推理基础设施:百度百舸 × SGLang 生产级实践」Meetup,围绕多芯适配、上下文缓存、KV Cache 优化、显存优化、MoE 专家压缩和推理服务治理等议题,探讨 Agent 走向生产环境所需要的推理底座。

从多芯适配到上下文复用 让 Agent 更快地跑起来
当前,Agent 不再只是生成一次回答,而是需要理解目标、拆解任务、调用工具,并在多轮交互中持续推进。上下文能否复用、超大模型能否高效部署、复杂请求能否稳定调度,都将影响 Agent 的任务完成效率和规模化应用成本。
一次真实的 Agent 任务,往往包含多轮推理和工具调用。随着任务推进,输入上下文持续增长,不同轮次之间也存在大量重复内容。如果每轮交互都从头计算,响应速度和推理成本都会受到影响。
公开基准数据显示,在 393 条真实 Agentic Coding 任务轨迹中,输入输出比中位数达到 213∶1,极端情况下输入序列长度可达 67.5 万 Token。Agent 工作负载正在呈现长输入、多轮次、强复用的特征。
因此,Agent 时代的推理基础设施不能只关注模型一次 「答得多快」,还要关注一项任务能否连续、稳定、低成本地完成。要实现这一目标,推理基础设施需要从底层硬件适配、计算效率优化到上下文管理进行系统性升级。
在多芯适配方面,sglang-kunlun 插件打通 SGLang 与昆仑芯,降低模型迁移和适配门槛。百度百舸还推动 SGLang 社区建立硬件可插拔插件机制,并从芯片算子、任务下发和通信等层面进行优化。
在上下文缓存方面,SGLang 社区分享了从 RadixAttention 到 Unified Radix Cache 的技术演进。通过统一缓存管理体系,不同类型的 KV Cache 可以实现高效复用。在现场分享的实践数据中,FULL 与 SWA 混合模型在多轮 HiCache 场景下命中率达到 96.8%,平均首字时延为 1.23 秒。
不止模型跑得快 也要让整套服务稳定可控
面对超大模型部署,百度百舸通过权重零冗余分布式部署、显存占用优化和 MoE 专家压缩,释放更多显存空间,为长上下文和高并发任务提供资源支撑。
在相关测试中,MoE 专家压缩 50% 后,长输出和高并发场景下的输出吞吐峰值可达到原来的 2.23 倍。对 Agent 而言,这不仅意味着节省显存,也意味着相同算力资源可以承载更多任务。
当 Agent 进入生产环境,仅仅提高模型速度还不够。百度百舸从流量、负载和集群缓存三个层面进行服务治理,通过动态调度、变长行为感知分桶和 KV Cache 无感热迁移,让请求进入更加合适的推理实例。
同时,百度百舸构建多级缓存体系,并通过全链路命中率漏斗定位缓存损失环节,提升复杂负载下的服务稳定性。
模型能力之外 看见 Agent 的真实问题
本次活动还设置了闪电演讲环节。SGLang 核心贡献者张晓雨围绕推理服务部署和 AI Infra 工程自动化展开分享;元神智算 CEO 蓝衣剑客从标准与生态角度分享 Agent 发展趋势;万涂幻象社区主理人李祥瑞则聚焦上下文与主体连续性,讨论 Agent 如何在真实系统中保持状态、完成交付并应对故障恢复。
三位嘉宾的分享共同指向一个变化:Agent 的价值不只是 「更会回答」,而是能够在连续上下文中理解任务、调用能力并完成交付。百度智能云将继续与 SGLang 等技术社区及更多开发者开展技术共建,助力 Agent 从单点尝试走向规模化落地。
模型能力决定 Agent 能够解决什么问题,推理基础设施则决定这些能力能否被稳定、低成本地交付。百度百舸正在把推理能力从单点性能优化,扩展为覆盖模型适配、上下文复用、资源管理和服务治理的完整体系,帮助 Agent 跑得更快、更省、更稳。
【TechWeb】9 月 22 日,百度智能云联合 SGLang 社区举办 「Agent 时代的推理基础设施:百度百舸 × SGLang 生产级实践」Meetup,围绕多芯适配、上下文缓存、KV Cache 优化、显存优化、MoE 专家压缩和推理服务治理等议题,探讨 Agent 走向生产环境所需要的推理底座。

从多芯适配到上下文复用 让 Agent 更快地跑起来
当前,Agent 不再只是生成一次回答,而是需要理解目标、拆解任务、调用工具,并在多轮交互中持续推进。上下文能否复用、超大模型能否高效部署、复杂请求能否稳定调度,都将影响 Agent 的任务完成效率和规模化应用成本。
一次真实的 Agent 任务,往往包含多轮推理和工具调用。随着任务推进,输入上下文持续增长,不同轮次之间也存在大量重复内容。如果每轮交互都从头计算,响应速度和推理成本都会受到影响。
公开基准数据显示,在 393 条真实 Agentic Coding 任务轨迹中,输入输出比中位数达到 213∶1,极端情况下输入序列长度可达 67.5 万 Token。Agent 工作负载正在呈现长输入、多轮次、强复用的特征。
因此,Agent 时代的推理基础设施不能只关注模型一次 「答得多快」,还要关注一项任务能否连续、稳定、低成本地完成。要实现这一目标,推理基础设施需要从底层硬件适配、计算效率优化到上下文管理进行系统性升级。
在多芯适配方面,sglang-kunlun 插件打通 SGLang 与昆仑芯,降低模型迁移和适配门槛。百度百舸还推动 SGLang 社区建立硬件可插拔插件机制,并从芯片算子、任务下发和通信等层面进行优化。
在上下文缓存方面,SGLang 社区分享了从 RadixAttention 到 Unified Radix Cache 的技术演进。通过统一缓存管理体系,不同类型的 KV Cache 可以实现高效复用。在现场分享的实践数据中,FULL 与 SWA 混合模型在多轮 HiCache 场景下命中率达到 96.8%,平均首字时延为 1.23 秒。
不止模型跑得快 也要让整套服务稳定可控
面对超大模型部署,百度百舸通过权重零冗余分布式部署、显存占用优化和 MoE 专家压缩,释放更多显存空间,为长上下文和高并发任务提供资源支撑。
在相关测试中,MoE 专家压缩 50% 后,长输出和高并发场景下的输出吞吐峰值可达到原来的 2.23 倍。对 Agent 而言,这不仅意味着节省显存,也意味着相同算力资源可以承载更多任务。
当 Agent 进入生产环境,仅仅提高模型速度还不够。百度百舸从流量、负载和集群缓存三个层面进行服务治理,通过动态调度、变长行为感知分桶和 KV Cache 无感热迁移,让请求进入更加合适的推理实例。
同时,百度百舸构建多级缓存体系,并通过全链路命中率漏斗定位缓存损失环节,提升复杂负载下的服务稳定性。
模型能力之外 看见 Agent 的真实问题
本次活动还设置了闪电演讲环节。SGLang 核心贡献者张晓雨围绕推理服务部署和 AI Infra 工程自动化展开分享;元神智算 CEO 蓝衣剑客从标准与生态角度分享 Agent 发展趋势;万涂幻象社区主理人李祥瑞则聚焦上下文与主体连续性,讨论 Agent 如何在真实系统中保持状态、完成交付并应对故障恢复。
三位嘉宾的分享共同指向一个变化:Agent 的价值不只是 「更会回答」,而是能够在连续上下文中理解任务、调用能力并完成交付。百度智能云将继续与 SGLang 等技术社区及更多开发者开展技术共建,助力 Agent 从单点尝试走向规模化落地。
模型能力决定 Agent 能够解决什么问题,推理基础设施则决定这些能力能否被稳定、低成本地交付。百度百舸正在把推理能力从单点性能优化,扩展为覆盖模型适配、上下文复用、资源管理和服务治理的完整体系,帮助 Agent 跑得更快、更省、更稳。
【TechWeb】9 月 22 日,百度智能云联合 SGLang 社区举办 「Agent 时代的推理基础设施:百度百舸 × SGLang 生产级实践」Meetup,围绕多芯适配、上下文缓存、KV Cache 优化、显存优化、MoE 专家压缩和推理服务治理等议题,探讨 Agent 走向生产环境所需要的推理底座。

从多芯适配到上下文复用 让 Agent 更快地跑起来
当前,Agent 不再只是生成一次回答,而是需要理解目标、拆解任务、调用工具,并在多轮交互中持续推进。上下文能否复用、超大模型能否高效部署、复杂请求能否稳定调度,都将影响 Agent 的任务完成效率和规模化应用成本。
一次真实的 Agent 任务,往往包含多轮推理和工具调用。随着任务推进,输入上下文持续增长,不同轮次之间也存在大量重复内容。如果每轮交互都从头计算,响应速度和推理成本都会受到影响。
公开基准数据显示,在 393 条真实 Agentic Coding 任务轨迹中,输入输出比中位数达到 213∶1,极端情况下输入序列长度可达 67.5 万 Token。Agent 工作负载正在呈现长输入、多轮次、强复用的特征。
因此,Agent 时代的推理基础设施不能只关注模型一次 「答得多快」,还要关注一项任务能否连续、稳定、低成本地完成。要实现这一目标,推理基础设施需要从底层硬件适配、计算效率优化到上下文管理进行系统性升级。
在多芯适配方面,sglang-kunlun 插件打通 SGLang 与昆仑芯,降低模型迁移和适配门槛。百度百舸还推动 SGLang 社区建立硬件可插拔插件机制,并从芯片算子、任务下发和通信等层面进行优化。
在上下文缓存方面,SGLang 社区分享了从 RadixAttention 到 Unified Radix Cache 的技术演进。通过统一缓存管理体系,不同类型的 KV Cache 可以实现高效复用。在现场分享的实践数据中,FULL 与 SWA 混合模型在多轮 HiCache 场景下命中率达到 96.8%,平均首字时延为 1.23 秒。
不止模型跑得快 也要让整套服务稳定可控
面对超大模型部署,百度百舸通过权重零冗余分布式部署、显存占用优化和 MoE 专家压缩,释放更多显存空间,为长上下文和高并发任务提供资源支撑。
在相关测试中,MoE 专家压缩 50% 后,长输出和高并发场景下的输出吞吐峰值可达到原来的 2.23 倍。对 Agent 而言,这不仅意味着节省显存,也意味着相同算力资源可以承载更多任务。
当 Agent 进入生产环境,仅仅提高模型速度还不够。百度百舸从流量、负载和集群缓存三个层面进行服务治理,通过动态调度、变长行为感知分桶和 KV Cache 无感热迁移,让请求进入更加合适的推理实例。
同时,百度百舸构建多级缓存体系,并通过全链路命中率漏斗定位缓存损失环节,提升复杂负载下的服务稳定性。
模型能力之外 看见 Agent 的真实问题
本次活动还设置了闪电演讲环节。SGLang 核心贡献者张晓雨围绕推理服务部署和 AI Infra 工程自动化展开分享;元神智算 CEO 蓝衣剑客从标准与生态角度分享 Agent 发展趋势;万涂幻象社区主理人李祥瑞则聚焦上下文与主体连续性,讨论 Agent 如何在真实系统中保持状态、完成交付并应对故障恢复。
三位嘉宾的分享共同指向一个变化:Agent 的价值不只是 「更会回答」,而是能够在连续上下文中理解任务、调用能力并完成交付。百度智能云将继续与 SGLang 等技术社区及更多开发者开展技术共建,助力 Agent 从单点尝试走向规模化落地。
模型能力决定 Agent 能够解决什么问题,推理基础设施则决定这些能力能否被稳定、低成本地交付。百度百舸正在把推理能力从单点性能优化,扩展为覆盖模型适配、上下文复用、资源管理和服务治理的完整体系,帮助 Agent 跑得更快、更省、更稳。
【TechWeb】9 月 22 日,百度智能云联合 SGLang 社区举办 「Agent 时代的推理基础设施:百度百舸 × SGLang 生产级实践」Meetup,围绕多芯适配、上下文缓存、KV Cache 优化、显存优化、MoE 专家压缩和推理服务治理等议题,探讨 Agent 走向生产环境所需要的推理底座。

从多芯适配到上下文复用 让 Agent 更快地跑起来
当前,Agent 不再只是生成一次回答,而是需要理解目标、拆解任务、调用工具,并在多轮交互中持续推进。上下文能否复用、超大模型能否高效部署、复杂请求能否稳定调度,都将影响 Agent 的任务完成效率和规模化应用成本。
一次真实的 Agent 任务,往往包含多轮推理和工具调用。随着任务推进,输入上下文持续增长,不同轮次之间也存在大量重复内容。如果每轮交互都从头计算,响应速度和推理成本都会受到影响。
公开基准数据显示,在 393 条真实 Agentic Coding 任务轨迹中,输入输出比中位数达到 213∶1,极端情况下输入序列长度可达 67.5 万 Token。Agent 工作负载正在呈现长输入、多轮次、强复用的特征。
因此,Agent 时代的推理基础设施不能只关注模型一次 「答得多快」,还要关注一项任务能否连续、稳定、低成本地完成。要实现这一目标,推理基础设施需要从底层硬件适配、计算效率优化到上下文管理进行系统性升级。
在多芯适配方面,sglang-kunlun 插件打通 SGLang 与昆仑芯,降低模型迁移和适配门槛。百度百舸还推动 SGLang 社区建立硬件可插拔插件机制,并从芯片算子、任务下发和通信等层面进行优化。
在上下文缓存方面,SGLang 社区分享了从 RadixAttention 到 Unified Radix Cache 的技术演进。通过统一缓存管理体系,不同类型的 KV Cache 可以实现高效复用。在现场分享的实践数据中,FULL 与 SWA 混合模型在多轮 HiCache 场景下命中率达到 96.8%,平均首字时延为 1.23 秒。
不止模型跑得快 也要让整套服务稳定可控
面对超大模型部署,百度百舸通过权重零冗余分布式部署、显存占用优化和 MoE 专家压缩,释放更多显存空间,为长上下文和高并发任务提供资源支撑。
在相关测试中,MoE 专家压缩 50% 后,长输出和高并发场景下的输出吞吐峰值可达到原来的 2.23 倍。对 Agent 而言,这不仅意味着节省显存,也意味着相同算力资源可以承载更多任务。
当 Agent 进入生产环境,仅仅提高模型速度还不够。百度百舸从流量、负载和集群缓存三个层面进行服务治理,通过动态调度、变长行为感知分桶和 KV Cache 无感热迁移,让请求进入更加合适的推理实例。
同时,百度百舸构建多级缓存体系,并通过全链路命中率漏斗定位缓存损失环节,提升复杂负载下的服务稳定性。
模型能力之外 看见 Agent 的真实问题
本次活动还设置了闪电演讲环节。SGLang 核心贡献者张晓雨围绕推理服务部署和 AI Infra 工程自动化展开分享;元神智算 CEO 蓝衣剑客从标准与生态角度分享 Agent 发展趋势;万涂幻象社区主理人李祥瑞则聚焦上下文与主体连续性,讨论 Agent 如何在真实系统中保持状态、完成交付并应对故障恢复。
三位嘉宾的分享共同指向一个变化:Agent 的价值不只是 「更会回答」,而是能够在连续上下文中理解任务、调用能力并完成交付。百度智能云将继续与 SGLang 等技术社区及更多开发者开展技术共建,助力 Agent 从单点尝试走向规模化落地。
模型能力决定 Agent 能够解决什么问题,推理基础设施则决定这些能力能否被稳定、低成本地交付。百度百舸正在把推理能力从单点性能优化,扩展为覆盖模型适配、上下文复用、资源管理和服务治理的完整体系,帮助 Agent 跑得更快、更省、更稳。










