RocketMQ 亮相 ApacheCon 2026:六场议题讲透 AI、高可用、生产实战

作者|Apache RocketMQ
2026年8月3日

Community Over Code 是 Apache 软件基金会(ASF)官方全球系列大会,前身为 ApacheCon。今年,Community Over Code Asia 2026 将于 8 月 7-9 日 在北京市海淀区中关村国家自主创新示范区会议中心举行。

Apache RocketMQ 将携手开源社区贡献者和用户,在 ApacheCon 2026 带来 6 场硬核议题,覆盖 AI 原生异步通信、秒级故障恢复、路由控制面,以及来自美团、腾讯、小米的大规模生产实践。

现场还设有 Apache RocketMQ 展位,欢迎前来互动打卡,获取精美周边。

大会报名地址:https://www.bagevent.com/event/9200424

image.png


消息(Messaging)专题

伴随着云原生 Serverless、物联网、实时数据技术的规模化落地,事件驱动架构与事件流技术得到更广泛的应用,消息队列成为越来越重要的基础设施。在消息专题中,你将了解不同消息系统如何基于自身架构特点选择最优的技术演进方向——存算分离、Serverless、消息流一体,也能看到各大厂商如何结合行业特点与业务场景选择合适的消息技术。

作为 Apache 生态中企业级云原生消息引擎的代表,RocketMQ 正在从“云原生消息引擎”向“AI 原生异步通信底座”跃迁。本次大会 RocketMQ 将带你了解多 Agent 可靠协作、秒级故障恢复、轻量级路由控制面,以及多个头部企业的大规模生产实践。

议题 1:面向 AI 的 Apache RocketMQ:多 Agent 系统的可靠协作机制

分享时间: 8 月 7 日 14:00-14:30

分享嘉宾: Zhou Li|阿里云消息传递专家,负责阿里巴巴核心消息中间件。

议题介绍:

第一部分:智能体协作中的工程挑战

1.1 通信复杂度:并发推理下的链路碎片化、资源争用和调度盲点。

1.2 工程风险:瞬态突发事件导致的通信链路中断、资源争用和调度失败,以及协作上下文丢失后故障恢复的难度。

第二部分:精简主题:海量会话的高效路由和调度

2.1 动态会话管理:构建基于 TTL 的二级动态拓扑,实现智能体间会话空间的逻辑隔离。

2.2 ReadySet 调度机制:通过分布式代理优化海量智能体事件的传递效率,解决超高并发下的“雷群效应”和延迟抖动问题。

第三部分:RocketMQ-A2A 异步交互模型:解耦与确定性控制

3.1 异步范式重构:构建一个全链路异步模型,用于“任务编排、触发执行和结果返回”,并将协作逻辑融入 RocketMQ 基础架构。

3.2 确定性通信编排:定义代理间通信的标准化协议,以确保复杂业务流程的确定性执行。

第四部分:协作一致性与可观测性:构建事件驱动的证据链

4.1 语义增强与状态恢复:利用幂等设计和事件日志,实现代理协作流程的原子中断重放和无损状态迁移。

4.2 全链路协作审计:基于结构化消息创建“协作证据链”,将分散的代理行为转换为可追溯、可归因的系统治理数据。

第五部分:大规模集群性能与实际闭环

5.1 高压协同下的稳定性与故障恢复

5.2 AI 网关如何利用消息传递基础架构实现大规模多智能体系统的故障自愈和协同任务编排

议题 2:重新思考云端 Apache RocketMQ 的高可用:面向秒级故障恢复的 Protocol-Fenced 接管

分享时间: 8 月 7 日 15:45-16:15

分享嘉宾: Rongtong Jin|金融通(Rongtong Jin)是阿里云技术专家及 Apache RocketMQ PMC 成员。他致力于云消息系统的架构设计与生产运维,重点关注高可用性、存储可靠性及大规模有状态服务。他在 Apache RocketMQ 的云原生演进、生产环境落地及稳定性工程方面拥有丰富的实践经验。

议题介绍: 在云环境中,有状态消息系统的高可用性往往受限于成本、稳态性能与故障转移速度之间难以平衡的矛盾。基于副本的方案虽能缩短恢复时间,但通常会引入额外的写放大、资源开销及运维复杂性。相比之下,单副本部署虽能保持良好的性能与成本效益,但在 Kubernetes 环境中,其故障转移路径往往受制于缓慢且不可预测的存储卷卸载/挂载(detach/attach)流程。

本次演讲将分享我们如何重新构思云上 Apache RocketMQ 的高可用方案,并构建一套经生产环境验证的架构:该架构无需在稳态下增加额外数据副本,即可实现秒级故障转移。其核心思路是保持 RocketMQ 正常存储路径不变,同时围绕“多挂载(Multi-Attach)”块存储与 NVMe 持久预留(Persistent Reservation)机制,重新设计接管路径。这种基于协议隔离的接管模式允许新节点安全地抢占磁盘所有权,防止脑裂(split-brain),并快速恢复服务,无需等待传统的存储迁移过程。我将详细介绍该架构、故障检测与接管流程、安全性与一致性考量,以及在 Apache RocketMQ 中的具体实现细节。此外,演讲还将探讨去中心化租约探测、节点侧接管编排与崩溃一致性恢复如何协同工作,从而缩短并稳定故障转移的关键路径。最后,我将分享来自阿里云的生产实践经验:该架构已应用于 Apache RocketMQ 服务,并通过了大规模容灾演练的验证。支撑本次演讲的技术成果已被 FSE 2026 工业赛道(Industry Track) 录用,而本次演讲将重点阐述生产级架构设计、工程权衡以及 Apache RocketMQ 实践中的经验教训。听众将深入了解如何在云原生环境下设计高可用的有状态消息系统,并学习如何在实际生产系统中平衡恢复目标、成本与性能。

议题 3:Apache RocketMQ 路由控制面演进

分享时间: 8 月 7 日 16:15-16:45

分享嘉宾: Xiao Yang|同程旅行基础架构工程团队,主要负责消息中间件的架构演进与维护工作。我热衷于开源事业,是Apache ShardingSphere 的 Committer,也是 Apache RocketMQ 的Committer。

议题介绍: 本议题将介绍我们如何为 Apache RocketMQ 演进出一套轻量级的外部路由控制平面,从而在不改动 Broker、NameServer 或客户端访问模式的前提下,实现对大规模集群的治理。

随着多个业务线逐渐共用同一个集群,真正的挑战从吞吐量转向了治理层面:即更快的故障收敛、可控的 Topic 迁移以及灵活的基于“泳道(Lane)”的流量隔离。本次演讲将阐述为何在路由层解决这些问题更优,为何现有的 NameServer 和 Broker 机制无法满足需求,以及如何将 Broker 写入隔离、Topic 迁移和泳道流量隔离统一到一个控制平面中,从而支持大规模集群拆分,并实现更小的故障影响范围与更可控的治理。

议题 4:RocketMQ 5 在美团的生产实践

分享时间: 8 月 9 日 14:00-14:30

分享嘉宾: Jiangge Zhang|美团的一名架构师,隶属于消息传递基础设施团队。他曾从事SOA中间件开发,职业生涯一直专注于大规模分布式系统。

议题介绍: 美团运营着中国最大的内部消息平台之一,该平台最初基于早期 Kafka 分支构建,内部代号为 Mafka。Mafka 曾为我们提供了良好的服务,但随着时间的推移,它遇到了两个硬性限制。首先,消费者扩展性受限于分区数量:增加超过分区数量的消费者实例并不能提升吞吐量。其次,客户端变得非常臃肿——承载着复杂的路由逻辑和网络协议,使得跨语言支持成为维护的噩梦。Apache RocketMQ 5 解决了这两个问题。Pop 消费模型按消息而非按分区管理消息生命周期,允许多个消费者同时共享队列,从而实现了横向弹性。基于 gRPC 的 Proxy 架构支持轻量级、与语言无关的客户端。但 RocketMQ 5 的开箱即用功能无法满足美团大规模部署的需求:统一的全局元数据层以及跨多个部署环境和业务部门的企业级流量隔离。

本次演讲将深入探讨美团在生产环境中采用 RocketMQ 5 背后的决策和权衡。我们将涵盖三个方面:首先,我们将介绍如何设计三层拓扑结构——租户、放置组和集群——其中放置组作为租户内部的传播半径边界;其次,我们将介绍如何完全在 RocketMQ 之外实现多种流量隔离和路由模式,从而使消息代理保持纯粹的消息传递原语状态,并且隔离策略可以独立演进;第三,我们将介绍如何构建一个权威的元数据服务,以确保所有组件保持同步。我们将以实际生产迁移的经验为基础进行演讲。大规模运行验证了我们核心架构选择的正确性,同时也暴露出一些我们仍在努力解决的难题——从 RocketMQ 5 复制模型中的数据平面限制到共享提交日志设计中固有的容量隔离挑战。我们希望这些生产经验能够对更广泛的 RocketMQ 社区有所帮助。

议题 5:Apache RocketMQ 低延迟优化的探索与实践

分享时间: 8 月 9 日 14:30-15:00

分享嘉宾: 魏熙凯|腾讯云高级开发工程师,拥有多年计算、存储及分布式系统性能优化经验。

议题介绍: 在某些使用场景中,存在严格的低延迟要求,核心需求是将 P99 或最大延迟稳定控制在固定阈值内。本次演讲将分享我们团队在优化和实现 Apache RocketMQ 低延迟模式方面所做的探索和努力。我们将从 RocketMQ 架构的核心延迟瓶颈入手,梳理影响端到端延迟的关键环节,包括网络传输、消息调度和资源分配,并详细阐述我们开展的针对性优化、架构调整以及实现效果验证。此外,本次演讲还将分享 RocketMQ 全链路延迟调优的方法和实践经验,希望能为社区开发者和用户提供一些帮助。

议题 6:小米 RocketMQ 在大规模集群中的生产实践

分享时间: 8 月 9 日 15:15-15:45

分享嘉宾: Kunming Han|主要负责小米内部消息队列相关工作。

议题介绍: 本次分享将重点介绍小米在大规模集群场景下应用 RocketMQ 和 MQTT 的实践经验,着重探讨小米在消息中间件领域面临的核心挑战及相应的解决方案。内容涵盖 RocketMQ 有序消息优化、容灾与限流机制、多维度性能调优,以及 MQTT 在千万级连接场景下的稳定性保障与架构优化实践。本次分享旨在为业界构建大规模消息系统提供参考与启示。


点击阅读原文,直达大会报名地址