从「构建 AI」到「驾驭 AI」,100+ 实战案例拆解 AI Native 时代的工程新实践!
推理模型持续突破能力边界,Coding Agent 深度参与研发流程,Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型,演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力,而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化:团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt,而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么,系统决定 AI 能否真正创造价值。
在这一背景下,2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办,聚焦 Harness AI 时代的工程实践,围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向,邀请全球技术社区与产业一线的实践者,系统性分享前沿洞察与实战经验,共同探索 AI 从能力到系统、从实验到生产的真实路径。
蚂蚁集团架构师刘杨已确认出席 “AI Agent 可观测与持续改进工程” 专题,并发表题为《从 Trace 到规模化实时评估:面向生产流量的 Agent 可观测实践》的主题分享。随着 Agent 进入真实业务场景,传统日志、指标和链路追踪已经难以完整回答 Agent 是否正确完成任务、问题发生在哪个环节,以及如何持续衡量和改善 Agent 质量。本次分享将介绍建设企业级 Agent 可观测与评估体系的实践。在采集层遵循 OpenTelemetry GenAI 语义约定,统一模型调用、工具调用和 Agent 执行过程的埋点与采集。在评估层以 Trace 为核心,配置化接入诊断任务,通过实时处理管线完成任务筛选、关键信息提取和自动评估,到达分钟级延迟。通过声明式表达式支持不同业务 Agent 低成本接入。先小模型粗筛,再大模型精筛的两阶段评估机制,可有效降低 90% token 成本,使大规模安全、合规等底线类指标评估覆盖全生产流量成为可能。针对部分复杂性能与质量类问题,还将介绍从 Agent 执行链路深入至推理引擎内部推理过程的探索。
刘杨,蚂蚁集团架构师,当前任职蚂蚁可观测技术架构师,参与或负责了产品/告警/计算/元数据等在内的可观测全技术栈建设,对于大型大规模分布式计算系统有丰富的性能优化经验。最近两三年主要重心在大模型领域,包括推理引擎、Agent 可观测等。他在本次会议的详细演讲内容如下:
演讲提纲:
Agent 可观测面临的新问题
为什么拥有日志、指标和完整 Trace,仍然难以判断 Agent 是否正确完成任务并定位质量问题。
2. 遵循 GenAI 语义约定的统一埋点与采集
如何统一模型调用、工具调用和 Agent 执行过程的遥测语义,并在标准字段基础上支持业务场景扩展。
3. 以 Trace 为中心的实时评估链路
从 Span 聚合、评估任务筛选和关键信息提取,到评估执行与结果沉淀。其中包括通过声明式表达式适配不同业务 Agent 和 Trace 结构,降低新 Agent 和新评估场景的接入成本。
4. 面向全量生产流量的两阶段评估实践
首先使用轻量小模型进行全量、低成本、高召回筛查;再对候选 Trace 按需加载完整执行上下文,由大模型完成精准语义裁决,在保障评估覆盖范围的同时控制实时运行成本。
5. 从 Agent 执行到模型推理的深度分析
如何关联 Agent Trace 与模型推理过程,在 Token 粒度进一步定位性能问题。并探索模型内部不确定性信号在轨迹分析中的应用。
6. 真实业务落地案例与实践经验
结合具体业务 Agent,介绍从标准化埋点、评估任务配置和生产运行,到问题发现、原因定位与质量改进的完整过程,并分享落地中的工程取舍与实践经验。
实践痛点
面向全量生产流量的两阶段评估实践可以有效解决 token 成本问题,但是强依赖有效的小模型。而小模型需要针对业务场景训练,才能做有效的过滤,成本不低。
从 Agent Trace 到推理引擎的跨层深度可观测,要求对推理引擎埋点,存在一定开发接入成本。
前沿亮点:
面向异构 Agent 的声明式 Trace 实时评估
将 Trace 从事后查询的数据转变为持续运行的评估对象。评估任务可以通过配置动态定义 Trace 筛选、关键维度提取和评估输入。对于已经完成标准化埋点的 Agent,新增评估场景时无需修改 Agent 埋点或重复建设数据处理链路;接入新的 Agent 时,也可以通过表达式适配其业务 Trace 结构。
2. 面向全量生产流量的两阶段评估
针对安全、合规等底线类场景,首先使用轻量模型进行全量、低成本、高召回筛查;再对候选 Trace 按需加载完整执行上下文,由大模型完成精准语义裁决,在保障评估覆盖范围的同时控制实时运行成本。
3. 从 Agent Trace 到推理引擎的跨层可观测
将 Agent 业务请求、LLM 节点和模型推理过程关联起来,在 Token 粒度分析生成时序和推理性能,并结合 Token 概率分布、熵等不确定性信号,探索质量预测与后置分析。
听众收益
了解如何基于统一的 GenAI 遥测语义构建 Agent 可观测基础,以及如何从标准化 Trace 进一步走向实时质量评估、大规模生产运行和深度问题定位,获得一套可用于 Agent 可观测体系化建设思路。
除此之外,本次大会还策划了Loop Engineering、千行百业 Agent 创新实践、Agent 自主进化:从记忆到持续学习、Agent as a Service、Vibe Coding 时代的新质量债、理性驾驭 AI 的 SRE 可靠性工程、金融 AI Native工程实践:从研发提效到业务破局、AI Infra:算力效率决定规模化落地、AI Native 架构等 20 个专题论坛,届时将有来自不同行业、不同领域、不同企业的 100+资深专家在现场带来前沿技术洞察和一线实践经验。
查看更多详情可扫码或联系票务经理 18514549229 进行咨询。