AI 可观测性:从"谁在用我的 API"到"谁在管我的 Agent"——LLM 监控赛道的整合时刻
一、执行摘要
2026 年上半年,AI 可观测性(AI Observability)赛道经历了一场静默但深刻的结构性重塑。这不是一个"又有人融了钱"的故事——而是赛道定义本身在发生变化。
三件事在同一季度发生,勾勒出终局的轮廓:
ClickHouse 收购 Langfuse(2026 年 1 月):数据库公司以 $4 亿 D 轮估值 $150 亿的姿态,将最流行的开源 LLM 可观测平台收入囊中。Langfuse 本来就跑在 ClickHouse 上——这是一个基础设施层向上吃应用层的经典案例。
Fiddler AI 完成 $3000 万 C 轮(2026 年 1 月):累计融资 $1 亿,将自己从"模型监控"重新定位为"AI 控制平面"(AI Control Plane)。这个措辞变化不是营销话术——它代表赛道从被动观测到主动治理的范式转换。4 月 Fiddler 又收购了 Lumeus,将治理边界从生产运行时反向延伸到 IDE/CLI 编码层。
安全巨头集体入场:Cisco 收了 Galileo(LLM 评估与护栏)、Palo Alto Networks 收了 Portkey(AI 网关)和 Protect AI(模型安全),Check Point 则选择自研 AI 安全四大支柱。AI 可观测性正在从"开发工具"蜕变为"安全基础设施"。
与此同时,OpenObserve 以 2 万+ GitHub Star 和 $1000 万 A 轮证明了开源路线的生命力;OpenTelemetry GenAI 语义约定成为行业"USB-C 接口";阿里云将"LLM 应用监控"升级为"AI Agent 可观测"。
全球 LLM 可观测平台市场 2026 年规模约 $26.9 亿,以 36.2% CAGR 向 2030 年的 $92.6 亿冲刺。Gartner 预测到 2028 年,LLM 可观测将覆盖 50% 的 GenAI 部署(2026 年初仅 ~15%)。
我判断:AI 可观测性正经历它的"Datadog 时刻"——不是因为市场规模,而是因为三个原本独立的轨道(APM 监控、LLM 评估、AI 安全)正在一条一条地合并。这不是零散的创业公司故事,而是一个新的基础设施层的形成。
二、从"模型监控"到"AI 控制平面"——赛道定义的重构
2.1 为什么 LLM 可观测性不是 MLOps 2.0
传统 MLOps 监控关心的是确定性系统的工程指标:模型延迟、吞吐量、CPU/GPU 利用率、数据漂移、预测分布。这些指标的前提是——模型的输出是可预测的、可重现的、可测量的。
LLM 推翻了这个前提。当你监控一个 GPT-5.6 或 Claude Opus 5 驱动的 Agent 时,你面对的是:
- 非确定性输出:同一个 prompt 两次调用可能返回语义不同但都"正确"的答案。传统的"期望值 vs 实际值"对比完全失效。
- 多步推理链:一个 Agent 的一次"回答"可能涉及 5-20 次内部 LLM 调用、3 次工具调用、2 次检索——每一步都可能出错,且错误呈指数级放大(MSR 2026 对 11,771 个 PR 的分析显示 AI Agent 引入了 79.15% 的 CI 失败)。
- 成本不可预测:Agent 工作负载每任务消耗的 Token 是聊天工具的 30-60 倍。一个看似简单的用户请求可能在后台触发 $0.50 的 API 调用——而你的 CFO 不知道。
- 安全边界模糊:Agent 不只是"生成文本"——它调用 API、操作数据库、发送邮件。一个被 prompt injection 攻击的 Agent 不只是"说错话",而是"做错事"。
这就是为什么 Fiddler 的措辞变化——从"模型监控"到"AI 控制平面"——代表了整个赛道的认知升级。监控告诉你发生了什么;控制平面决定什么被允许发生。
2.2 赛道分层:五个正在融合的细分市场
2024 年这五个赛道是分开的——做追踪的不做评估,做 prompt 管理的不做安全,做网关的不做护栏。到了 2026 年年中,这三条线正在坍缩为三个互相重叠的平台层。
最直接的数据佐证:Fiddler 先拿了 $3000 万做"控制平面",然后立刻收购 Lumeus 补上了编码层的安全能力。Langfuse 被 ClickHouse 收购后,从"LLM 追踪工具"变成了"分析数据库的原生 AI 层"。Cisco 收了 Splunk(SIEM)+ Robust Intelligence(AI 安全)+ Galileo(LLM 评估),三者拼成了一张完整的"AI 信任"拼图。
三、整合浪潮——谁在买、为什么买、花多少钱
3.1 2026 年 AI 可观测性 M&A 全景
| 时间 | 买方 | 标的 | 交易类型 | 战略逻辑 |
|---|---|---|---|---|
| 2026.1 | ClickHouse | Langfuse | 收购(随 $4 亿 D 轮同步) | 数据库公司向上吃应用——Langfuse 本来就跑在 ClickHouse 上 |
| 2026.1 | Fiddler AI | — | $3000 万 C 轮(累计 $1 亿) | 从模型监控升级为 AI 控制平面 |
| 2026.4 | Fiddler AI | Lumeus | 收购 | 将治理边界从运行时延伸到 IDE 编码层 |
| 2026.5 | Cisco | Galileo | 收购 | AI 评估+护栏,补充 Splunk SIEM 的 AI 安全拼图 |
| 2026.5 | Palo Alto Networks | Portkey | 收购 | AI 网关集成进 Prisma AIRS(AI 运行时安全) |
| 2025.7 | Palo Alto Networks | Protect AI | ~$6.5-7 亿收购 | 模型扫描+红队+运行时安全 → Prisma AIRS |
| 2026.3 | Mintlify | Helicone | 收购 | Helicone 进入维护模式,新功能开发停止 |
| 2026.4 | OpenObserve | — | $1000 万 A 轮(Nexus + Dell) | 开源统一可观测(日志+指标+追踪+LLM) |
| 2026.5 | Palo Alto Networks | CyberArk | ~$250 亿收购 | 身份安全+机器身份,虽不直接是 AI 可观测但补齐了 Agent 身份治理 |
3.2 三条整合逻辑,一条终局分歧
逻辑一:基础设施层向上吃(ClickHouse + Langfuse)
ClickHouse 的玩法最值得拆解。这不是一次普通的收购——Langfuse 早在 v3 就内部跑在 ClickHouse 上,所以技术整合几乎零摩擦。但真正的战略含义更深:如果你是一个数据库公司,而 LLM 可观测本质上是一个"大量非结构化追踪数据的存储+查询"问题,那你应该拥有这个应用层。
ClickHouse 的"Agentic Data Stack"愿景是:所有 AI Agent 产生的追踪数据、评估数据、成本数据,天然就应该存在 ClickHouse 里。Langfuse 只是这个愿景的第一个 UI 层。接下来可能是 prompt 管理、评估平台、甚至 AI 安全——全部建立在 ClickHouse 的列式存储引擎上。
逻辑二:用安全预算买可观测(Cisco + Galileo, Palo Alto + Portkey)
这是最精巧的商业逻辑。企业采购 AI 可观测工具的预算通常来自哪里?——DevOps 或 MLOps 团队,预算池有限。但 AI 安全工具的预算来自哪里?——CISO 办公室,预算池是 DevOps 的 3-5 倍。
Cisco 和 Palo Alto 的收购本质上是在做"预算套利":把 LLM 可观测产品装进安全 SKU,用 CISO 的预算来卖。Cisco 的拼图尤其清晰——Splunk(SIEM 可观测)+ Robust Intelligence(AI 安全)+ Galileo(LLM 评估)= 一张"AI 信任"菜单,CISO 可以一次性采购。
逻辑三:独立平台向上做厚(Fiddler + Lumeus)
Fiddler 代表第三条路——不卖身,自己做厚。$3000 万 C 轮之后立刻收购 Lumeus,把"AI 控制平面"从运行时监控延伸到开发时治理。Lumeus 做的是 Agent 姿态管理和策略执行——在代码生成层(IDE/CLI)就拦截不安全的 Agent 行为。
Fiddler 的赌注是:企业需要的不是另一个监控面板,而是一个"AI 操作系统"——统一管理所有 AI Agent 的身份、权限、行为、审计。这条路如果走通,Fiddler 就是 AI 时代的 CrowdStrike。
3.3 终局分歧:三种世界观
这三种世界观互不兼容,且各有道理:
ClickHouse 的逻辑:"LLM 可观测本质上是数据问题——高速写入、列式存储、SQL 查询。数据库引擎天然应该吃掉这一层。"如果这个逻辑成立,Datadog、Splunk、Elastic 都会跟进收购同类标的。
Fiddler 的逻辑:"LLM 可观测不是数据问题,是治理问题——你需要的是策略引擎、权限模型、合规审计,不是一个分析数据库。"如果这个逻辑成立,Fiddler 应该被 ServiceNow 或 Salesforce 收购,而不是被 ClickHouse。
OpenObserve 的逻辑:"可观测应该是免费的、开源的、统一的——不需要为 LLM 专门买一个工具。"如果这个逻辑成立,付费可观测市场会坍缩为少数几个极端复杂场景的高端服务。
我预判,这三种世界观会在 12-18 个月内分出胜负——不是靠技术优劣,而是靠谁先拿下 50 家 Fortune 500 的"AI 治理年度合同"。一旦大企业的采购决策形成惯性,后发者很难翻盘。
四、技术架构的战场——追踪、评估、护栏的三位一体
4.1 OpenTelemetry:AI 可观测的"USB-C 接口"
2026 年 AI 可观测领域最重要的技术趋势不是某个创业公司的产品,而是一个协议——OpenTelemetry GenAI 语义约定。它做了一件简单但关键的事:定义了一套标准化的gen_ai.*属性命名空间,让所有 LLM 调用——不管用的是 OpenAI、Anthropic、Gemini 还是 Qwen——都以相同的格式产出追踪数据。
| 属性 | 含义 | 重要性 |
|---|---|---|
gen_ai.system | 模型提供商(openai/anthropic/gemini) | 跨平台追踪的基础 |
gen_ai.request.model | 请求的模型名称 | 模型迁移时的对比基准 |
gen_ai.usage.input_tokens | 输入 Token 数 | 成本归因 |
gen_ai.usage.output_tokens | 输出 Token 数 | 成本归因 |
gen_ai.cost.total | 单次调用成本 | 2026 年最受关注的指标 |
gen_ai.server.time_to_first_token | 首 Token 延迟 | 用户体验核心指标 |
gen_ai.response.finish_reasons | 生成停止原因 | 安全监控(是否被拦截) |
为什么这件事重要?因为它把可观测的"仪表层"和"后端层"解耦了。以前你选了 Langfuse 做追踪,基本就被绑在它的 SDK 和 UI 上了。现在你可以用 OpenTelemetry 采集数据,后端随便换——今天是 ClickHouse,明天是 Datadog,后天是自建。这是整个赛道商品化的技术前提。
4.2 Agent 追踪 vs LLM 追踪:复杂度跳升
单次 LLM 调用的追踪是"一维的":请求→模型→响应。但一个多步 Agent 的追踪是"三维的":
agent.run(根 Span) ├── reasoning span(规划/决策步骤) │ ├── tool_call span(工具调用 + 结果) │ └── tool_call span(另一个工具) ├── gen_ai.chat(LLM 调用) │ ├── retrieval span(向量检索) │ └── embedding span(查询向量化) └── gen_ai.chat(最终回答生成)这种三层父子 Span 架构是 2026 年的行业共识。关键在于,每一步的延迟和成本都可以独立归因——当 p95 延迟从 2 秒跳到 8 秒,你不需要猜是 retrieval 慢了还是 generation 慢了。
但这只是技术前提——真正的战场在评估层。
4.3 评估层:LLM 可观测的"最后一公里"
传统 APM 工具(Datadog、New Relic、Dynatrace)监控的是"管道"——延迟、错误率、吞吐量。但 LLM 的核心风险不在管道,在"内容"——模型是否产生幻觉、是否有偏见、是否泄露了 PII、是否被 prompt injection 攻击。
2026 年的共识方案是LLM-as-Judge 评估器:用一个独立的 LLM 在后台对生产流量中的 10-20% 进行质量评分(幻觉检测、毒性检测、任务完成度等),将评分作为 Span 属性写回追踪数据。
关键工程挑战是延迟——评估不能阻塞用户请求。业界的最佳实践是"tail-based sampling":保留 100% 的错误和低质量追踪,对正常追踪仅采样 1-10%。评估器异步运行在采样数据上,不增加用户体验延迟。
但这里有一个元问题:谁评估评估器?如果 LLM-as-Judge 本身也漂移了怎么办?业界目前的答案是定期用人工标注校准——这又回到了那个古老的真理:AI 可观测的最终锚点仍然是人类判断。
五、监管驱动——可观测从"nice-to-have"到"must-have"
5.1 EU AI Act:2026 年 8 月的倒计时
EU AI Act 的高风险 AI 系统(Annex III)主要义务原本定在 2026 年 8 月 2 日全面生效,后被 Digital Omnibus 推迟到 2027 年 12 月。但这个推迟是"施工时间,不是暂停"——Article 12 要求的自动事件日志是其中最硬核的技术要求:
- 系统运行全生命周期的日志记录
- 日志必须能够追溯和检查每一个决策
- 记录保存至少 7 年(从系统退役起算)
这意味着如果你 2027 年 12 月上线一个高风险 AI 系统,你需要在 2034 年 12 月之后仍然能够拿出它的每一笔决策日志。这不是"装个 Langfuse 就行"的事——这是需要从数据架构层面规划的合规工程。
5.2 安全厂商为什么在这个时点入场
Cisco、Palo Alto、Check Point 三家安全巨头在 2026 年密集布局 AI 可观测,不是因为他们看到了一个性感的开发者工具市场——而是因为他们看到了一个即将爆发的合规市场。
EU AI Act 的日志要求与 SOC 2、ISO 27001、PCI-DSS 的审计要求是同构的。CISO 们突然意识到:AI 系统的决策日志和传统 IT 系统的审计日志,本质上应该存在同一个 SIEM 里。
这就是"安全预算买可观测"的逻辑基础。LLM 可观测工具可以作为一个"开发工具"卖给 MLOps 团队,定价 $199/月;也可以作为一个"AI 信任基础设施"卖给 CISO,定价 $50,000/年。Cisco 和 Palo Alto 显然选择了后者。
5.3 中国市场:NFRA 8 号文的"可追溯"要求
中国国家金融监管总局 2025 年 6 月的"金发 8 号文"虽然没有明确提"AI 可观测"这个词,但其核心要求——“谁使用谁负责”、人工智能应用全生命周期管理、高风险应用须经风险管理委员会审批——在实质上等同于强制 AI 可观测。
阿里云的响应速度最快:2026 年 6-7 月,将"LLM 应用监控"全面升级为"AI Agent 可观测",整合了全局拓扑、链路追踪、会话分析、场景化大盘和智能告警五大能力。更重要的是,阿里云通过 eBPF 无侵入监控(OBI)+ OpenTelemetry 实现了零代码接入——这对于受严格监管的中国金融机构来说是关键卖点。
但在独立创业公司层面,中国 AI 可观测赛道几乎空白。搜索"大模型可观测"、“LLM 监控”、"AI Agent 治理"等关键词,除了阿里云的产品文档和少数技术博客,几乎没有独立创业公司的声音。这与美国市场 Langfuse/Fiddler/OpenObserve/Arize/Braintrust 五强争霸的格局形成鲜明对比。
六、主流产品对比——从开发者到 CISO,谁在为谁买单
6.1 开源阵营:Langfuse vs Arize Phoenix vs OpenObserve
| 维度 | Langfuse | Arize Phoenix | OpenObserve |
|---|---|---|---|
| 许可证 | MIT(OSI 开源) | Elastic License 2.0(源码可用) | AGPL-3.0 |
| GitHub 星 | 31,500+ | 12,000+ | 20,000+ |
| 自托管 | Docker Compose 免费 | 单进程免费,无事件上限 | 单二进制文件免费 |
| 核心优势 | 最成熟的 Trace 浏览器 UI,Prompt 管理,社区生态 | OpenTelemetry 原生,14+ 框架自动插桩 | 统一后端(日志+指标+追踪+LLM),140x Elasticsearch 存储成本 |
| 核心短板 | 被 ClickHouse 收购后独立性存疑;评估未附着在 Span 上 | 无 Prompt 管理;无网关/护栏;非 OSI 许可证 | 无 Prompt 管理;无 Playground;AGPL 许可证法律风险 |
| 最佳场景 | 需要完整 LLM 可观测+自托管+开源的中大型团队 | 已采用 OpenTelemetry,需要轻量自托管追踪的团队 | 想要"一个后端管所有"、厌恶工具蔓延的 SRE 团队 |
| 起步价格 | Hobby 免费 (5 万 events/月),Core $29/月 | 自托管免费,AX Pro $50/月 | 自托管免费 |
6.2 商业平台阵营:Braintrust vs LangSmith vs Fiddler
| 维度 | Braintrust | LangSmith | Fiddler |
|---|---|---|---|
| 定位 | 评估优先的 AI 开发平台 | LangChain 原生追踪平台 | 企业 AI 控制平面 |
| 核心优势 | 最佳实验 UI + 数据集对比,LLM-as-Judge 原生支持 | LangChain/LangGraph 零胶水追踪 | Trust Models 治理框架,合规优先 |
| 核心短板 | 闭源 SaaS,Agent 轨迹评估弱于 LangSmith | 封闭平台,脱离 LangChain 价值下降,per-seat 定价惩罚大团队 | 封闭平台,仅企业定制定价,无开发者社区 |
| 最佳场景 | 以离线评估和实验为中心的团队 | 全栈 LangChain/LangGraph 团队 | 受监管行业(金融/医疗/保险)的 AI 治理 |
| 起步价格 | Starter 免费 (1GB), Pro $249/月 | Developer 免费 (5K traces), Plus $39/座/月 | 定制报价(推测 $5-20 万/年起) |
6.3 APM 三巨头的 AI 可观测布局
Datadog、New Relic、Dynatrace 三家的 AI 可观测能力目前属于"有,但不深"——它们能捕获 LLM 调用的延迟、错误率、Token 用量和成本,但评估深度、Prompt 版本管理和数据集管理明显弱于专用工具。
Datadog 在三家中 LLM 评估做得最深(内置幻觉检测、毒性检测、PII 扫描),New Relic 的免费层最慷慨(100GB/月),Dynatrace 的 Davis AI 根因分析最强。
但三家的共同盲点是模型正确性。一个模型可以漂移、幻觉、返回自信满满的错误答案,而你的 Datadog 面板全绿——因为延迟 40ms,HTTP 200 OK。这就是为什么业界共识是 APM + 专用 LLM 可观测工具并行部署。
七、中国市场——"沉睡的巨人"与独特路径
7.1 中国 AI 可观测的三层梯队
与美国市场 Langfuse/Fiddler/OpenObserve/Arize/Braintrust 五强争霸的格局不同,中国 AI 可观测市场形成了"标准制定者 + 上市公司 + 新锐创业"的三层梯队:
| 梯队 | 代表企业 | 核心定位 |
|---|---|---|
| 标准引领者 | 基调听云(Tingyun) | 中国信通院 Lv5 智能引领级认证;参编《面向 LLM 应用的可观测性能力要求》标准;在超大型银行核心交易系统、省级政务大数据中心落地 |
| 上市公司 | 博睿数据(Bonree, 688229) | Bonree ONE 一体化可观测平台,2026 年 2 月披露 LLM 可观测模块;适配 LiteLLM/SGL-Router |
| 新锐创业 | 点富科技(北京,2024 年成立) | 大模型全链路监控专利(2025 年 12 月申请);注册资本 1.11 亿元;自动拦截 + SDK 主动埋点 |
| 国产替代 | Litefuse(SelectDB 团队) | 兼容 Langfuse SDK;基于 Apache Doris;成本低 88%;已上线 SaaS(10 万条/月免费) |
最值得关注的是 Litefuse。它由 SelectDB 技术团队推出,兼容 Langfuse SDK 的同时将架构从 6 组件简化至 3 组件,基于 Apache Doris 列式存储将存储成本降低 65-88%,并原生支持 Hermes、OpenClaw、Claude Code 等 Agent。这是中国 AI 可观测赛道第一个真正意义上的"国产替代"产品。
7.2 阿里云的"AI Agent 可观测"升级
2026 年 6-7 月,阿里云将"LLM 应用监控"全面升级为"AI Agent 可观测",整合了五大核心能力:全局拓扑与健康度、链路追踪(支持轨迹图、链路树)、会话分析(多轮对话、长周期)、场景化大盘(Token 用量、模型性能、工具调用)、智能告警。
更具战略意义的是接入方式——阿里云通过eBPF 无侵入监控(OBI)实现零代码接入,自动识别 LLM、Embedding、RAG、MCP、Tool 等调用类型,支持 OpenAI、Claude、Gemini、Qwen 等主流模型。同时推出AgentLoop平台,构建"观测→分析→优化→再验证"的经验自进化闭环——从真实 Trace 中自动挖掘经验并注入 Agent 运行时上下文,在不重新训练模型的情况下提升准确率。
腾讯云的策略则是"自进化 Agent"——CLS 全域可观测的 5-Agent 架构,50,000 台 Agent 实例并发监控,故障定位从 30 分钟降至秒级,密钥沙箱防止 Agent 越权。
7.3 中国特色的"合规驱动"路径
中国 NFRA 金发 8 号文(2026 年 6 月 18 日)虽然未直接使用"可观测性"一词,但其实质上构建了完整的监控-追溯-审计闭环:
- “谁使用谁负责”:金融机构作为 AI 使用方,责任不随业务外包转移
- 个人信息红线:姓名、身份证号、手机号、银行卡号等个人信息不得用于生成式 AI 模型训练——这是一条比 GDPR 更严格的硬性红线
- 全链路留痕:完整保留原始数据、推理路径及阈值触发记录;日志保存不低于业务存续期
- 人类最终决策权:信贷审批、资金交易等高风险场景,AI 仅作为辅助工具
中国信通院在标准建设上的速度全球领先——《面向 LLM 应用的可观测性能力要求》(29 家头部单位参编,2025 年 7 月发布)和AgentOps《智能体运维能力要求》(40+ 专家参与,2025 年 12 月定稿)两个标准,在时间上均领先于国际同类标准。
我判断,中国市场将从 2027 年开始爆发——不是因为技术创新,而是因为 NFRA 8 号文的合规 deadline 和中国 AI 法的立法进程将创造强制性需求。中国金融行业大模型中标项目从 2024 年的 133 个(2.4 亿元)暴增至 2025 年的 587 个(15.06 亿元),这些项目都需要可观测基础设施支撑。
7.4 中美差异:两条完全不同的赛道
| 维度 | 美国/全球 | 中国 |
|---|---|---|
| 市场驱动 | VC 驱动 + 产品竞争 | 政策合规先行 + 标准引领 |
| 主要买家 | 科技公司 + SaaS 企业 | 金融机构 + 央企 + 政务 |
| 工具偏好 | Langfuse/LangSmith/Arize | Langfuse 自托管 + Dify 集成;Litefuse 国产替代;云厂商原生方案 |
| 商业模式 | SaaS 订阅 + 开源核心 | 私有化部署 + 项目制 + 信创适配 |
| 数据主权 | 关注但非首要 | 最高优先级,直接决定工具选型 |
关键差异:在美国,AI 可观测是"开发者想用"的品类;在中国,它是"监管要求必须做"的品类。后者虽然起步慢,但一旦监管 deadline 落地,预算释放的速度和规模会远超前者。
八、核心结论与终局推演
8.1 AI 可观测的五个确定性趋势
从被动观测到主动治理:Fiddler 的"AI 控制平面"叙事代表了整个赛道的方向——可观测的终点不是更漂亮的仪表盘,而是确定性的策略执行。2027 年底之前,"可观测+护栏+网关"三者将合并为同一个产品品类。
OpenTelemetry 成为事实标准:就像 Kubernetes 统一了容器编排,OpenTelemetry GenAI 语义约定正在统一 LLM 追踪的数据格式。这对创业公司是双刃剑——标准化降低了用户迁移成本,但也降低了产品粘性。
安全预算吃掉可观测预算:Cisco/Palo Alto/Check Point 的入场不是来做慈善的。当 AI 可观测从"开发者工具"重新定义为"安全基础设施",市场 TAM 从 ~$27 亿跃升至安全市场的 ~$2000 亿。LLM 可观测创业公司要么被安全巨头收购,要么证明自己值得独立存在。
Agent 追踪是下一块必争之地:单次 LLM 调用的可观测已经基本标准化(OpenTelemetry + gen_ai 语义约定)。但多步 Agent 的追踪——包括工具调用链、推理轨迹、人机交互节点——仍处于早期。谁先做好 Agent 的原生可观测,谁就抓住了下一波增长。
中国市场是"沉睡的巨人":阿里云已经入场,但独立创业公司几乎空白。中国 NFRA 的合规要求和 AI 法立法进程将创造强制性需求——不是"要不要"的问题,是"什么时候"的问题。我预判2027 年上半年会出现第一个中国本土 AI 可观测创业公司的融资案。
8.2 三种终局的可能概率
终局 A:基础设施层吃掉应用层(概率 ~35%)
ClickHouse + Datadog + Splunk 三家数据分析/APM 巨头,通过收购或自研,将 LLM 可观测变成其平台的一个功能模块。Fiddler 等独立平台被 ServiceNow/Salesforce 收购。开源工具(Langfuse/Phoenix)维持社区但商业化乏力。
终局 B:独立控制平面成为新品类(概率 ~30%)
Fiddler 的愿景兑现——"AI 控制平面"成为类似 SIEM 的独立品类。企业不愿意让 ClickHouse 或 Datadog 同时知道他们的数据、AI 模型和 Agent 行为——数据主权和安全隔离的需求推动独立平台生存。2028 年出现第一家 AI 可观测独角兽 IPO。
终局 C:商品化——可观测变成 AI 网关的免费功能(概率 ~35%)
OpenTelemetry 标准化 + 开源工具成熟 + Cloudflare/AWS/Azure 将可观测内建为 AI 网关的免费功能 → 独立 LLM 可观测市场萎缩为少数高合规场景的高端服务。就像 Kubernetes 的监控——大部分够用,少数极端场景才需要 Datadog。
我赌终局 C 在 2-3 年内最可能,但终局 B 在 5-7 年内有翻盘机会。短期看,标准化和开源的力量太强——OpenTelemetry 让"采集层"商品化,ClickHouse 让"存储层"商品化,开源项目让"UI 层"商品化。但长期看,AI Agent 的治理复杂度(身份、权限、审计、策略)会超出通用工具的能力边界——届时会出现一个"AI 时代的 Okta + Splunk"。
8.3 对创业者和投资者的启示
- 如果你在做 LLM 可观测创业:不要做"更好的 Langfuse"。去做 Langfuse 做不到的事——Agent 身份治理、跨组织追踪(A2A)、AI 策略引擎。差异化不在仪表盘,在"谁有权限让 Agent 做什么"。
- 如果你是企业 AI 负责人:2026 年下半年是采购 AI 可观测工具的最佳窗口期——M&A 刚完成,产品路线图清晰,价格还没被安全预算推高。锁定一个支持 OpenTelemetry 的工具,给自己留好退路。
- 如果你在中国做 AI 创业:AI 可观测是一个几乎空白的赛道。银行、保险、政府机构对 AI 审计追溯有刚性需求,且不会用美国工具。谁先拿出合规就绪的国产 AI 可观测方案,谁就锁定了一个至少 20 亿人民币的蓝海市场。
AI 辅助深度研究,人工视角解读。每日更新。