zx-dennis
26-07-02 12:02

为什么是现在:可观测性统一的八年之约

这是回顾可观测性三支柱历史后的文章,想尝试回答为什么现在统一可观测性存储变成一个必须项,而不是优化项。

统一可观测性不是新想法。Bourgon 2018 年那段 über-system 推演就把它讲透了。聪明人想到了,懂行的人批判了,SigNoz、ClickStack 这些创业公司也真把三类信号塞进了同一个列存。可这想法从提出到今天将近八年,才算真正到了能落地的时候。

八年到底在等什么?我的答案是:得等价值和条件同时翻过来。

先说价值。monitoring 时代,统一就是个 nice to have,省下的无非是"少运维一个组件"。到了微服务和云原生,可观测性数据的成本高到让 CFO 睡不着觉,Coinbase 2021 年的 Datadog 账单据说到了 6500 万美元的量级。但即便这么贵,统一还是个优化项:你可以自建、可以采样、可以换便宜的,痛,但有得选。

Agent 让这件事的性质彻底变了。人查数据是线性的,看一眼 dashboard、翻个日志、跳去看 trace,慢慢在脑子里把三块拼图对上。Agent 不这么干,它并行、探索式地一口气甩出几十个查询,错了就丢、对了就深挖。三套各自为政、字段名都对不齐的系统,根本喂不动这种查法:查得越多噪声越多,还容易把汇总模型的 context 撑爆。对人类只是不便,对 Agent 基本决定了它能不能真正跑起来。统一到这一步,从优化项变成了绕不过去的硬需求。

再说条件。过去缺的几块零件这几年陆续到位了:对象存储便宜到长期留存算得过账;Arrow / DataFusion / Parquet 让"造一个统一引擎"不用从零开始;Rust 进了数据基础设施主流;OTel 把采集标准化,迁移阻力降了一个数量级。最后一块也最反直觉:LLM 让"教数据库懂可观测性"这件事直接没必要了,数据库连"懂"语义都不必,只要"对齐"就够。

云原生、OTel、LLM 这三波其实是一场接力,前者造出需求,后者补上缺口,每一棒都让前一棒想做却做不到的事变得能做。这就是"为什么是现在"。

欢迎阅读: http://t.cn/AXobsvwn

发布于 浙江