标签:可观测性
共 8 篇文章。
-
Agent 任务回放与确定性调试
Agent 生产事故很难复现,本文讲如何用捕获的执行轨迹搭建回放调试环境,处理 LLM 采样、工具调用、时间等非确定性因素。
-
LLM 成本异常检测
从请求级成本事件、动态基线、分层检测到告警归因,系统讲解 LLM 成本异常检测的落地方法,帮助团队发现重试风暴、上下文膨胀和租户突发用量。
-
Prompt Cache 命中率监控:从盲目省钱到有数据支撑
讲解如何采集、计算并监控 Prompt Cache 命中率,涵盖指标定义、日志埋点、告警阈值设计,让缓存优化效果可度量。
-
LLM 对话轨迹存储与查询设计实践
从数据模型、索引策略到检索场景,讲解如何设计 LLM 对话轨迹(trace)的存储方案,兼顾调试、审计与成本分析的查询需求。
-
AI Agent 可观测性设计
讲清 AI Agent 可观测性的核心架构设计:该观测什么、Trace 数据模型怎么建、告警怎么定,以及自建与用现成工具的取舍。
-
AI 流水线的错误追踪方案:从日志到根因定位
系统讲解 AI 多步流水线的错误追踪设计,涵盖结构化日志、Span 追踪、错误分类与告警,附 Python 实战代码示例。
-
Claude message_id 追踪与日志关联实战指南
深入解析 Claude API 的 message_id 字段:如何在生产环境中实现请求追踪、日志关联、错误回溯与多轮会话调试。
-
LLM 可观测性实战:Langfuse 自部署完整指南
用 Langfuse 在国内自部署 LLM 应用可观测性平台:tracing、用量、成本、调试、用户反馈一站搞定,含 Docker 部署与接入示例。