Langfuse
约 604 字大约 2 分钟
2026-09-01
简介
Langfuse 是一个开源的 LLM 工程平台,核心是「LLM 可观测性(Observability)」。它帮你追踪、调试、评估、监控生产环境里的 LLM 应用。
它之于 LLM 应用,就好比「Datadog / Grafana 之于后端服务」,只是观测对象从「API 请求」变成了「模型调用、token、prompt、成本」。
与 LangGraph 的分工很清晰:LangGraph 负责「怎么跑」,Langfuse 负责「跑得怎么样、花了多少钱、哪里出了问题」。
为什么需要它
普通后端你已经能看日志、看监控,但 LLM 应用有它特有的盲区:
| 痛点 | 具体表现 |
|---|---|
| 不可见 | 一个回答背后可能是一次模型调用 + 5 次工具调用 + 1 次向量检索,难以定位出错环节 |
| 成本失控 | 每个请求消耗多少 token、多少钱?哪个 prompt 最烧钱? |
| 质量难量化 | 「回答好不好」没有客观指标,只能靠感觉 |
| Prompt 混乱 | 改了 prompt 不知道是变好还是变坏,也无法回退 |
| 难复现 | 用户反馈「上个月的回答很烂」,你却找不到当时的输入输出 |
核心能力
| 能力 | 说明 | 详细文档 |
|---|---|---|
| Tracing(调用追踪) | 把一次请求解析成嵌套的 trace 树,记录每一步的输入输出、token、成本、延迟 | 调用追踪 |
| Evals(评估) | LLM-as-judge + 数据集 + 自定义评分,量化回答质量,做回归测试 | 评估 |
| Prompt 管理 | prompt 版本化、集中管理、支持 A/B 测试与回退 | Prompt 管理 |
| Analytics | token 用量、成本、错误率、延迟等聚合看板 | 见 tracing |
| User Feedback | 收集 👍👎 反馈并关联到具体 trace | 见 tracing |
| 自托管 | Docker Compose 一键部署,数据完全自控 | 自托管部署 |
部署形态
Langfuse 有两种使用方式:
- Langfuse Cloud:官方云托管,有免费额度,开箱即用
- 自托管(Self-host):Docker Compose 部署在自己服务器,数据完全可控,是它区别于 LangSmith 等商业工具的核心卖点
目录导航
| 文档 | 说明 |
|---|---|
| 调用追踪 | Trace/Observation 概念、埋点方式、SDK 与框架集成 |
| 评估 | 数据集、LLM-as-judge、自定义评分器与回归测试 |
| Prompt 管理 | prompt 版本化、编译填充、A/B 测试 |
| 自托管部署 | 架构组件、Docker Compose、关键环境变量 |
