Skip to content

AI 应用评估与可观测性

Trace 回答“系统做了什么”,Evaluation 回答“做得是否正确”。两者都不能只依赖生产用户反馈:发布前需要固定数据集和回归门槛,发布后需要采样、隐私控制和异常定位。

LangSmith

LangSmith 提供 Trace、Dataset、Experiment 和在线评估,与 LangChain/LangGraph 集成紧密。为每个请求保留版本、延迟、Token、工具和错误,但不要默认记录原始敏感内容;在进入平台前脱敏或关闭对应采集。

Langfuse

Langfuse 是开源 LLM 工程平台,覆盖 Trace、Prompt、指标和评估,可使用托管版或自部署。自部署意味着数据库、升级、备份和访问控制由团队负责;Prompt 版本要关联实际运行 Trace,避免线上代码与平台模板分叉。

Phoenix

Phoenix 面向 AI 应用的 OpenTelemetry 追踪、实验和评估,适合观察 RAG、工具调用与模型行为。使用标准语义字段有利于跨框架比较;嵌入和文档内容也可能敏感,应控制采样和存储。

promptfoo

promptfoo 用配置定义 Provider、Prompt、测试用例和断言,适合在本地或 CI 中做模型/Prompt 比较与红队测试。把关键行为写成可重复断言,不只比较平均分;对非确定模型设置合理容差和多次采样。

Ragas 与 DeepEval

Ragas 偏向 RAG/Agent 数据集生成与指标,DeepEval 提供类似测试框架的 LLM 评估。LLM-as-a-judge 需要固定 Judge 模型与 Rubric,并用人工标注样本校准;同一 Judge 的分数不能被当作绝对真值。

建立评估闭环

  1. 从真实失败和预期任务建立版本化 Dataset。
  2. 分开评估检索、工具选择、参数、最终答案和安全边界。
  3. 保存 Trace,定位失败发生在哪一层。
  4. 对关键样本使用确定性断言,对开放任务使用校准后的 Judge。
  5. 新版本与固定 Baseline 比较,设置回归门槛。
  6. 人工复核指标变化较大、Judge 不一致和高风险样本。

训练实验跟踪与应用可观测性可以共享版本信息,但服务对象不同:W&B/SwanLab 主要关注训练 run;本页工具主要关注线上或离线 Agent 调用链。

参考:LangSmithLangfusePhoenixpromptfooRagasDeepEval