跳到主要内容
知仓学习社ZHICANG

phoenix-evals

Build and run evaluators for AI/LLM applications using Phoenix.

执行命令无严重或高危命中github/awesome-copilot

它会碰到什么

扫了多少35 个文本文件,90 KB
它会碰到什么执行命令
命中总数1 处
命中统计严重 0 · 高 0 · 中 1 · 低 0

这一栏是扫描器报的事实,不是结论。命中多不等于有毒(安全工具、规则库、示例脚本本来就会包含危险写法),命中少也不等于干净。它和你手上的凭据、文件、网络有什么关系,需要你自己看。

技能内容

Phoenix Evals

Build evaluators for AI/LLM applications. Code first, LLM for nuance, validate against humans.

Quick Reference

| Task | Files |

| ---- | ----- |

| Setup | [setup-python](references/setup-python.md), [setup-typescript](references/setup-typescript.md) |

| Decide what to evaluate | [evaluators-overview](references/evaluators-overview.md) |

| Choose a judge model | [fundamentals-model-selection](references/fundamentals-model-selection.md) |

| Use pre-built evaluators | [evaluators-pre-built](references/evaluators-pre-built.md) |

| Build code evaluator | [evaluators-code-python](references/evaluators-code-python.md), [evaluators-code-typescript](references/evaluators-code-typescript.md) |

| Build LLM evaluator | [evaluators-llm-python](references/evaluators-llm-python.md), [evaluators-llm-typescript](references/evaluators-llm-typescript.md), [evaluators-custom-templates](references/evaluators-custom-templates.md) |

| Batch evaluate DataFrame | [evaluate-dataframe-python](references/evaluate-dataframe-python.md) |

| Understand experiments | [experiments-overview](references/experiments-overview.md) |

| Run experiment | [experiments-running-python](references/experiments-running-python.md), [experiments-running-typescript](references/experiments-running-typescript.md) |

| Create dataset | [experiments-datasets-python](references/experiments-datasets-python.md), [experiments-datasets-typescript](references/experiments-datasets-typescript.md) |

| Generate synthetic data | [experiments-synthetic-python](references/experiments-synthetic-python.md), [experiments-synthetic-typescript](references/experiments-synthetic-typescript.md) |

| Validate evaluator accuracy | [validation](references/validation.md), [validation-evaluators-python](references/validation-evaluators-python.md), [validation-evaluators-typescript](references/validation-evaluators-typescript.md) |

| Sample traces for review | [observe-sampling-python](references/observe-sampling-python.md), [observe-sampling-typescript](references/observe-sampling-typescript.md) |

| Analyze errors | [error-analysis](references/error-analysis.md), [error-analysis-multi-turn](references/error-analysis-multi-turn.md), [axial-coding](references/axial-coding.md) |

| RAG evals | [evaluators-rag](references/evaluators-rag.md) |

| Avoid common mistakes | [common-mistakes-python](references/common-mistakes-python.md), [fundamentals-anti-patterns](references/fundamentals-anti-patterns.md) |

| Production | [production-overview](references/production-overview.md), [production-guardrails](references/production-guardrails.md), [production-continuous](references/production-continuous.md) |

Workflows

Starting Fresh:

[observe-tracing-setup](references/observe-tracing-setup.md) → [error-analysis](references/error-analysis.md) → [axial-coding](references/axial-coding.md) → [evaluators-overview](references/evaluators-overview.md)

Building Evaluator:

[fundamentals](references/fundamentals.md) → [common-mistakes-python](references/common-mistakes-python.md) → evaluators-{code|llm}-{python|typescript} → validation-evaluators-{python|typescript}

RAG Systems:

[evaluators-rag](references/evaluators-rag.md) → evaluators-code- (retrieval) → evaluators-llm- (faithfulness)

Production:

[production-overview](references/production-overview.md) → [production-guardrails](references/production-guardrails.md) → [production-continuous](references/production-continuous.md)

Reference Categories

| Prefix | Description |

| ------ | ----------- |

| fundamentals-* | Types, scores, anti-patterns |

| observe-* | Tracing, sampling |

| error-analysis-* | Finding failures |

| axial-coding-* | Categorizing failures |

| evaluators-* | Code, LLM, RAG evaluators |

| experiments-* | Datasets, running experiments |

| validation-* | Validating evaluator accuracy against human labels |

| production-* | CI/CD, monitoring |

Key Principles

| Principle | Action |

| --------- | ------ |

| Error analysis first | Can't automate what you haven't observed |

| Custom > generic | Build from your failures |

| Code first | Deterministic before LLM |

| Validate judges | >80% TPR/TNR |

| Binary > Likert | Pass/fail, not 1-5 |

想直接用这个技能?

本站把开放许可(MIT / Apache 等)的技能按仓库打包整理到网盘,点一下转存到你自己的网盘,不用一个个从 GitHub 拉。许可未声明的技能只给原始仓库链接,不打包。