选模型是 AI 落地第一步,但 ChatGPT、Claude、DeepSeek、Gemini……到底哪个更适合你的场景?靠主观感受打分太主观,靠用户反馈周期太长,最靠谱的办法是用同一套题库让模型同台竞技,量化输出质量。这就是 AI 模型评测(AI Evals)的价值所在。本篇文章横向对比 5 款免费评测工具,给出每一款的必杀命令,帮你用三分钟跑完一场模型 PK。
一、先弄清评测什么:三维评估框架
很多团队做评测只是让模型跑几道题,然后说「这个好」。这不是评测,这是抽查。科学的模型评测需要覆盖三个维度:
| 维度 | 衡量什么 | 典型指标 | 适用场景 |
|---|---|---|---|
| 功能正确性 | 答案对不对 | 准确率、召回率、F1 | 问答、搜索、代码生成 |
| 输出质量 | 答案好不好 | BLEU、BERTScore、LLM-as-Judge | 写作、摘要、翻译 |
| 性能与成本 | 跑得快不快、贵不贵 | 延迟、吞吐量、Token 成本 | 生产环境选型 |
三维度全做是理想状态,三选其二也能跑。关键是提前定好「哪个维度权重最高」,否则结果出来后团队各执一词。
二、五款免费工具横向对比
| 工具 | 核心定位 | 免费边界 | 上手难度 | 最适场景 |
|---|---|---|---|---|
| Braintrust | AI 评测平台 | 开源可自托管,开箱即用 | 低 | 生产级评测、团队协作 |
| promptfoo | Prompt 与模型评测 | 完全开源免费 | 中 | Prompt 调优、模型对比 |
| RAGAS | RAG 系统评测 | 开源免费 | 中 | RAG 场景专项评测 |
| EleutherAI lm-evaluation-harness | 学术基准评测 | 完全开源 | 高 | 标准学术任务(BBH、MMLU) |
| OpenAI Evals | 官方评测框架 | 开源免费 | 中 | OpenAI 模型专项 |
1. Braintrust:最适合团队协作的生产级评测
Braintrust 是目前最完整的 AI 评测平台,核心功能是把评测数据、Prompt 模板、模型配置、结果分析全部串成一条流水线。它的评测结果带可视化报表,支持多人协作标注,CI 集成也不在话下。
# 安装
npx @braintrust/openapi
# 或 Python SDK
pip install braintrust-openapi
评测的核心概念是「Eval」——一个 Eval 包含测试用例集(dataset)和评估函数(assertions)。Braintrust 内置了常用评估器,也支持自定义 LLM-as-Judge,让模型自己评判输出质量。
import { Eval } from "@braintrust/openapi";
const eval = new Eval({
name: "code-review-eval",
model: "gpt-4o",
dataset: [
{ input: "Review this Python code", expected: "Should catch SQL injection" },
],
tasks: [
async ({ input }) => {
// 调用你的 AI 系统
return await callYourAI(input);
}
],
scorers: ["llm_grade"]
});
await eval.run();
Braintrust 的强项是结果可追溯:每次运行会生成 session ID,任何时候都能回看某次 Prompt 修改前后的评分变化。这对需要频繁迭代 Prompt 的团队来说是刚需。对比那些跑完就出图、无法复现的工具,Braintrust 的数据持久化能力是核心差异。
如果你已经有了 AI 本地大模型部署 的环境(如 Ollama),Braintrust 可以直接对接本地模型做离线评测,无需额外付费调用云端 API。
2. promptfoo:Prompt 调优 + 模型对比的一把好手
promptfoo 的设计理念是「用配置替代代码」。你不需要写 Python 脚本,只用一个 YAML 文件就能定义评测任务、模型列表、变量组合,然后一键跑完所有组合。
# 安装
npm install promptfoo
# 初始化配置
npx promptfoo init
配置文件的核心结构是三件套:prompts(Prompt 模板)、providers(模型接入)、tests(测试用例)。
# promptfoo.yaml
prompts:
- "Answer the question: {{query}}",
providers:
- id: openai:gpt-4o
label: GPT-4o
- id: openai:gpt-4o-mini
label: GPT-4o-mini
- id: anthropic:claude-3-5-sonnet
label: Claude 3.5 Sonnet
tests:
- vars:
query: "Explain quantum entanglement to a 10-year-old"
- vars:
query: "Write a Python decorator that caches function results"
- vars:
query: "Compare React and Vue for a large enterprise project"
defaultTest:
assert:
- type: contains
value: "quantum"
- type: llm-rubric
value: "Is the answer age-appropriate and accurate?"
# 一行命令跑完所有组合
npx promptfoo eval
# 查看 Web 界面
npx promptfoo view
跑完后 promptfoo 会生成一个本地 Web 界面,表格里直观展示每个模型对每个用例的输出质量评分。关键亮点是:你可以给测试用例打权重,比如「代码类问题权重 60%,通用问答权重 40%」,然后看加权总分。
另一个高阶玩法是 --retry 模式——对于评分低于阈值的用例,自动换个 Prompt 模板重跑,帮助你找到最优 Prompt。这配合 DeepSeek 提示词工程技巧 使用效果翻倍。
3. RAGAS:RAG 场景的专项评测武器
RAG(检索增强生成)是当前最流行的 LLM 应用架构,但 RAG 系统质量评估比普通 Prompt 评测复杂得多——你需要同时评估检索质量(Retriever)和生成质量(Generator)。RAGAS 正是为此而生。
pip install ragas
RAGAS 的核心指标有三个:Context Precision(检索到的文档相关性)、Answer Correctness(答案准确性)、Answer Relevancy(答案与问题的相关度)。这三个指标组合起来,能定位 RAG 系统的问题到底出在检索侧还是生成侧。
from ragas import evaluate
from ragas.metrics import (
faithfulness,
answer_relevancy,
context_precision,
)
from datasets import Dataset
# 构造测试集
test_data = {
"user_input": ["What is RAG?", "How does indexing work?"],
"retrieved_contexts": [[context1, context2], [context3, context4]],
"response": ["RAG is...", "Indexing works by..."],
"ground_truth": ["RAG means...", "Indexing means..."]
}
dataset = Dataset.from_dict(test_data)
# 跑评测
result = evaluate(dataset, metrics=[faithfulness, answer_relevancy])
print(result)
如果你正在做 AI 知识库搭建,RAGAS 是标配工具。它能帮你量化知识库检索效果,找到「检索到了但没回答好」或「回答了但检索内容不相关」的具体卡点。
4. EleutherAI lm-evaluation-harness:学术基准评测的标准跑道
lm-evaluation-harness 是学术圈最权威的开源评测框架,支持 400+ 评测基准(HellaSwag、MMLU、GSM8K、BBH 等),是评判大模型「通用智能水平」的行业标准工具。
# 安装
pip install lm-eval
这个工具适合做「模型选型前的摸底」:当你在 Ollama 或 vLLM 上部署了多个模型,想知道哪个综合能力最强,直接用 本地大模型部署 环境跑一遍 MMLU,看分数对比就行。无需联网调用 API,评测完全离线完成。
上手门槛稍高,适合有一定技术基础的团队。但一旦跑通,能得到比商业平台更透明、更可复现的评测结果。
5. OpenAI Evals:OpenAI 模型的官方评测工具
OpenAI Evals 是 OpenAI 官方开源的评测框架,设计理念强调「评测即代码」——用 JSONL 定义测试数据,用 Python 定义评估器,CI 可集成,结果可版本化。
# 安装
git clone https://github.com/openai/evals
cd evals
pip install -e .
# 运行已有评测集
oaieval gpt-3.5-turbo quiz-closed-book
# 自定义评测
openai evals run --model gpt-4o --template my_custom_eval.yaml
OpenAI Evals 的优势是深度对接 OpenAI API,支持 token 使用量追踪和成本分析。如果你的场景以 OpenAI 模型为主,这个工具可以顺便帮你做成本优化——找到「同等效果下哪个模型最省钱」的答案。
三、三分钟跑完一场模型对比实战
以 promptfoo 为例,演示从零到出报告的完整流程。目标是回答「DeepSeek v3 和 GPT-4o-mini 在中文代码审查场景哪个更强」。
第一步:准备测试用例。创建 test_cases.jsonl:
{"query": "Review this Python code for SQL injection", "lang": "python"}
{"query": "Find memory leaks in this Node.js code", "lang": "javascript"}
{"query": "Optimize this React component rendering performance", "lang": "react"}
{"query": "Check this Go code for goroutine leaks", "lang": "go"}
{"query": "Security audit this Java Spring controller", "lang": "java"}
第二步:配置模型。
# promptfoo.yaml
providers:
- id: openai:deepseek-chat-v3
label: DeepSeek-V3
- id: openai:gpt-4o-mini
label: GPT-4o-mini
prompts:
- "Review this {{lang}} code and report issues: {{query}}",
tests: @test_cases.jsonl
defaultTest:
assert:
- type: llm-rubric
value: "Does the review identify at least one real issue with severity marked?"
- type: latency
threshold: 10000 # 10秒内响应
第三步:运行并查看报告。
npx promptfoo eval --no-cache
npx promptfoo view
浏览器打开 http://localhost:3000,你会看到一张表格,每行是一个测试用例,每列是两个模型的评分和延迟对比。如果某个模型在特定语言上分数显著偏低,你就知道该场景该选哪个了。
四、评测避坑:从五个真实失败案例中学教训
坑一:测试用例全是「简单题」
很多团队用 10 道入门题评测模型,然后宣布「GPT-4o 碾压全场」。问题是:入门题大家都会,拉不开差距,结论毫无参考价值。
解法:测试用例需要覆盖简单、中等、困难三个难度层级。困难题才是真正区分模型的标尺——如果你跑 MMLU 基准,困难题正确率能从 35% 拉到 85%,模型之间的差距才真正显现。
坑二:评分标准「LLM-as-Judge 自己评自己」
用被测模型来做评判者(LLM-as-Judge)会导致「王婆卖瓜」现象:模型倾向于给自己的输出打高分。
解法:使用第三方模型做评判,或者用结构化评分(精确匹配、正则匹配、BLEU 分数)替代开放式 LLM 判断。promptfoo 的 llm-rubric 需要指定一个与被测模型不同的 judge 模型。
坑三:只测质量,不测延迟
DeepSeek-V3 质量最高,但延迟 30 秒;GPT-4o-mini 质量差 5%,但 500 毫秒出结果。如果你的场景是实时对话,延迟权重应该高于质量。
解法:用 promptfoo 的 --metrics 同时输出质量和延迟,用加权分做最终决策:
score = 0.6 * quality_score + 0.4 * (1 - latency / max_latency)
坑四:评测一次就下结论
模型输出有随机性(temperature > 0),一次运行的结果方差可能很大。
解法:每个测试用例跑 3-5 次取平均,或者用统计显著性检验(p < 0.05)判断「模型 A 确实优于模型 B」。
坑五:拿着评测结果不做行动
评测最大的浪费是「跑完了然后放着看」。
解法:评测结果应该驱动决策——选型、固定 Prompt 版本、设置模型切换规则。把评测结果写入 AI 数据库设计 相关的元数据管理系统,让模型选择变成自动化流程的一部分。
五、工具选型决策树
五款工具各有侧重,用决策树快速匹配你的需求:
- 团队协作 + 生产环境 → Braintrust(数据可追溯,CI 集成完善)
- Prompt 调优 + 快速模型对比 → promptfoo(YAML 配置,零代码上手)
- RAG 系统优化 → RAGAS(检索 + 生成双维度评测)
- 学术基准 + 综合智能评估 → lm-evaluation-harness(最权威,400+ 基准)
- OpenAI 模型选型 + 成本优化 → OpenAI Evals(官方工具,token 级追踪)
结语
AI 模型评测不是「选最贵的那个」,而是「找到性价比最匹配的那个」。用对了工具,三分钟就能跑完一场模型 PK,把选型时间从一周压缩到一天。建议先从 promptfoo 入手——YAML 配置、直观报告、最小上手成本,拿到第一份评测数据后,再根据场景复杂度选择 Braintrust 或 RAGAS 做深度分析。
版权声明
本文仅代表个人观点。
本文系AI辅助作者原创,未经许可,转载请保留原文链接。

发表评论