模型评测与 A/B 实验

把模型对比从一次印象,变成能复现的实验

凭一次对话的手感很难判断哪个模型或 Prompt 更好。LabRouter AI 让你先固定样本集、模型 ID、参数和 Prompt 版本,再用外部脚本跑同一批输入、记录每条结果,最后按统一指标比较。结论有据可查,换人换时间也能重跑。

建议顺序:先固定一套基准样本,编号保存 Prompt 版本,再开始横向对比。

固定实验条件

评测能不能复现,取决于你把哪些东西钉死了。开始对比前,先把这四类变量固定下来,只留你真正想观察的那一处做变动。

变量固定方式为什么
样本集选定一批输入用例并编号保存,每轮评测都跑同一批,不临时增删输入不同,输出就不可比;固定样本才能让不同模型在同一起跑线上对齐
模型 ID记录 /v1/models 返回的真实 ID,不用别名,也不照抄文档示例名别名可能指向不同版本,模型一换,历史结论就悄悄失效
参数锁定 temperature、top_p、max_tokens 等采样参数,评测时通常设 temperature=0采样带来的随机波动会盖过模型本身的差异,让你误判优劣
Prompt给每个 Prompt 版本编号存档,做 A/B 时只改动这一处未版本化的 Prompt 无法回溯,出了差异也说不清是哪一版造成的

A/B 两组怎么设

A/B 的核心不是跑两次,而是让两组之间只差一个变量。这样输出有了差异,你才能把它归因到那一处改动上。

A 组:基线 Prompt

拿当前线上或默认的 Prompt 与模型配置做对照,它是所有比较的参照点。跑基线时把样本集、模型 ID 和参数一并记录,作为后续每次对比的基准,其余一切保持不变。

B 组:只改一个变量

相对 A 组只动一处:换一版 Prompt 措辞、换一个模型 ID,或调整一个采样参数。一次只改一个变量,输出的差异才能明确归因;若同时动了两处,就分不清到底是哪一处带来的变化。

记录而不是凭印象

评测的价值在于留下证据。每跑一条样本,都把下面四项落盘,日后能复查、能对比、能复现,而不是靠回忆哪个"感觉更好"。

样本 id每条输入的唯一编号,把输出、耗时、token 和评分都挂在同一个 id 下,便于逐条比对。
模型本次调用命中的真实模型 ID 与来源分组,连同参数一并记下,换机器重跑也能对上。
输出摘要保存完整输出或截断摘要,附上 request id 与 token 用量,作为评分和排查失败的原始依据。
评分按统一 rubric 给出的分数或判定,是整批样本横向对比时的最终口径。

评测脚本示例

评测逻辑放在你自己的脚本里,本站只提供兼容接口。下面这段用固定样本集、固定温度跑同一批输入,并把每条结果追加写入日志,方便之后统一打分和 A/B 比较。

# 固定样本集评测:同一批输入跑候选模型,逐条落盘
API="https://labrouterai.xyz/v1"
KEY="YOUR_EVAL_KEY"
MODEL="<从 /v1/models 复制真实模型 ID>"

# samples.jsonl:每行一个 {"id":"s001","prompt":"..."}
while IFS= read -r line; do
  id=$(echo "$line" | jq -r '.id')
  prompt=$(echo "$line" | jq -r '.prompt')
  curl -s "$API/chat/completions" \
    -H "Authorization: Bearer $KEY" \
    -H "Content-Type: application/json" \
    -d "$(jq -n --arg m "$MODEL" --arg p "$prompt" \
         '{model:$m, temperature:0, messages:[{role:"user",content:$p}]}')" \
  | jq -c --arg id "$id" --arg m "$MODEL" \
      '{sample:$id, model:$m, output:.choices[0].message.content, usage:.usage}' \
  >> results.jsonl
done < samples.jsonl

# 之后按统一 rubric 给 results.jsonl 打分,再做 A/B 比较

额度与计费

¥1 = $1

充值 ¥1 到账 $1 API 额度。充值兑换率与调用倍率是分开的两件事,评测跑多少样本就按调用如实扣费。

  • 低价来源倍率:default 0.19x、Kiro Pro 0.19x、特惠 0.19x、GPT Team 0.19x。
  • 官转档为独立计费分组(特惠来源),倍率 1.45x,不代表模型厂商官方服务。
  • 调用扣费 = 模型基准价 × 来源倍率。
  • Claude 与 GPT 通过现有分组路由,可用模型以 /v1/models 的实时返回为准。
  • 本站由 LabRouter AI 运营团队运营,是第三方兼容 API 服务,不是 Anthropic / OpenAI 或其他厂商官方服务。

新用户赠送符合最新活动资格的用户,累计前 ¥50 实付享 1:1 API 额度赠送,最多赠送 $50;超过部分及达到上限后的充值不再赠送。资格与口径以本站公告和后台核验为准。

常见问题

怎样才算一次可复现的评测?

固定样本集、模型 ID、Prompt 版本和采样参数(如温度),只改动你要对比的那一个变量,并保存每条输出的 request id 与评分。换机器、换时间重跑,也能得到可以对照的结果。

A/B 两组应该改几个变量?

一次只改一个。A 组保持基线,B 组只改动 Prompt 措辞、模型 ID 或某个参数中的一项。同时改多项会让你无法归因,分不清差异是哪一处带来的。

评分该用人工还是自动指标?

看任务类型。结构化任务可用精确匹配、正则或单元测试自动判分;开放式生成可以用固定评分表人工打分,或用另一个模型按同一套 rubric 评审。关键是整批样本用同一标准。

模型 ID 怎么填,会不会失效?

以 /v1/models 的实时返回为准,不要照抄文档示例名。评测时把用到的模型 ID 连同结果一起记录下来,便于日后复现和核对结论。

LabRouter AI 是模型厂商的官方评测服务吗?

不是。本站是第三方兼容 API 服务,通过现有分组路由 Claude / GPT 模型请求,不是 Anthropic、OpenAI 或其他厂商的官方服务。评测结果只反映在本站配置下的表现。