把模型对比从一次印象,变成能复现的实验
凭一次对话的手感很难判断哪个模型或 Prompt 更好。LabRouter AI 让你先固定样本集、模型 ID、参数和 Prompt 版本,再用外部脚本跑同一批输入、记录每条结果,最后按统一指标比较。结论有据可查,换人换时间也能重跑。
建议顺序:先固定一套基准样本,编号保存 Prompt 版本,再开始横向对比。
固定实验条件
评测能不能复现,取决于你把哪些东西钉死了。开始对比前,先把这四类变量固定下来,只留你真正想观察的那一处做变动。
| 变量 | 固定方式 | 为什么 |
|---|---|---|
| 样本集 | 选定一批输入用例并编号保存,每轮评测都跑同一批,不临时增删 | 输入不同,输出就不可比;固定样本才能让不同模型在同一起跑线上对齐 |
| 模型 ID | 记录 /v1/models 返回的真实 ID,不用别名,也不照抄文档示例名 | 别名可能指向不同版本,模型一换,历史结论就悄悄失效 |
| 参数 | 锁定 temperature、top_p、max_tokens 等采样参数,评测时通常设 temperature=0 | 采样带来的随机波动会盖过模型本身的差异,让你误判优劣 |
| Prompt | 给每个 Prompt 版本编号存档,做 A/B 时只改动这一处 | 未版本化的 Prompt 无法回溯,出了差异也说不清是哪一版造成的 |
A/B 两组怎么设
A/B 的核心不是跑两次,而是让两组之间只差一个变量。这样输出有了差异,你才能把它归因到那一处改动上。
A 组:基线 Prompt
拿当前线上或默认的 Prompt 与模型配置做对照,它是所有比较的参照点。跑基线时把样本集、模型 ID 和参数一并记录,作为后续每次对比的基准,其余一切保持不变。
B 组:只改一个变量
相对 A 组只动一处:换一版 Prompt 措辞、换一个模型 ID,或调整一个采样参数。一次只改一个变量,输出的差异才能明确归因;若同时动了两处,就分不清到底是哪一处带来的变化。
记录而不是凭印象
评测的价值在于留下证据。每跑一条样本,都把下面四项落盘,日后能复查、能对比、能复现,而不是靠回忆哪个"感觉更好"。
评测脚本示例
评测逻辑放在你自己的脚本里,本站只提供兼容接口。下面这段用固定样本集、固定温度跑同一批输入,并把每条结果追加写入日志,方便之后统一打分和 A/B 比较。
# 固定样本集评测:同一批输入跑候选模型,逐条落盘
API="https://labrouterai.xyz/v1"
KEY="YOUR_EVAL_KEY"
MODEL="<从 /v1/models 复制真实模型 ID>"
# samples.jsonl:每行一个 {"id":"s001","prompt":"..."}
while IFS= read -r line; do
id=$(echo "$line" | jq -r '.id')
prompt=$(echo "$line" | jq -r '.prompt')
curl -s "$API/chat/completions" \
-H "Authorization: Bearer $KEY" \
-H "Content-Type: application/json" \
-d "$(jq -n --arg m "$MODEL" --arg p "$prompt" \
'{model:$m, temperature:0, messages:[{role:"user",content:$p}]}')" \
| jq -c --arg id "$id" --arg m "$MODEL" \
'{sample:$id, model:$m, output:.choices[0].message.content, usage:.usage}' \
>> results.jsonl
done < samples.jsonl
# 之后按统一 rubric 给 results.jsonl 打分,再做 A/B 比较
额度与计费
充值 ¥1 到账 $1 API 额度。充值兑换率与调用倍率是分开的两件事,评测跑多少样本就按调用如实扣费。
- 低价来源倍率:default 0.19x、Kiro Pro 0.19x、特惠 0.19x、GPT Team 0.19x。
- 官转档为独立计费分组(特惠来源),倍率 1.45x,不代表模型厂商官方服务。
- 调用扣费 = 模型基准价 × 来源倍率。
- Claude 与 GPT 通过现有分组路由,可用模型以 /v1/models 的实时返回为准。
- 本站由 LabRouter AI 运营团队运营,是第三方兼容 API 服务,不是 Anthropic / OpenAI 或其他厂商官方服务。
新用户赠送符合最新活动资格的用户,累计前 ¥50 实付享 1:1 API 额度赠送,最多赠送 $50;超过部分及达到上限后的充值不再赠送。资格与口径以本站公告和后台核验为准。
常见问题
怎样才算一次可复现的评测?
固定样本集、模型 ID、Prompt 版本和采样参数(如温度),只改动你要对比的那一个变量,并保存每条输出的 request id 与评分。换机器、换时间重跑,也能得到可以对照的结果。
A/B 两组应该改几个变量?
一次只改一个。A 组保持基线,B 组只改动 Prompt 措辞、模型 ID 或某个参数中的一项。同时改多项会让你无法归因,分不清差异是哪一处带来的。
评分该用人工还是自动指标?
看任务类型。结构化任务可用精确匹配、正则或单元测试自动判分;开放式生成可以用固定评分表人工打分,或用另一个模型按同一套 rubric 评审。关键是整批样本用同一标准。
模型 ID 怎么填,会不会失效?
以 /v1/models 的实时返回为准,不要照抄文档示例名。评测时把用到的模型 ID 连同结果一起记录下来,便于日后复现和核对结论。
LabRouter AI 是模型厂商的官方评测服务吗?
不是。本站是第三方兼容 API 服务,通过现有分组路由 Claude / GPT 模型请求,不是 Anthropic、OpenAI 或其他厂商的官方服务。评测结果只反映在本站配置下的表现。