致那些依赖基准测试分数选择 AI 模型的技术管理者们
TuBrief 편집팀
2026년 7월 10일
0
Computing/Software원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.
커뮤니티의 다른 글
댓글 (0)
Log in to leave a comment
아직 작성된 글이 없습니다
원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.
Log in to leave a comment
아직 작성된 글이 없습니다
作为工程经理,你可能首先会查看 Hugging Face 排行榜或 MMLU 分数。坦白说,这些数字与实际工作无关。学术界的基准测试根本无法反映企业内部复杂的领域知识或公司独有的语气与风格。根据 Scale AI 的 GSM1K 研究,在去除数据污染后,模型的数学推理能力最多下降了 13%。通用指标只是验证模型是否“背诵”了数据的一种手段,并不能告诉你模型在生产环境中表现如何。
为了避免浪费预算,你需要以团队过去 3 个月处理的实际业务数据为基础来建立评估标准。
高级开发人员编写的理想答案本身就是明确的业务规则。从这 20 个案例开始,后续可以将其发展为包含 150 个以上用例的回归测试套件。
让人工去逐一阅读模型回答并打分是不可能的。编写一个 Python 脚本,利用 GPT-4o 或 Claude 3.5 Sonnet 作为判分器(Judge)。
`python
def evaluate_response(question, response):
prompt = f"""
请根据以下 3 个标准,对下述回答进行 0 到 1 分的评分:
1. 准确性:信息是否属实?
2. 约束遵守:是否遵守了请求的格式?
3. 语气一致性:是否符合公司准则?
问题: {question}
回答: {response}
"""
# API 调用及结果返回
`
为了防止位置偏差,请每次随机打乱问题顺序。Shopify 通过内化这种智能评估基础设施,将收件箱场景的验证速度提高了 62%,并将响应一致性保持在 93% 以上。
每次更换模型都进行人工质量检查是在浪费时间。
建立这套流程后,就像 Duolingo 将人工 QA 资源减少了 70% 一样,你的团队也可以将每次模型升级时产生的回归测试时间缩短 80%。现在,你只需两周时间就能定量验证引入模型的可行性。如果在这个问题上纠结超过两周,那就是效率低下。