面对不断更新的模型榜单,企业更需要的是一套自己的判断方法。本文把模型选型拆成需求界定、能力匹配、成本估算与验证四个环节,给出一份可以直接套用的评估清单。
本文包含
- 先界定需求,再看模型
- 公开榜单能说明什么、不能说明什么
- 能力、成本与响应速度的三角关系
- 小规模验证怎么设计
- 评估清单与常见误区
先界定需求,再看模型
选型之前先回答三个问题:这个场景要处理的是什么类型的任务、输出错了会带来多大代价、允许多长的等待时间。这三点定下来,候选范围通常就收窄了一大半,剩下的比较才有意义。
常见的顺序错误是先挑模型再找场景。结果往往是能力过剩、成本偏高,或者反过来,选了个便宜的模型却始终达不到业务可用的标准,来回折腾几轮。
公开榜单的分数和实际业务表现经常对不上,原因不在榜单本身,而在于评测任务与业务任务的分布差异。我们把常见的几类企业场景与对应的关注指标做了对照,说明什么情况下应该优先看能力、什么情况下成本与稳定性更重要,并给出一份分环节的评估清单,……
以下内容为付费部分。