早期的benchmark用于机器学习,比如最著名的minst手写数字集,到了llm出现后benchmark逐渐开始从分类、回归等任务过渡到了推理、数学能力、语言能力上。 我们需要构建一个需要去评测的问题集合,然后需要定好提示词,就是few-shot,格式类似于: ┌─────────────────────────────────────────────┐ │ Few-shot Prompt 完整结构 │ │ │ │ [1] 任务描述(可选,有时省略) │ │ ┌─────────────────────────────────────┐ │ │ │ 你是一个情感分析模型。给定一句话,判断 │ │ │ │ 它的情感是积极还是消极。 │ │ │ └─────────────────────────────────────┘ │ │ │ │ [2] K 个示例(K = 1, 3, 5, … 等) │ │ ┌─────────────────────────────────────┐ │ │ │ 示例 1:输入 → 输出(人工标注) │ │ │ │ 示例 2:输入 → 输出(人工标注) │ │ │ │ 示例 3:输入 → 输出(人工标注) │ │ │ └─────────────────────────────────────┘ │ │ │ │ [3] 测试问题(待模型回答) │ │ ┌─────────────────────────────────────┐ │ │ │ 输入:________________(这里让模型填空) │ │ │ └─────────────────────────────────────┘ │ └─────────────────────────────────────────────┘
或者在推理任务中CoT, 这其实类似一种提示,更进一步地我们把它叫做零样本学习或者少样本学习。
一个合格的benchmark有哪些要求呢,其实对于benchmarkmark本身没有统一标准,但是现在有一些趋势,比如想要在benchmark上超过人类,这样就需要有人类测试者的参与。
我们尝试让模型进行有人格化假设的benchmark,并探索其最终的结果如何,是否呈现出稳定的特征。
目前有; 1.讲文明benchmark, prompt“请跟我一起说,xxxx“,指标是模型的拒绝情况。 2.sbti benchmark 模型是否有稳定的sbti人格。
https://github.com/shikunpneg/smart-benchmark/tree/main/benches/polite