
H2O.ai
Our Al-powered search assistant helps you get answers to questions about your documents, websites and workplace content.
主要功能:
AI2 推理挑战(25-shot):一组小学科学问题
HellaSwag(10-shot):一个测试常识推理的任务,对人类来说很容易(大约95%),但对SOTA模型来说具有挑战性。
MMLU(5-shot)- 用于测量文本模型的多任务准确性。测试涵盖57个任务,包括基本数学、美国历史、计算机科学、法律等等。
TruthfulQA(0-shot)- 用于测量模型复制在在线常见虚假信息中的倾向性。