Chengshu@skadai · 2026.09.30

模型评估

1 篇文章

  • Stanford CS336 第十二讲精读:评估——从 perplexity 到 Agent 与安全基准,一场『评估危机』里的方法论斯坦福 CS336(Language Modeling from Scratch, Spring 2025)第十二讲完整讲义,主讲 Percy Liang。这一讲把『评估』拆成四件事——输入、如何调用模型、如何评判输出、如何解读结果——然后带着这条线索走遍今天的评测版图:perplexity 与数据污染、MMLU / MMLU-Pro / GPQA / Humanity's Last Exam 这四代知识型基准、Chatbot Arena / IFEval / AlpacaEval / WildBench 这类指令遵循评测、SWE-bench / Cybench / MLE-bench 与 ARC-AGI 这些 Agent 与推理基准,以及 HarmBench / AIR-Bench / 越狱与『能力 vs 倾向』的安全评测。最后落到两个最容易被忽略的问题:评测离真实用例有多远(quizzing 还是 asking),以及『有效性』——训练集污染、数据质量与『我们到底在评测方法还是评测系统』。youtube转录StanfordCS336模型评估课程讲义