清华 14 大 LLM 最新评测报告出炉：GPT-4 和 Claude-3 依然领先，国内 GLM-4 等模型同样亮眼-微比恩

图片地址：https://img.ithome.com/newsuploadfiles/2024/4/edb73a62-104b-4c67-9555-9ec02600556a.png?x-bce-process=image/format,f_auto

大模型混战究竟谁才是实力选手？清华对国内外 14 个 LLM 做了最全面的综合能力测评，其中 GPT-4、Cluade 3 是当之无愧的王牌，而在国内 GLM-4、文心 4.0 已然闯入了第一梯队。在 2023 年的「百模大战」中，众多实践者推出了各类模型，这些模型有的是原创的，有的是针对开源模型进行微调的；有些是通用的，有些则是行业特定的。如何能合理地评价这些模型的能力，成为关键问题。尽管国内外存在多个模型能力评测榜单，但它们的质量参差不齐，排名差异显著，这主要是因为评测数据和测试方法尚不成熟和科学。我们认为，好的评测方法应当具备开放性、动态性、科学性和权威性。为提供客观、科学的评测标准，清华大学基础模型研究中心联合中关村实验室研制了 SuperBench大模型综合能力评测框架，旨在推动大模型技术、应用和生态的健康发展。最近，2024 年 3 月版《SuperBench 大模型综合能力评测报告》正式发布。评测共包含了 14 个