清华发布最新全球大模型评测: 智谱 GLM-4、文心一言直追 GPT-4,Llama 3 表现不俗
日前,Meta 发布最新开源模型 Llama 3 并号称是性能最好开源大语言模型,极有可能超过当前的闭源王者 GPT-4 Turbo。那么,Llama 3 能力究竟如何?
4 月 24 日,由清华大学基础模型研究中心联合中关村实验室研制的 SuperBench 大模型综合能力评测平台,基于语义、对齐、代码、安全和智能体 5 项大模型原生评测基准,展开开放性、动态性、科学性和权威性的大模型综合能力评测,率先剖析 Llama 3 模型能力。
《SuperBench 大模型综合能力评测报告》对 Llama 3-8B、Llama 3-70B 等 16 个海内外具有代表性的模型进行了评测。结果显示,Llama 3 与 GPT-4 系列模型仍有一定差距,而国内大模型智谱 AI 的 GLM-4 与百度文心一言 4.0 在多项评测中进入榜单前五名,超过 Llama 3。
在语义理解能力评测中,国内大模型 GLM-4、文心一言 4.0 分别位列第二名、第三名,仅次于 Claude-3,但超过 GPT-4 网页版与 GPT-4 Turbo,稳占第一梯队。Llama 3-70B、Llama 3-8B 则分别位列第六名、第十六名。
而在智能体能力评测中,Llama 3-70B 跻身榜单前五名,这也是该模型五项评测排名最高的一次。在代码编写能力、人类对齐能力、安全和价值观三项评测中,Llama 3-70B 均排在第七名,超过大部分国内大模型,只落败于 GLM-4 和文心一言 4.0,Llama 3-8B 排名相对靠后,考虑到模型参数量的差异,Llama 3-70B 整体表现较好。
相较之下,表现出色的国内大模型 GLM-4 全面对标 OpenAI,在五项能力评测中均紧追 GPT-4 系列模型与 Claude-3,堪称“全能选手”。同时,在代码、智能体两项大模型关键能力评测中,GLM-4 排名仅次于 GPT-4 系列模型和 Claude-3,位列国内第一。
在安全价值观能力评测中,文心一言 4.0 拿下最高分,超越 GPT-4 系列模型和 Claude-3。在智能体能力评测中,文心一言 4.0 表现较差。
总体而言,虽然国内大模型与国际顶尖模型之间还存在差距,但正逐步缩小这一差距。相信在政策支持和技术创新的推动下,国内大模型将取得显著成就,推动我国人工智能产业高质量发展。
评论