📢 Arabic Leaderboards 全面升级!新增 Arabic Instruction Following、AraGen 03-25 更新等内容上线!🤖
为了推动阿拉伯语大语言模型的发展与评估,Inception 联合 MBZUAI 推出了全新的 Arabic-Leaderboards Space,集中发布并持续更新阿语 LLM 的多维评估榜单。
🌟 1. 全新统一评估平台上线
Arabic-Leaderboards Space 集中呈现多任务榜单
当前上线两个核心榜单:AraGen 03-25(生成任务)和 Arabic Instruction Following(指令跟随能力)
支持多模态任务评估即将上线!
📊 2. AraGen 03-25 更新:更难、更全面
数据集扩展至 340 条问答对,涵盖问答、推理、安全性、语法等任务
评估标准采用 3C3H 体系:正确性、完整性、简洁性、帮助性、诚实性、无害性
使用 Claude-3.5 作为评审模型,结果更稳定,评分更严谨
🔎 本次更新后,模型得分整体下降(如冠军模型得分从 82.67% 降至 70.25%),反映出更具挑战的基准,更能区分强弱模型。
🧠 3. Arabic Instruction Following 榜单首发
基于 Arabic IFEval 数据集,参考 Google IFEval 构建,完全自动评估
包含 300+ 条针对阿拉伯语语法与文化的精准指令,全面考察模型“听话”能力
Claude-3.5、GPT-4o 表现最优,Qwen、Gemma 等开源模型也表现亮眼
📈 Arabic 指令完成率 Top 3:
1️⃣ Claude-3.5-Sonnet:72.5%
2️⃣ GPT-4o:70.8%
3️⃣ GPT-4o-mini:68.1%
🔜 未来计划
我们将很快推出视觉问答榜单,并引入 camel-bench、kitab 等新基准,欢迎社区参与共建,推动 Arabic LLM 的发展!
🤗 欢迎加入我们的中文社区:Chinese LLMs on Hugging Face,一起关注全球多语言大模型的进展!
#ArabicLLM##语言模型评估##InstructionFollowing##多语言模型##Hugging Face#
