🧠 编码器 vs 解码器,谁才是通用模型架构之王?Hugging Face 推出全新开源模型套件 —— Ettin Suite,让你真正公平地对比二者能力!⚔️
Ettin 是首个基于相同架构、相同数据(2 万亿 Token)、相同训练配方,同时训练编码器(MLM)和解码器(CLM)的大模型套件,参数量覆盖从 17M 到 1B,真正实现“苹果对苹果”的架构对比。
结果非常惊艳:
✅ 编码器全面超越 ModernBERT,用于分类、检索表现极佳
✅ 解码器在文本生成任务上击败 Llama 3.2 和 SmolLM2
✅ 同样大小下,结构差异带来的性能差距大于训练目标本身
模型基于开放数据训练,三阶段流程(预训练、扩展上下文、收尾精调),完全可复现,支持 Transformers 直接加载,适合 embedding、检索、分类和文本生成等多种下游任务。
🤗 Ettin 不只是架构对比,更是一套可落地、可扩展的高质量模型工具箱。欢迎加入我们的中文社区:Chinese LLMs on Hugging Face,一起探索架构设计、训练技巧和落地应用的新边界!
#人工智能##Hugging Face##大语言模型#
发布于 美国
