💥隆重推出:OBLITERATUS!!! 💥
护栏去掉! ⛓️💥
OBLITERATUS 是迄今为止最先进的开源工具包,用于从开放权重 LLM 中消除拒绝行为——而且每一次运行都会让它变得更智能。
召唤→探测→提炼→切除→核实→重生
一键操作,六个阶段,精准无比。该模型保留了完整的推理能力,但摒弃了人为的拒绝冲动——无需重新训练,无需微调,只需基于奇异值分解的权重投影,即可斩断束缚,保留大脑功能。
这款主消融套件兼具前沿研究人员所需的功能和复杂性,同时提供新手也能快速掌握的直观易用的界面。
OBLITERATUS 包含 13 种消除方法——从忠实地再现每个主要先前的工作(FailSpy、Gabliteration、Heretic、RDO)到我们自己的新颖流程(光谱级联、分析信息、CoT 感知优化、全核)。
15 个深度分析模块,可在您接触任何权重之前绘制拒绝的几何形状:跨层对齐、拒绝逻辑透镜、概念锥几何形状、对齐印记检测(仅从子空间几何形状中识别 DPO、RLHF 和 CAI 的指纹)、衔尾蛇自修复预测、跨模型通用性索引等等。
杀手级特性:该“知情”管道在销毁过程中运行分析,实时自动配置每一个决策。包括销毁多少个方向、销毁哪些层、是否进行自我修复等。完全闭环。
11 项独一无二的创新技术——针对 MoE 模型的专家级粒度消融、保留思路链的 CoT 感知消融、KL 散度协同优化、基于 LoRA 的可逆消融等等。116 个精选模型,分布于 5 个计算层级。837 次测试。
但真正让它脱颖而出的是:OBLITERATUS 是一项众包研究实验。每次您启用遥测功能运行它时,您的匿名基准测试数据都会以任何单个实验室都无法企及的规模,为不断增长的社区数据集(包括拒食几何形状、方法比较、硬件配置等)提供数据。在 HuggingFace Spaces 上,遥测功能默认开启,因此每一次点击都是对科学的贡献。您不仅仅是在移除防护栏——您还在参与撰写有史以来规模最大的跨模型清除研究。
