#1
Hermes 4
拒答模式: 极少(设计如此)
拒答训练最少、最强的开源权重模型——非常适合主流模型过度拒答会成为障碍的合法用例,例如安全研究、红队评估、面向成年人的创意写作以及对敏感话题的教育性讨论。
主流的开源权重指令微调模型——Llama Instruct、Qwen Instruct、Phi Instruct——都会在后训练流水线中加入安全对齐训练。这对通用消费级应用是合理的,但对于对齐训练未能预料的合法用例却造成了实际障碍:安全研究与红队评估、CTF 训练环境、含成年题材的小说创作、涉及敏感话题的历史与教育内容,以及处于灰色地带的合法分析工作。
本榜单覆盖以下两类开源权重模型:要么显式采用极少的拒答训练(如 Hermes 4),要么被广泛用作社区微调的基础以剥离对齐层(如 Llama 3 + Dolphin 等)。我们的目标并不是推动有害内容——生产部署仍需配套的产品级安全控制——而是识别那些受激进拒答训练阻碍、却在实际操作中可访问的合法用例所适配的模型。
拒答模式: 极少(设计如此)