Heretic 是一款全自动的 LLM 审查去除工具,基于方向性消融技术(abliteration)和 Optuna 优化器,无需人工调参即可为 transformer 语言模型移除安全对齐,保留模型原有能力。
- v1.4.0
- 发布于
- 2026年6月14日
- 32,475
- 星标
- 3,537
- 下载
- 同步于
- 1 天前
最新版本
v1.4.02026年6月14日 20:55下载慢?可在上方随时切换镜像源
项目说明
项目概述
Heretic 是一款全自动的 LLM 审查去除工具,基于方向性消融技术(Abliteration)结合 Optuna TPE 优化器,无需人工调参即可为 transformer 语言模型移除安全对齐(censorship),在保留模型智力水平的同时大幅减少拒绝回答。
主要功能
- 全自动运行:无需配置,一条命令完成去审查
- Abliteration 技术:结合 LLM 内部语义进行定向消融
- KL 散度优化:最小化对原模型智能的损害
- 广泛模型支持:密集模型、多模态模型、MoE 架构
- 量化支持:bitsandbytes 4-bit 量化降低显存需求
适用人群
- 本地部署 LLM 的研究者和爱好者
- 希望获得无审查回复的 AI 用户
- 对模型解释学研究感兴趣的技术人员
快速上手
- 安装 Python 3.10+ 环境,确保 PyTorch 2.2+ 已安装
- 安装 Heretic:
pip install -U heretic-llm - 运行去审查:
heretic Qwen/Qwen3-4B-Instruct-2507 - 完成后可选择保存模型、上传 HuggingFace、测试对话或运行基准测试
核心优势
- 完全自动化,无需理解 transformer 内部原理
- 在拒绝抑制和 KL 散度上均优于手动消融版本
- 支持模型量化,16GB VRAM 即可运行 4B 模型
- 社区已生成超过 5000 个 Heretic 模型
系统要求
- 操作系统:Linux(推荐)、macOS、Windows
- 支持架构:x64(CUDA GPU 推荐)
- 额外依赖:Python 3.10+、PyTorch 2.2+、可选 bitsandbytes
注意事项
- 部分模型需要更新的 PyTorch 版本(如 MXFP4 量化需 2.6+)
- 推荐使用 uv 管理依赖:
uv run heretic - 仅用于合法的研究和教育目的
历史版本
排序