p-e-w

heretic

Heretic 是一款全自动的 LLM 审查去除工具,基于方向性消融技术(abliteration)和 Optuna 优化器,无需人工调参即可为 transformer 语言模型移除安全对齐,保留模型原有能力。

v1.4.0
发布于
2026年6月14日
32,475
星标
3,537
下载
同步于
1 天前

最新版本

v1.4.02026年6月14日 20:55
下载慢?可在上方随时切换镜像源

项目说明

项目概述

Heretic 是一款全自动的 LLM 审查去除工具,基于方向性消融技术(Abliteration)结合 Optuna TPE 优化器,无需人工调参即可为 transformer 语言模型移除安全对齐(censorship),在保留模型智力水平的同时大幅减少拒绝回答。

主要功能

  • 全自动运行:无需配置,一条命令完成去审查
  • Abliteration 技术:结合 LLM 内部语义进行定向消融
  • KL 散度优化:最小化对原模型智能的损害
  • 广泛模型支持:密集模型、多模态模型、MoE 架构
  • 量化支持:bitsandbytes 4-bit 量化降低显存需求

适用人群

  • 本地部署 LLM 的研究者和爱好者
  • 希望获得无审查回复的 AI 用户
  • 对模型解释学研究感兴趣的技术人员

快速上手

  1. 安装 Python 3.10+ 环境,确保 PyTorch 2.2+ 已安装
  2. 安装 Heretic:pip install -U heretic-llm
  3. 运行去审查:heretic Qwen/Qwen3-4B-Instruct-2507
  4. 完成后可选择保存模型、上传 HuggingFace、测试对话或运行基准测试

核心优势

  • 完全自动化,无需理解 transformer 内部原理
  • 在拒绝抑制和 KL 散度上均优于手动消融版本
  • 支持模型量化,16GB VRAM 即可运行 4B 模型
  • 社区已生成超过 5000 个 Heretic 模型

系统要求

  • 操作系统:Linux(推荐)、macOS、Windows
  • 支持架构:x64(CUDA GPU 推荐)
  • 额外依赖:Python 3.10+、PyTorch 2.2+、可选 bitsandbytes

注意事项

  • 部分模型需要更新的 PyTorch 版本(如 MXFP4 量化需 2.6+)
  • 推荐使用 uv 管理依赖:uv run heretic
  • 仅用于合法的研究和教育目的

历史版本

排序