一个遵循Unix哲学的网络爬虫工具,使用SAX解析HTML,提取链接、JS/CSS中的API端点、图片、视频等资源,支持深度扫描、robots.txt和代理认证。
- v1.7.20
- 发布于
- 2026年6月12日
- 339
- 星标
- 2,120
- 下载
- 同步于
- 1 天前
最新版本
v1.7.202026年6月12日 18:32下载慢?可在上方随时切换镜像源
项目说明
项目概述
Crawley 是一个遵循 Unix 哲学的网络爬虫工具,使用快速 HTML SAX 解析器,打印页面中找到的任何链接。
主要功能
- 快速 HTML SAX 解析
- JS/CSS 词法解析:从 JS 代码和
url()属性中提取 API 端点 - 资源 URL 抓取:图片、视频、音频、表单等
- 流式输出:URL 流式输出到 stdout,保证唯一性
- 扫描深度配置
- robots.txt 支持
brute模式:扫描 HTML 注释中的 URL- 代理支持:HTTP_PROXY/HTTPS_PROXY,支持代理认证
- Cookie 和 Header 支持
适用人群
- 安全研究人员和渗透测试人员
- 网站爬虫开发者
- DevOps 工程师
快速上手
- 从 Releases 下载二进制文件(Linux、FreeBSD、macOS、Windows)
- 基本用法:
crawley http://some-test.site - 抓取 JS 文件和 API 端点:
crawley -depth -1 -tag script -js http://some-test.site
核心优势
- 遵循 Unix 哲学,小而专注
- 代码量低于 1500 SLOC,测试覆盖率 >80%
- 跨平台支持
系统要求
- 操作系统:Linux、FreeBSD、macOS、Windows
- 支持架构:x86_64、arm64
历史版本
排序