httpjson 在线工具

网站路径探测与 Sitemap 有效路径发现工具

网站路径探测面向网站所有者、开发者和已获得明确授权的测试人员,默认加载并执行后端 TXT 字典中的全部 17,725 条路径,同时从 robots.txt 与 Sitemap 获取同源页面路径,并合并自定义路径进行有限并发 HTTP 检测;任务支持实时进度、取消、软 404 过滤和结果导出。

从 Sitemap 获取网站路径

工具会优先读取目标站 robots.txt 中声明的 Sitemap,并尝试常见的 sitemap.xml 与 sitemap_index.xml。Sitemap 索引和页面地址会在后端解析、规范化和去重,只保留与输入域名同源的 HTTP 或 HTTPS 路径,再逐项确认当前响应状态。

内置 TXT 路径字典

内置字典由后端从单一 TXT 文件加载,包含 17,725 条经过安全过滤、清洗和去重的路径。工具提供 QUICK 100 条、STANDARD 500 条和 FULL 17,725 条三档范围,默认选择 FULL;用户取消、达到总时限或目标连续返回 HTTP 429 时,任务仍会安全停止并保留已完成部分。

状态分类与软 404 过滤

探测使用有限并发的只读 GET 请求,记录状态码、内容类型、响应大小、耗时和跳转位置。任务会先请求随机不存在路径建立基线,将返回统一首页或相似错误页的软 404 结果排除;401、403 等受限路径会单独标记,不会被误认为普通成功页面。

授权、同源与私网边界

仅可检测自己拥有、负责维护或已获得明确书面授权的域名。后端拒绝本机、内网、保留地址和非网页端口,只接受目标域名同源路径,并限制候选数、并发数、单请求时限、总任务时限、队列和结果数量。任务可随时取消,已发现结果可以复制或导出。

常见问题

  • Sitemap 中的地址还需要再次探测吗?

    需要。Sitemap 可能包含已经下线、跳转、受权限限制或临时异常的历史地址。再次发起有限的只读请求可以确认当前状态,并将有效、受限、跳转、缺失和软 404 分开统计。

  • 内置路径字典会在每次任务时联网下载吗?

    不会。后端直接读取经过清洗去重的本地 TXT 字典,任务运行时不需要访问第三方服务,因此候选顺序稳定,也不会因外部服务不可用或内容变化而受影响。

  • 什么是软 404,工具如何减少误报?

    软 404 是不存在路径仍返回 200、统一跳转或相似错误页面的情况。任务会先生成随机不存在路径作为基线,对比状态、跳转位置与受限大小的响应指纹,把相似结果计入软 404 而不是有效路径。

  • 网站路径探测可以扫描内网或任意端口吗?

    不可以。该功能只面向公开网站的标准 HTTP 或 HTTPS 入口,拒绝 localhost、私网、链路本地、保留地址和非网页端口,并只处理输入域名的同源路径。