geo-audit · tdengine.com 2026-09-12 11:50 UTC 0.1.0 UA: geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com) 去噪清单: denoise/2026-09-07.1 schema geo-audit/report/1

判决

你的 AI 检索链路上有 7 个位置会被读错。

30 个位置 4 通过 7 读错 0 无法判断 19 不适用

四格之和恒等于位置数。「无法判断」永不折算进「通过」——「我们看不了」和「你这里没问题」是两件事。

按根因

按根因:7 条发现来自 3 处改动

口径:7 条 finding / 3 处根因 / 12 个链接实例 —— 三个数各有各的意思,不许混着说。

未能评估

把「我们没看到」误读成「没问题」的代价,比漏一条 LOW 死链大得多,所以这一区排在发现之前。这些位置既不计死链也不计存活。

本次扫描没有「无法判断」的位置。

AI 检索链路六段

① 入口发现4 个位置✓ 4 通过② 索引文件真伪12 个位置✕ 2 读错 · – 10 不适用③ 全文通道8 个位置✕ 2 读错 · – 6 不适用④ 索引内链存活0 个位置未探测⑤ .md 通道1 个位置未声明「任意页面加 .md」约定⑥ 可点击路径5 个位置✕ 3 读错 · – 2 不适用

这条链路上任何一段断掉,后面几段的内容 AI 都拿不到。

差异化演示

只探根路径、不做对照探测的实现,在这个站上没读错。差异化演示区因此是空的 —— 这是这个域的性质,不是我们少做了对照。

这一块的作用不是炫技,是让「我拿别的东西查过,没这条」这句话失效:我们先说出那类实现在这里会得出什么、以及它少做了哪一步。

自己复现 → geo-audit tdengine.com --contact you@you.co --naive-only

这份报告不检查:锚点是否腐烂、sitemap、robots 对 AI 爬虫的放行、图片/CSS 资源、事实是否冲突、内容是否过期。理由见文末。

发现(按根因分组)

https://tdengine.com/pricing/:1 个唯一目标 / 4 个链接实例命中「站内路由缺失」(兜底)。证据:https://cloud.tdengine.com/ 404,站内没有这个路由

改 1 处 → 修 1 条 · 4 个链接实例 · 最高 CRITICAL route_missingdefect=route_missingsource_locus=https://tdengine.com/pricing/|div.entry-content[n8-29]path_prefix=/edges=none

CRITICAL · 销售路径 ⑥ 可点击路径 dead_link GA-9F75548B2C
https://tdengine.com/pricing/ 上的「Free Trial」点了就 404

去哪儿改

HTTP 200

证据

目标 https://cloud.tdengine.com 200
同域 https://cloud.tdengine.com/ 200
同域对照返回正常,所以这不是整站反爬。
复现
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://cloud.tdengine.com'

只探根路径、不做对照探测的实现会说:只看首跳状态码的实现会说:活的

实际是:HTTP 200,同 host 有活着的对照

这个目标在站上出现 4 次(2 个页面)

这条链接在「销售路径」上。人点了拿到 404,AI 抓到的也是 404 —— 这一段链路对两边同时断掉。

已排除的可能(通过了这些去噪规则才报出来): 与同域不存在路径 https://cloud.tdengine.com/geo-audit-probe-5bf78b588d002f5cfacab314 的HTML 骨架指纹完全相同(sha256 865c4fed5154c68e…,标签数 159)该 host 对任意路径返回同一个壳,本位置等同不存在已用第二次即时对照探测 https://cloud.tdengine.com/geo-audit-probe-0457ff8793266027a6faab59 复核,结论一致

严重度依据: page_role=https://tdengine.com/pricing/anchor=Free Trialanchor_class=region=销售路径

不认这条:不认这条:geo-audit tdengine.com --ignore GA-9F75548B2C

纯文本版(手选复制)
GA-9F75548B2C CRITICAL 销售路径
https://tdengine.com/pricing/ 上的「Free Trial」点了就 404
目标: https://cloud.tdengine.com 200 -
这个目标在站上出现 4 次(2 个页面) https://tdengine.com/pricing/
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://cloud.tdengine.com'
不认这条:geo-audit tdengine.com --ignore GA-9F75548B2C
这个目标在站上出现 4 次(2 个页面)
  • https://cloud.tdengine.com
  • https://cloud.tdengine.com/

https://tdengine.com/:1 个唯一目标 / 2 个链接实例命中「站内路由缺失」(兜底)。证据:https://cloud.tdengine.com/login?instanceType=IDMP 404,站内没有这个路由

改 1 处 → 修 1 条 · 2 个链接实例 · 最高 CRITICAL route_missingdefect=route_missingsource_locus=https://tdengine.com/|div.gb-element-7b179dbd[n3-7]path_prefix=/loginedges=none

CRITICAL · 销售路径 ⑥ 可点击路径 dead_link GA-974C99C11B
https://tdengine.com/ 上的「Cloud」点了就 404

去哪儿改

打开
https://tdengine.com/
定位
锚文本「Cloud」的链接(https://tdengine.com/|div.gb-element-7b179dbd[n3-7])
现在
https://cloud.tdengine.com/login?instanceType=IDMP
改成
https://docs.tdengine.com/internals/log/ ← 我们请求过,200

证据

目标 https://cloud.tdengine.com/login?instanceType=IDMP 200
同域 https://cloud.tdengine.com/ 200
同域对照返回正常,所以这不是整站反爬。
复现
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://cloud.tdengine.com/login?instanceType=IDMP'

只探根路径、不做对照探测的实现会说:只看首跳状态码的实现会说:活的

实际是:HTTP 200,同 host 有活着的对照

这个目标在站上出现 2 次(2 个页面)

这条链接在「销售路径」上。人点了拿到 404,AI 抓到的也是 404 —— 这一段链路对两边同时断掉。

已排除的可能(通过了这些去噪规则才报出来): 与同域不存在路径 https://cloud.tdengine.com/geo-audit-probe-09fb064f78a98b891d0f71ab 的HTML 骨架指纹完全相同(sha256 865c4fed5154c68e…,标签数 159)该 host 对任意路径返回同一个壳,本位置等同不存在已用第二次即时对照探测 https://cloud.tdengine.com/geo-audit-probe-e630412a5641b56961d2ec92 复核,结论一致

严重度依据: page_role=https://tdengine.com/anchor=Cloudanchor_class=region=销售路径

不认这条:不认这条:geo-audit tdengine.com --ignore GA-974C99C11B

纯文本版(手选复制)
GA-974C99C11B CRITICAL 销售路径
https://tdengine.com/ 上的「Cloud」点了就 404
目标: https://cloud.tdengine.com/login?instanceType=IDMP 200 -
这个目标在站上出现 2 次(2 个页面) https://tdengine.com/
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://cloud.tdengine.com/login?instanceType=IDMP'
不认这条:geo-audit tdengine.com --ignore GA-974C99C11B
这个目标在站上出现 2 次(2 个页面)
  • https://cloud.tdengine.com/login?instanceType=IDMP

https://tdengine.com/:1 个唯一目标 / 2 个链接实例命中「站内路由缺失」(兜底)。证据:https://cloud.tdengine.com/login?instanceType=TSDB 404,站内没有这个路由

改 1 处 → 修 1 条 · 2 个链接实例 · 最高 CRITICAL route_missingdefect=route_missingsource_locus=https://tdengine.com/|div.gb-element-101f24d5[n3-7]path_prefix=/loginedges=none

CRITICAL · 销售路径 ⑥ 可点击路径 dead_link GA-28513FEA2C
https://tdengine.com/ 上的「Cloud」点了就 404

去哪儿改

打开
https://tdengine.com/
定位
锚文本「Cloud」的链接(https://tdengine.com/|div.gb-element-101f24d5[n3-7])
现在
https://cloud.tdengine.com/login?instanceType=TSDB
改成
https://docs.tdengine.com/internals/log/ ← 我们请求过,200

证据

目标 https://cloud.tdengine.com/login?instanceType=TSDB 200
同域 https://cloud.tdengine.com/ 200
同域对照返回正常,所以这不是整站反爬。
复现
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://cloud.tdengine.com/login?instanceType=TSDB'

只探根路径、不做对照探测的实现会说:只看首跳状态码的实现会说:活的

实际是:HTTP 200,同 host 有活着的对照

这个目标在站上出现 2 次(2 个页面)

这条链接在「销售路径」上。人点了拿到 404,AI 抓到的也是 404 —— 这一段链路对两边同时断掉。

已排除的可能(通过了这些去噪规则才报出来): 与同域不存在路径 https://cloud.tdengine.com/geo-audit-probe-e630412a5641b56961d2ec92 的HTML 骨架指纹完全相同(sha256 865c4fed5154c68e…,标签数 159)该 host 对任意路径返回同一个壳,本位置等同不存在已用第二次即时对照探测 https://cloud.tdengine.com/geo-audit-probe-f02332537f169a50153672ea 复核,结论一致

严重度依据: page_role=https://tdengine.com/anchor=Cloudanchor_class=region=销售路径

不认这条:不认这条:geo-audit tdengine.com --ignore GA-28513FEA2C

纯文本版(手选复制)
GA-28513FEA2C CRITICAL 销售路径
https://tdengine.com/ 上的「Cloud」点了就 404
目标: https://cloud.tdengine.com/login?instanceType=TSDB 200 -
这个目标在站上出现 2 次(2 个页面) https://tdengine.com/
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://cloud.tdengine.com/login?instanceType=TSDB'
不认这条:geo-audit tdengine.com --ignore GA-28513FEA2C
这个目标在站上出现 2 次(2 个页面)
  • https://cloud.tdengine.com/login?instanceType=TSDB

未归并(各自独立的一处改动)

HIGH · AI 通道内部 ② 索引文件真伪 soft_404 GA-080399C1F1
https://www.tdengine.com/docs/llms.txt 返回 200 但内容不是文本文件(软 404)

去哪儿改

HTTP 200,28515 字节,内容是兜底页(修复目标:我们没找到明显的正确目标,需人工确认)

证据

目标 https://www.tdengine.com/docs/llms.txt 200 text/html 28,515 B
<title>TDengine TSDB Reading Guide | TDengine TSDB Docs</title>
tdengine tsdb reading guide | tdengine tsdb docs skip to main content idmp docs contact us cloud search v3.4.2 (latest) v3.4.1 cloud v3.4.0 v3.3.8 v3.3.6 (lts) v3.2 v3.1 v3.0 v2.6 v2.4 v2.0 v1.6 search reading guide introduction time-series
这一条靠确定性规则判定(要的是文本文件、给回来的是 HTML),不依赖同域对照。
复现
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://www.tdengine.com/docs/llms.txt'

只探根路径、不做对照探测的实现会说:未采纳(没探这个位置)

实际是:软 404:html_where_text_expected(另命中 redirect_to_site_root),HTTP 200 / text/html

AI 抓这个位置拿到的是页面外壳,不是你的索引文件。只看状态码的工具会把它读成「已采纳 llms.txt」——采纳率因此虚高。

已排除的可能(通过了这些去噪规则才报出来): html_where_text_expectedredirect_to_site_root

严重度依据: page_role=ai_channelanchor=(AI 通道内部,无锚文本)anchor_class=(AI 通道内部,无 class)region=ai_channel

不认这条:geo-audit tdengine.com --ignore GA-080399C1F1

纯文本版(手选复制)
GA-080399C1F1 HIGH AI 通道内部
https://www.tdengine.com/docs/llms.txt 返回 200 但内容不是文本文件(软 404)
目标: https://www.tdengine.com/docs/llms.txt 200 text/html
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://www.tdengine.com/docs/llms.txt'
geo-audit tdengine.com --ignore GA-080399C1F1
HIGH · AI 通道内部 ③ 全文通道 soft_404 GA-615A790674
https://tdengine.com/docs/llms-full.txt 返回 200 但内容不是文本文件(软 404)

去哪儿改

HTTP 200,28515 字节,内容是兜底页(修复目标:我们没找到明显的正确目标,需人工确认)

证据

目标 https://tdengine.com/docs/llms-full.txt 200 text/html 28,515 B
<title>TDengine TSDB Reading Guide | TDengine TSDB Docs</title>
tdengine tsdb reading guide | tdengine tsdb docs skip to main content idmp docs contact us cloud search v3.4.2 (latest) v3.4.1 cloud v3.4.0 v3.3.8 v3.3.6 (lts) v3.2 v3.1 v3.0 v2.6 v2.4 v2.0 v1.6 search reading guide introduction time-series
这一条靠确定性规则判定(要的是文本文件、给回来的是 HTML),不依赖同域对照。
复现
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://tdengine.com/docs/llms-full.txt'

只探根路径、不做对照探测的实现会说:未采纳(没探这个位置)

实际是:软 404:html_where_text_expected(另命中 redirect_to_site_root),HTTP 200 / text/html

AI 抓这个位置拿到的是页面外壳,不是你的索引文件。只看状态码的工具会把它读成「已采纳 llms.txt」——采纳率因此虚高。

已排除的可能(通过了这些去噪规则才报出来): html_where_text_expectedredirect_to_site_root

严重度依据: page_role=ai_channelanchor=(AI 通道内部,无锚文本)anchor_class=(AI 通道内部,无 class)region=ai_channel

不认这条:geo-audit tdengine.com --ignore GA-615A790674

纯文本版(手选复制)
GA-615A790674 HIGH AI 通道内部
https://tdengine.com/docs/llms-full.txt 返回 200 但内容不是文本文件(软 404)
目标: https://tdengine.com/docs/llms-full.txt 200 text/html
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://tdengine.com/docs/llms-full.txt'
geo-audit tdengine.com --ignore GA-615A790674
HIGH · AI 通道内部 ② 索引文件真伪 soft_404 GA-986100631D
https://tdengine.com/docs/llms.txt 返回 200 但内容不是文本文件(软 404)

去哪儿改

HTTP 200,28515 字节,内容是兜底页(修复目标:我们没找到明显的正确目标,需人工确认)

证据

目标 https://tdengine.com/docs/llms.txt 200 text/html 28,515 B
<title>TDengine TSDB Reading Guide | TDengine TSDB Docs</title>
tdengine tsdb reading guide | tdengine tsdb docs skip to main content idmp docs contact us cloud search v3.4.2 (latest) v3.4.1 cloud v3.4.0 v3.3.8 v3.3.6 (lts) v3.2 v3.1 v3.0 v2.6 v2.4 v2.0 v1.6 search reading guide introduction time-series
这一条靠确定性规则判定(要的是文本文件、给回来的是 HTML),不依赖同域对照。
复现
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://tdengine.com/docs/llms.txt'

只探根路径、不做对照探测的实现会说:未采纳(没探这个位置)

实际是:软 404:html_where_text_expected(另命中 redirect_to_site_root),HTTP 200 / text/html

AI 抓这个位置拿到的是页面外壳,不是你的索引文件。只看状态码的工具会把它读成「已采纳 llms.txt」——采纳率因此虚高。

已排除的可能(通过了这些去噪规则才报出来): html_where_text_expectedredirect_to_site_root

严重度依据: page_role=ai_channelanchor=(AI 通道内部,无锚文本)anchor_class=(AI 通道内部,无 class)region=ai_channel

不认这条:geo-audit tdengine.com --ignore GA-986100631D

纯文本版(手选复制)
GA-986100631D HIGH AI 通道内部
https://tdengine.com/docs/llms.txt 返回 200 但内容不是文本文件(软 404)
目标: https://tdengine.com/docs/llms.txt 200 text/html
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://tdengine.com/docs/llms.txt'
geo-audit tdengine.com --ignore GA-986100631D
HIGH · AI 通道内部 ③ 全文通道 soft_404 GA-A136902808
https://www.tdengine.com/docs/llms-full.txt 返回 200 但内容不是文本文件(软 404)

去哪儿改

HTTP 200,28515 字节,内容是兜底页(修复目标:我们没找到明显的正确目标,需人工确认)

证据

目标 https://www.tdengine.com/docs/llms-full.txt 200 text/html 28,515 B
<title>TDengine TSDB Reading Guide | TDengine TSDB Docs</title>
tdengine tsdb reading guide | tdengine tsdb docs skip to main content idmp docs contact us cloud search v3.4.2 (latest) v3.4.1 cloud v3.4.0 v3.3.8 v3.3.6 (lts) v3.2 v3.1 v3.0 v2.6 v2.4 v2.0 v1.6 search reading guide introduction time-series
这一条靠确定性规则判定(要的是文本文件、给回来的是 HTML),不依赖同域对照。
复现
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://www.tdengine.com/docs/llms-full.txt'

只探根路径、不做对照探测的实现会说:未采纳(没探这个位置)

实际是:软 404:html_where_text_expected(另命中 redirect_to_site_root),HTTP 200 / text/html

AI 抓这个位置拿到的是页面外壳,不是你的索引文件。只看状态码的工具会把它读成「已采纳 llms.txt」——采纳率因此虚高。

已排除的可能(通过了这些去噪规则才报出来): html_where_text_expectedredirect_to_site_root

严重度依据: page_role=ai_channelanchor=(AI 通道内部,无锚文本)anchor_class=(AI 通道内部,无 class)region=ai_channel

不认这条:geo-audit tdengine.com --ignore GA-A136902808

纯文本版(手选复制)
GA-A136902808 HIGH AI 通道内部
https://www.tdengine.com/docs/llms-full.txt 返回 200 但内容不是文本文件(软 404)
目标: https://www.tdengine.com/docs/llms-full.txt 200 text/html
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://www.tdengine.com/docs/llms-full.txt'
geo-audit tdengine.com --ignore GA-A136902808

待人工确认

下面这些我们判它死了,但静态 HTML 判不了它是否对访客可见。我们打 needs_review 而不是丢弃,也不进首页分子。

本次没有需要人工确认的条目。

下次会先坏在哪 · 结构性脆弱点

每条都挂一个实测先例,并给一条能直接放进 CI 的命令。这一区不是预测,是「这个形状在语料里已经坏过」。

INFO F6
WAF 会把真文件挡成 403/429
判据
本次全部 host 的对照探测都可用(0 个被挡)
为什么危险
被拦截 ≠ 不存在。纯 HTTP 客户端在这类 host 上会把真文件读成「没有」。
实测先例
gusto.com 403、www.pipedrive.com 429
放进 CI 的一条命令
geo-audit tdengine.com --contact you@yourco.com --format json
INFO F8
该 host 对未知路径不返回 404
判据
本次全部 host 对随机路径都返回了非 2xx(状态码可判别)
为什么危险
这种 host 上任何只看状态码的工具都会报 0 死链,那个 0 是假的。
实测先例
developers.pipedrive.com(200 + 24,907 B 兜底页)、docs.gusto.com(302→/)、docs.moderntreasury.com(302→/)、www.minimax.io(200 + 384,052 B)、platform.kimi.ai(200 + 414,072 B)
放进 CI 的一条命令
geo-audit tdengine.com --contact you@yourco.com --format json

我们替你验了什么 · 证据存档

逐位置一行,行数恒等于位置数。每行都带一条可粘贴的 curl。

共 30 行 == 30 个位置。

URL状态码content-type字节对照路径对照返回结论
① 入口发现 https://tdengine.com/ 通过 对照探测 https://tdengine.com/geo-audit-probe-a189f33efd6989223a942916 返回 HTTP 404 / text/html,与本响应可区分,判为真实内容
① 入口发现 https://www.tdengine.com/ 通过 对照探测 https://www.tdengine.com/geo-audit-probe-a4889888a41d1e0234b216bd 返回 HTTP 404 / text/html,与本响应可区分,判为真实内容
① 入口发现 https://docs.tdengine.com/ 通过 对照探测 https://docs.tdengine.com/geo-audit-probe-932b5f726d49409a6edfd2ee 返回 HTTP 404 / text/html,与本响应可区分,判为真实内容
① 入口发现 https://api.w.org/ 通过 对照探测 https://api.w.org/geo-audit-probe-bc068fb5ed0e33b3d0e9098b 返回 HTTP 404 / text/html,与本响应可区分,判为真实内容
② 索引文件真伪 https://tdengine.com/llms.txt 404 text/html 167,499 https://tdengine.com/geo-audit-probe-a189f33efd6989223a942916 404 不适用 HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致
curl
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://tdengine.com/llms.txt'
③ 全文通道 https://tdengine.com/llms-full.txt 404 text/html 167,499 https://tdengine.com/geo-audit-probe-a189f33efd6989223a942916 404 不适用 HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致
curl
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://tdengine.com/llms-full.txt'
② 索引文件真伪 https://www.tdengine.com/llms.txt 404 text/html 167,499 https://www.tdengine.com/geo-audit-probe-a4889888a41d1e0234b216bd 404 不适用 HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致
curl
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://www.tdengine.com/llms.txt'
③ 全文通道 https://www.tdengine.com/llms-full.txt 404 text/html 167,499 https://www.tdengine.com/geo-audit-probe-a4889888a41d1e0234b216bd 404 不适用 HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致
curl
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://www.tdengine.com/llms-full.txt'
② 索引文件真伪 https://docs.tdengine.com/llms.txt 404 text/html 11,754 https://docs.tdengine.com/geo-audit-probe-932b5f726d49409a6edfd2ee 404 不适用 HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致
curl
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://docs.tdengine.com/llms.txt'
③ 全文通道 https://docs.tdengine.com/llms-full.txt 404 text/html 11,754 https://docs.tdengine.com/geo-audit-probe-932b5f726d49409a6edfd2ee 404 不适用 HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致
curl
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://docs.tdengine.com/llms-full.txt'
② 索引文件真伪 https://api.w.org/llms.txt 404 text/html 146 https://api.w.org/geo-audit-probe-bc068fb5ed0e33b3d0e9098b 404 不适用 HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致
curl
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://api.w.org/llms.txt'
③ 全文通道 https://api.w.org/llms-full.txt 404 text/html 146 https://api.w.org/geo-audit-probe-bc068fb5ed0e33b3d0e9098b 404 不适用 HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致
curl
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://api.w.org/llms-full.txt'
② 索引文件真伪 https://tdengine.com/docs/llms.txt 200 text/html 28,515 https://tdengine.com/geo-audit-probe-a189f33efd6989223a942916 404 读错 请求的是文本文件,实际返回 HTML(content-type: text/html,28488 字符);用 Accept: */* 再量一次,状态码、正文类型都一致
curl
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://tdengine.com/docs/llms.txt'
③ 全文通道 https://tdengine.com/docs/llms-full.txt 200 text/html 28,515 https://tdengine.com/geo-audit-probe-a189f33efd6989223a942916 404 读错 请求的是文本文件,实际返回 HTML(content-type: text/html,28488 字符);用 Accept: */* 再量一次,状态码、正文类型都一致
curl
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://tdengine.com/docs/llms-full.txt'
② 索引文件真伪 https://www.tdengine.com/docs/llms.txt 200 text/html 28,515 https://www.tdengine.com/geo-audit-probe-a4889888a41d1e0234b216bd 404 读错 请求的是文本文件,实际返回 HTML(content-type: text/html,28488 字符);用 Accept: */* 再量一次,状态码、正文类型都一致
curl
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://www.tdengine.com/docs/llms.txt'
③ 全文通道 https://www.tdengine.com/docs/llms-full.txt 200 text/html 28,515 https://www.tdengine.com/geo-audit-probe-a4889888a41d1e0234b216bd 404 读错 请求的是文本文件,实际返回 HTML(content-type: text/html,28488 字符);用 Accept: */* 再量一次,状态码、正文类型都一致
curl
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://www.tdengine.com/docs/llms-full.txt'
② 索引文件真伪 https://docs.tdengine.com/docs/llms.txt 404 text/html 11,754 https://docs.tdengine.com/geo-audit-probe-932b5f726d49409a6edfd2ee 404 不适用 HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致
curl
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://docs.tdengine.com/docs/llms.txt'
③ 全文通道 https://docs.tdengine.com/docs/llms-full.txt 404 text/html 11,754 https://docs.tdengine.com/geo-audit-probe-932b5f726d49409a6edfd2ee 404 不适用 HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致
curl
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://docs.tdengine.com/docs/llms-full.txt'
② 索引文件真伪 https://api.w.org/docs/llms.txt 404 text/html 146 https://api.w.org/geo-audit-probe-bc068fb5ed0e33b3d0e9098b 404 不适用 HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致
curl
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://api.w.org/docs/llms.txt'
③ 全文通道 https://api.w.org/docs/llms-full.txt 404 text/html 146 https://api.w.org/geo-audit-probe-bc068fb5ed0e33b3d0e9098b 404 不适用 HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致
curl
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://api.w.org/docs/llms-full.txt'
② 索引文件真伪 https://tdengine.com/.well-known/llms.txt 404 text/html 167,499 https://tdengine.com/geo-audit-probe-a189f33efd6989223a942916 404 不适用 HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致
curl
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://tdengine.com/.well-known/llms.txt'
② 索引文件真伪 https://www.tdengine.com/.well-known/llms.txt 404 text/html 167,499 https://www.tdengine.com/geo-audit-probe-a4889888a41d1e0234b216bd 404 不适用 HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致
curl
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://www.tdengine.com/.well-known/llms.txt'
② 索引文件真伪 https://docs.tdengine.com/.well-known/llms.txt 404 text/html 11,754 https://docs.tdengine.com/geo-audit-probe-932b5f726d49409a6edfd2ee 404 不适用 HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致
curl
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://docs.tdengine.com/.well-known/llms.txt'
② 索引文件真伪 https://api.w.org/.well-known/llms.txt 404 text/html 146 https://api.w.org/geo-audit-probe-bc068fb5ed0e33b3d0e9098b 404 不适用 HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致
curl
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://api.w.org/.well-known/llms.txt'
⑤ .md 通道 https://tdengine.com/ 不适用 未声明「任意页面加 .md」约定
⑥ 可点击路径 https://www.tdengine.com/ 读错 2 条死链 / 0 条活
⑥ 可点击路径 https://www.tdengine.com/pricing 读错 4 条死链 / 1 条活
⑥ 可点击路径 https://www.tdengine.com/changelog 404 text/html 167,499 不适用 起始页抓不下来:HTTP 404 / status_404
curl
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://www.tdengine.com/changelog'
⑥ 可点击路径 https://docs.tdengine.com/ 读错 2 条死链 / 0 条活
⑥ 可点击路径 https://www.tdengine.com/help 404 text/html 167,499 不适用 起始页抓不下来:HTTP 404 / status_404
curl
curl -sSL -A 'geo-audit/0.1.0 (+https://github.com/wangtoone/geo-audit; contact: 152046194+wangtoone@users.noreply.github.com)' 'https://www.tdengine.com/help'

别人的工具会怎么误判你

三种可自动检出的误判形态。这一块是零发现报告真正的付费点:你拿到的 0 与别处拿到的 0,来源不一样。

  1. 你的真文件会被读成「没有」:WAF / 限流会把纯 HTTP 客户端拦掉(实测 gusto.com 403、www.pipedrive.com 429);真文件在子域或 /docs 下而根路径 404 或软 404(实测 minimax、moonshot、siliconflow、onfleet、canvasmedical、ecwid 六家)。
  2. 你的 0 死链会被读成「有死链」:站上有 Cloudflare 的 /cdn-cgi/l/email-protection 诱饵 href、有 example.com 占位、有 Alpine/Vue 的 :href、有 {templateID} 这类模板占位。实测:这类噪声能让死链数从 25 虚报成 42(+68%)。
  3. 你的 0 死链其实是假的 0:你的站对未知路径返回 200 或 302 而不是 404(实测 developers.pipedrive.com 的 24,907 B 兜底页、docs.gusto.com 与 docs.moderntreasury.com 的 302→首页、platform.kimi.ai 的 414,072 B Quickstart 页)。这种站上任何只看状态码的死链工具都会报 0 死链,那个 0 是假的。我们是用正文/骨架比对得出的 0,所以我们的 0 是真的。

裸域 / www 双向探测

tdengine.com
ok · ok_control_discriminates
www.tdengine.com
ok · ok_control_discriminates
结论
both_ok single_case

证据强度 single_case:全语料只有一例(brevo 的裸域返回 Vercel 的纯文本 DEPLOYMENT_NOT_FOUND,而 www 与 developers 子域都正常)。n=1 不够格进首页计数,所以这一区单列。

被去噪排除的链接

逐条留痕,带 rule_id。实测教训:五个批次排除了 /cdn-cgi/l/email-protection、另几个批次没排 —— 同一个东西两套口径,所以这里必须逐条列。

本次没有被去噪排除的链接。

朴素对照全表

同一批已抓响应上的两个读数:左边只用「跟完跳转的最终状态码」推,右边是我们的判定。朴素侧不额外发一个请求 —— 它是换算器,不是第二次扫描。

只有 ① 入口发现 / ② 索引文件真伪 / ③ 全文通道 三段的位置进这张表;④⑤⑥ 的差异化走下面那行死链口径对比。

有分歧 0 条。

探测位置朴素方法那种实现会说实际是有分歧多打的请求方向
https://tdengine.com/ 不在朴素探测集内 它往这个 host 打过请求(只打了两条根路径) 对照探测 https://tdengine.com/geo-audit-probe-a189f33efd6989223a942916 返回 HTTP 404 / text/html,与本响应可区分,判为真实内容 n 1 一致
https://www.tdengine.com/ 不在朴素探测集内 它往这个 host 打过请求(只打了两条根路径) 对照探测 https://www.tdengine.com/geo-audit-probe-a4889888a41d1e0234b216bd 返回 HTTP 404 / text/html,与本响应可区分,判为真实内容 n 1 一致
https://docs.tdengine.com/ 不在朴素探测集内 它从没往这个 host 打过请求 对照探测 https://docs.tdengine.com/geo-audit-probe-932b5f726d49409a6edfd2ee 返回 HTTP 404 / text/html,与本响应可区分,判为真实内容 n 2 一致
https://api.w.org/ 不在朴素探测集内 它从没往这个 host 打过请求 对照探测 https://api.w.org/geo-audit-probe-bc068fb5ed0e33b3d0e9098b 返回 HTTP 404 / text/html,与本响应可区分,判为真实内容 n 2 一致
https://tdengine.com/llms.txt GET https://tdengine.com/llms.txt,跟随跳转,只看最终状态码 未采纳(404) HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致 n 1 一致
https://tdengine.com/llms-full.txt GET https://tdengine.com/llms-full.txt,跟随跳转,只看最终状态码 未采纳(404) HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致 n 1 一致
https://www.tdengine.com/llms.txt GET https://www.tdengine.com/llms.txt,跟随跳转,只看最终状态码 未采纳(404) HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致 n 1 一致
https://www.tdengine.com/llms-full.txt GET https://www.tdengine.com/llms-full.txt,跟随跳转,只看最终状态码 未采纳(404) HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致 n 1 一致
https://docs.tdengine.com/llms.txt 不在朴素探测集内 未采纳(没探这个位置) HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致 n 2 一致
https://docs.tdengine.com/llms-full.txt 不在朴素探测集内 未采纳(没探这个位置) HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致 n 2 一致
https://api.w.org/llms.txt 不在朴素探测集内 未采纳(没探这个位置) HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致 n 2 一致
https://api.w.org/llms-full.txt 不在朴素探测集内 未采纳(没探这个位置) HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致 n 2 一致
https://tdengine.com/docs/llms.txt 不在朴素探测集内 未采纳(没探这个位置) 请求的是文本文件,实际返回 HTML(content-type: text/html,28488 字符);用 Accept: */* 再量一次,状态码、正文类型都一致 n 2 一致
https://tdengine.com/docs/llms-full.txt 不在朴素探测集内 未采纳(没探这个位置) 请求的是文本文件,实际返回 HTML(content-type: text/html,28488 字符);用 Accept: */* 再量一次,状态码、正文类型都一致 n 2 一致
https://www.tdengine.com/docs/llms.txt 不在朴素探测集内 未采纳(没探这个位置) 请求的是文本文件,实际返回 HTML(content-type: text/html,28488 字符);用 Accept: */* 再量一次,状态码、正文类型都一致 n 2 一致
https://www.tdengine.com/docs/llms-full.txt 不在朴素探测集内 未采纳(没探这个位置) 请求的是文本文件,实际返回 HTML(content-type: text/html,28488 字符);用 Accept: */* 再量一次,状态码、正文类型都一致 n 2 一致
https://docs.tdengine.com/docs/llms.txt 不在朴素探测集内 未采纳(没探这个位置) HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致 n 3 一致
https://docs.tdengine.com/docs/llms-full.txt 不在朴素探测集内 未采纳(没探这个位置) HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致 n 3 一致
https://api.w.org/docs/llms.txt 不在朴素探测集内 未采纳(没探这个位置) HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致 n 3 一致
https://api.w.org/docs/llms-full.txt 不在朴素探测集内 未采纳(没探这个位置) HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致 n 3 一致
https://tdengine.com/.well-known/llms.txt 不在朴素探测集内 未采纳(没探这个位置) HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致 n 2 一致
https://www.tdengine.com/.well-known/llms.txt 不在朴素探测集内 未采纳(没探这个位置) HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致 n 2 一致
https://docs.tdengine.com/.well-known/llms.txt 不在朴素探测集内 未采纳(没探这个位置) HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致 n 3 一致
https://api.w.org/.well-known/llms.txt 不在朴素探测集内 未采纳(没探这个位置) HTTP 404(状态码正确,正文形态不参与判定);用 Accept: */* 再量一次,状态码、正文类型都一致 n 3 一致

死链口径对比:只看首跳状态码(>= 400 即判死)会数出 1 条;我们经去噪与正文比对后是 8 条链接实例。

覆盖披露

位置数 30 · 抓到的页面 3 个 · HTTP 请求 124 / 上限 120(其中不同 URL 43 个;差额是跳转每一跳、robots.txt 与重试)

链接账本:抽取 129 = 排除 0 + 待人工 0 + 已验证 4 + 无法判断 2 + 被封顶截掉 123

本次未触发抽样。

robots.txt 的 Disallow 我们遵守了:命中的路径零请求,判「无法判断(robots_disallowed)」。「我们没被允许看」是真话。

LLM 调用 0 次(这个工具零 LLM、零 API key,所以它恒为 0)。

查了什么

不查什么(摘要,理由见「方法」)

这些地方我们想看但没看到

没有额外的覆盖缺口。

方法,与不检查什么

这个工具零 LLM、零 API key。判定全部来自 HTTP 观测 + 同域随机路径对照探测 + 正文/骨架归一化比对。下面两张表是范围本身,不是免责声明。

首页大字只用位置数,条目数单列 —— 位置数回答「链路哪几段走不通」,条目数回答「有几条要改」,两个数不能互相顶替。

「未能评估」与「没问题」在这份报告里严格分开:Status.UNKNOWN 永不折算成通过。实测依据:help.spoton.com 与 docs.lawmatics.com 的文档站是纯 JS SPA,它们的「零发现」是抓取能力问题,不是站点干净。

报告里凡提到「那类实现会读错」,措辞一律是「只探根路径、不做对照探测的实现」——我们没有拿任何一款现成产品跑过对照,所以不会替它们下结论。

做什么

实测理由
C3 · AI 检索链路体检llms.txt / llms-full.txt 是真文件还是软 404、全文通道是不是索引的字节副本、索引里列的链接活着几条、「任意页面加 .md」这个约定兑现了没有。每一条都配同域随机路径对照探测。
C1 · 人和爬虫共用的可点击路径seed 页上抽取的 <a href>,点了就 404 的那些。带 23 条去噪规则与两级根因归并。

明确不做,以及为什么(引实测,不重新论证)

实测理由
过期信号整类(含附录)通用旧年份正则:batch1 扫出 134 条命中、真信号 0;CN 批扫出 296 处、真信号 2。两批独立同结论。而且还高假阴 —— snipcart 的真信号 「© All rights reserved, Snipcart inc. 2023」被自家正则的 inc. 句点截断漏掉。三条收窄规则没有命中率、没有假阳性率、没有回归用例,三样全无。
事实冲突(套餐名枚举 / 同页矛盾 / 档位↔功能映射)8/72、6/72 这些数是人工逐域推出来的,自动化版本从来没跑过,这一整块的假阳性率是空的。且「属性对」这个单位实测伸缩 15 倍(bigcommerce 把一整张套餐枚举记成 1 对,baseten 把同型 GPU 表记成 17 对,together 14 个模型记成 37 对)。
锚点腐烂(#xxx 在目标页不存在)本轮未做系统性检测,只偶得 1 例(gusto #minimum-api-version)。命中率未知。不做的理由是实现成本,不是命中率低。
通用定价页↔文档数值比对15 个域完全没有可比面(必然 0);单位不可定义;20% 的冲突以 llms.txt 为一侧(已否决功能)。
定期扫描 / 健康分订阅中位数落在 1–2 条区间,73.6% 的站报不出 3 条。注意:「两次扫描之间没有新增」是无证据的时序断言(全部数据是单一时间点横截面),准确表述是「我们没有纵向数据,无法承诺订阅价值」。
托管 web 版(输入任意域名就发请求的公开端点)它会让 --contact 这条合规约束当场失效,且等于开放抓取代理。
浏览器渲染 / Playwrightuvx 一行可跑是硬需求;Playwright 要另外 playwright install(约 300 MB)。已量化的代价:确认的 JS 盲区只有 help.spoton.com 与 docs.lawmatics.com = 2/72 = 2.8%。这两家判 UNKNOWN,绝不判「干净」。
--serve 本地表单页HTTP server 是纯 scope creep + 安全面。非命令行用户走 GitHub Action。