如何创建与优化 llms.txt
AI 驱动的搜索与检索技术的兴起,从根本上改变了网站向机器分发内容的方式。对于现代大语言模型(LLM)而言,仅仅依赖传统的 HTML DOM 抓取已不再适用。
通过提供纯净的 Markdown 内容,实施 llms.txt 标准可大幅减少 40-60% 的 Token 开销。此外,将文件交付延迟保持在 200ms 以下,对于防止 AI 爬虫在初始域名发现阶段发生超时至关重要。
本架构指南将完整展示如何创建和优化 llms.txt 标准。从配置 robots.txt 指令,到将 /llms-full.txt 载荷控制在 200k Token 以内以契合 Claude 3.5 和 GPT-4o 的最佳摄取需求,助您全面掌握面向 AI 优先的内容分发技术。
深入理解 llms.txt 标准
快速解答:/llms.txt 标准为 AI 爬虫提供了一个标准化的 Markdown 目录,从而绕过了原始的 HTML DOM 抓取。AnswerShaper 的方法论利用该协议实现了 40-60% 的 Token 开销削减。通过将 /llms.txt 中的路由与 /llms-full.txt 中的深度摄取分离,我们确保了 LLM 的最佳上下文窗口对齐与精确的知识图谱消除歧义(Knowledge Graph Disambiguation)。
/llms.txt 的核心规范
官方 llms.txt 规范与标准建立了一套确定性协议,用于将文档直接暴露给大语言模型。通过将该文件与标准 robots.txt 指令 一同放置在根目录下,域名可提供专门针对 AI 摄取格式化的机器可读映射。这种结构化方法消除了传统网络抓取的噪声,直接向 RAG 向量相似度引擎输送高信号数据。
当 AI 爬虫(GPTBot、ClaudeBot、PerplexityBot)访问域名时,解析原始 HTML DOM 结构会带来巨大的计算资源浪费。在 /llms.txt 与 /llms-full.txt 规范 中采用严格的 Markdown (MD) 格式与语法,相比抓取原始 HTML DOM,在 /llms.txt 中使用纯净 Markdown 可经证实地减少 40-60% 的 Token 开销。这种效率直接改善了模型处理内容并将其映射至内部知识图谱消歧管线的方式。
服务器基础设施必须在初始域名发现期间优先保证这些路由文件的快速交付。工程团队必须将 /llms.txt 文件交付延迟控制在 200ms 这一基准之下,以防止 AI 爬虫在初次探测域名时超时。若未能达到该阈值,爬虫将降级为标准的 HTML 抓取,从而抵消了 上下文窗口优化(Context Window Optimization) 带来的计算优势。
/llms-full.txt 的作用
主 /llms.txt 充当轻量级路由目录,而 /llms-full.txt 文件则作为用于深度模型摄取的整合数据载荷(Payload)。根据 Anthropic 爬虫规范,提供单一、拼接完整的 Markdown 文件可让模型在单次调用中无缝处理整套文档集。这种分离设计防止了上下文碎片化,并强化了相关技术概念之间的 JSON-LD Schema 节点桥接(Node Bridging)。
为了保持高检索准确率,工程师必须执行严格的上下文窗口对齐,要求 /llms-full.txt 的数据载荷保持在 100k-200k Token 以下,以实现 Claude 3.5 和 GPT-4o 的最佳摄取效果。超出此限制会削弱注意力机制从文档载荷中间召回特定事实的能力。AnswerShaper 建议将体量过大的文档集拆分为模块化的 /llms-full.txt 文件,并通过主路由文档进行映射,以保持向量保真度。
| 摄取架构 | 目标响应延迟 | 引用概率 | Schema 与节点自动化 |
|---|---|---|---|
| 原始 HTML DOM 抓取 | >800ms(高开销) | 低(向量碎片化) | 手动提取 |
/llms.txt(路由) |
<200ms 基准 | 高(直接映射) | 自动化节点桥接 |
/llms-full.txt(数据载荷) |
<500ms(流式传输) | 最高(纯净 Markdown) | 原生 RAG 向量对齐 |
AI 爬虫摄取架构
快速解答:AnswerShaper 的摄取方法论将 AI 爬虫从标准 robots.txt 指令直接路由至 /llms.txt 和 /llms-full.txt 端点。通过在低于 200ms 的延迟基准内提供纯净的 Markdown 载荷,该架构完全绕过了原始 HTML DOM 抓取。这种结构化数据流确保了 LLM 的确定性知识图谱消除歧义与最佳上下文窗口对齐。
GPTBot 和 ClaudeBot 的抓取机制
现代 AI 爬虫(GPTBot、ClaudeBot、PerplexityBot)在执行全站深度遍历前,会先扫描根目录配置文件以启动域名发现流程。遵循 官方 llms.txt 规范与标准,这些智能体会寻找能绕过标准 HTML DOM 抓取噪声的结构化端点。这种直接路由建立了即时的 JSON-LD Schema 节点桥接,使爬虫无需执行 JavaScript 即可提取核心实体。
从原始 HTML 过渡到严格的 Markdown (MD) 格式与语法,可在摄取期间减少 40-60% 的 Token 开销。这种效率通过最大化提取载荷的语义密度,直接赋能上下文窗口优化。正如 OpenAI GPTBot 文档 中所述,提供干净、预处理过的文本可确保下游 RAG 向量相似度匹配具备更高的保真度。
对于全量域名摄取,/llms.txt 和 /llms-full.txt 规范明确了向基础模型交付聚合内容的方式。工程师必须执行上下文窗口对齐,确保 /llms-full.txt 载荷保持在 100k-200k Token 以下,以实现 Claude 3.5 和 GPT-4o 的最佳摄取。遵循 Anthropic 爬虫规范 可防止内容截断,并确保在整个数据集范围内实现确定性的知识图谱消除歧义。
[AI 爬虫请求] (GPTBot / ClaudeBot / PerplexityBot)
│
▼
[域名根目录] ───(检查 1)──▶ [robots.txt] (验证 Allow/Disallow 指令)
│
├──(检查 2)──▶ [/llms.txt] (低于 200ms 的低延迟交付)
│ │
│ └──▶ [Markdown 载荷] (减少 40-60% Token 开销)
│
└──(检查 3)──▶ [/llms-full.txt] (上下文窗口对齐)
│
└──▶ [聚合 MD] (< 100k-200k Tokens)
配置 robots.txt 指令
发现管线依赖明确的 robots.txt 指令将自治智能体引导至优化后的 Markdown 端点。搜索工程师必须配置这些规则以显式允许 AI User-Agent,同时映射出 /llms.txt 文件的确切路径。这种配置可防止爬虫在无关的 CSS 或 JavaScript 资产上浪费算力周期,从而专注于高信号文本的提取。
基础设施必须支持 200ms 以下的 /llms.txt 文件交付延迟基准,以防止 AI 爬虫在初次域名探测时超时。如果服务器响应超出该阈值,爬虫将放弃该结构化端点,并回退到消耗大量 Token 的标准 HTML 抓取方式。保持极低的交付延迟可确保初次握手成功将优化载荷推入模型的摄取队列中。
Markdown 格式化与语法规范
快速解答:AnswerShaper 的 /llms.txt 方法论依赖严格的 Markdown 格式与 YAML Frontmatter,以确保 AI 爬虫的确定性摄取。通过剥离 HTML DOM 元素,这种语义化结构可减少 40-60% 的 Token 开销,直接提升 RAG 向量相似度,并保证大语言模型的最佳上下文窗口对齐。
规范的 Markdown (MD) 格式与语法 是机器可读文档的基础层。当域名所有者配置 robots.txt 指令 指向这些文件时,必须确保服务器达到低于 200ms 的 /llms.txt 文件交付延迟,以防止 AI 爬虫在初始域名发现期间发生超时。这一严格的性能阈值确保了 AI 爬虫(GPTBot、ClaudeBot、PerplexityBot) 在执行深层站点遍历前,能够稳定访问并解析索引。
YAML Frontmatter 要求
官方 llms.txt 规范与标准要求使用 YAML Frontmatter 来为知识图谱消歧提供明确的元数据。该结构化头部使模型能够将项目依赖项、版本控制和规范 URL(Canonical URLs)直接映射到其内部语义网络中。
---
title: AnswerShaper 技术文档
description: AI 搜索优化的核心规范。
version: 1.0.4
urls:
- https://answershaper.com/api/docs
---
通过嵌入此类元数据,工程师可以在原始文本与模型现有的实体数据库之间实现精准的 JSON-LD Schema 节点桥接。OpenAI GPTBot 文档 也明确支持这一做法,该文档优先推荐使用结构化元数据来实现精准的归属和索引构建。
面向 RAG 的语义结构化
语义化 Markdown 直接决定了检索增强生成(RAG)向量相似度计算期间所应用的文本分块(Chunking)逻辑。使用严格的 ATX 标题层级可构建确定性的边界;与原始 HTML DOM 抓取相比,在 /llms.txt 中采用规范的 Markdown 能实现 40-60% 的 Token 开销缩减。
## RAG 分块优化
- 向量对齐: 使用无序列表承载高密度事实信息。
- 代码块: 隔离代码语法以防止 Token 碎片化。
