ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

specification.website AI就绪篇:21条Agent Readiness规范,让你的网站被AI Agent读懂的完整攻略

specification.website AI就绪篇:21条Agent Readiness规范,让你的网站被AI Agent读懂的完整攻略 specification.website AI就绪篇21条Agent Readiness规范让你的网站被AI Agent读懂的完整攻略【免费下载链接】specification.websiteWebsite specification — HTML, accessibility, security, SEO, agent-readiness. Platform-agnostic, sourced, MIT.项目地址: https://gitcode.com/gh_mirrors/sp/specification.websitespecification.website 是一个平台无关的开源网站规范项目覆盖 HTML、无障碍、安全、SEO 与 AI 就绪Agent Readiness五大维度。本文带你完整梳理其中 21 条 Agent Readiness 规范——从 llms.txt、robots.txt 的 AI 爬虫策略到 MCP 工具发现帮助新手让网站被 AI Agent 顺利读懂、引用并调用。为什么 AI Agent 读你的网站和浏览器不一样先纠正一个常见误解AI Agent 不是更聪明的浏览器而是一个几乎不执行 JavaScript、只抓纯文本的读者。它会抓取页面、剥离导航和广告、解析链接与结构化数据然后把你的内容缓存、引用进回答里。如果你的关键内容藏在客户端渲染里、URL 每次发版都变、robots.txt 把主流 AI 爬虫全挡了门——那你在 AI 回答里就是不存在。Agent Readiness 就是解决这件事的一组规范 这 21 条规范并不互相独立它们与 SEO、无障碍高度重叠。做好它们搜索引擎和视障用户同时受益。21条Agent Readiness规范全景四大板块一张表看懂规范源码位于 src/content/spec/agent-readiness/每条都遵循统一结构是什么、为何重要、如何实现、常见错误、如何验证。按读懂 → 放行 → 发现 → 调用四个递进阶段分组阶段规范状态一句话说明 内容可读Stable URLs必须URL 是公开契约别让引用和缓存失效 内容可读Structured data for agents推荐JSON-LD schema.org 给 Agent 类型化事实 内容可读/llms.txt推荐站点根部的 Markdown 内容目录v2 可发现 内容可读/llms-full.txt可选关键页面全文拼接成一个大文件 内容可读Markdown source endpoints推荐每个页面提供 .md 原始源码端点 内容可读Machine-readable formats推荐提供 JSON / RSS / Markdown 端点 访问控制robots.txt for AI crawlers推荐按 User-Agent 精确放行/拦截各家 AI 爬虫 访问控制Content Signals可选robots.txt 中声明可否检索/摄取/训练 访问控制TDMRep可选机器可读地保留文本数据挖掘异议权 访问控制Web Bot Auth可选爬虫用密钥签名自证身份告别 IP 猜测 能力发现HTTP Link headers推荐响应头直接广播 llms.txt、sitemap 等资源 能力发现Agent Skills discovery推荐发布给 Agent 加载的短指令集 能力发现ARDai-catalog.json可选一个文件列全所有 Agent 能力 能力发现DNS-AID可选用 DNS 记录在 HTTP 之前暴露服务 能力发现OKF bundle可选整个知识库打包成 Markdown 概念树 能力发现Schemamap可选为每个资源单独暴露 JSON-LD 端点 交互调用MCP and tool discovery可选通过 MCP 向 Agent 暴露可查询工具 交互调用A2A agent cards可选用 agent-card.json 让 Agent 互相发现 交互调用NLWeb可选暴露 /ask 端点支持自然语言问答 交互调用WebMCP可选页面注册浏览器原生工具供 Agent 调用另含 1 条总览规范 Agent readiness overview共 21 条。核心速通先做哪 5 件事回报最高不用一次做完。新手按以下优先级落地前五项即可覆盖 80% 的 AI 可见度1️⃣ 稳住 URL一切引用都是基于它的Stable URLs是唯一的必须级规范。W3C 早在 1998 年就提出好 URI 不改变。Agent 会缓存你的 URL 作为引用一旦 404权威性随之崩塌。要点内容搬家就做 301 永久重定向别为了好看每版重构 URL。2️⃣ 发布 /llms.txt给 AI 一份精选地图/llms.txt 是放在站点根部的纯 Markdown 文件第一行站点名、引用块简介、若干##分组链接。注意两点常见误区它不是 robots.txt——不控制权限只是索引和邀请v2 新变化必须用Link: /llms.txt; reldescribedby; typetext/markdown响应头或 head 中的link广播它否则 Agent 只能靠猜路径。本项目的 /llms.txt 由 src/pages/llms.txt.ts 从同一内容集合自动生成与所有页面共用单一事实来源值得参考。3️⃣ 写清 robots.txt点名各家 AI 爬虫2026 年的主流 AI 爬虫都有署名 User-AgentGPTBot、OAI-SearchBot、ClaudeBot、Google-Extended、Applebot-Extended、PerplexityBot 等。默认全拦然后抱怨品牌在 AI 助手里没有存在感是最典型的错误。按需分条配置# robots.txt 示例精确控制 AI 爬虫 User-agent: GPTBot Allow: / User-agent: ClaudeBot Disallow: /private/4️⃣ 加 JSON-LD 结构化数据Agent 不擅长从散文里猜实体却可靠地解析 JSON-LD。在head里嵌入 schema.org 类型Article、Person、HowTo 等等于告诉 Agent这一页是关于什么的、谁写的、何时发布。5️⃣ 给每个页面提供 Markdown 源码端点给页面路径加.md后缀或支持Accept: text/markdown内容协商Agent 就能直接拿到无广告、无 DOM 噪音的原始内容省去 HTML 解析的有损往返。本项目通过 src/pages/spec/[category]/[slug].md.ts 为 168 个规范页全部提供 Markdown 镜像。进阶玩法让 AI Agent 主动找到并调用你的网站当内容可读之后真正的差异化在于可发现性与可调用性 用 HTTP Link 头广播资源Agent 可能根本不解析你的 HTML。在响应头里直接声明 sitemap、RSS、llms.txt 的Link关系是最稳的暗号。 部署 MCP 服务器把网站变成工具MCPModel Context Protocol让站点通过 JSON-RPC 向 Agent 暴露可查询工具。本项目就自带一个公开只读的 MCP 服务器提供search全文检索、get_topic取整页 Markdown、get_checklist审计清单等 5 个工具连接配置见 mcp/README.md。 Agent Skills 与 OKF 包一次抓走整个知识库Agent Skills discovery在/.well-known/agent-skills/下发布短小、有边界的指令文件Agent 加载后即可更好地操作你的站点OKF bundle把全部知识打包成一棵带类型化 front matter 的 Markdown 概念树Agent 一次抓取就能摄取整个语料库无需逐页爬取A2A agent cards / NLWeb / WebMCP分别面向Agent 互调、自然语言问答端点和浏览器内原生工具三个更前沿的场景标记为可选按需跟进。新手上手清单十分钟自查步骤用curl抓一个关键页面确认正文在初始 HTML里而非 JS 渲染后检查robots.txt是否明确列出要放行/拦截的 AI 爬虫确认/llms.txt返回 200 且结构符合 llmstxt.org 示例信息架构变更后必须同步更新——过期的 llms.txt 比没有更糟验证 JSON-LD 能被解析、URL 重定向链没有断点用浏览器 DevTools 的 Lighthouse 跑一遍其 agentic-browsing 检查项现在会报告 llms.txt 的存在与可发现性。结语AI 就绪不是玄学是基本功Agent Readiness 听起来很新但 21 条规范里绝大多数稳定 URL、语义化 HTML、结构化数据、清晰的 robots 策略本来就是一直就该做的网页基本功——AI 时代只是提高了它们的优先级。项目仓库中还有 CLAUDE.md 这份写给 Agent 的仓库协作指南、docs/okf-recon.md 的 OKF 落地调研以及 /checklist/ 页面提供的可勾选完整审计清单建议收藏逐条过一遍。先做前五件再逐步扩展——让你的网站从今天起成为 AI Agent 愿意引用、敢于调用的那一类网站。【免费下载链接】specification.websiteWebsite specification — HTML, accessibility, security, SEO, agent-readiness. Platform-agnostic, sourced, MIT.项目地址: https://gitcode.com/gh_mirrors/sp/specification.website创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表