WordPress网站如何通过Schema和llms.txt优化LLM信息抓取

WordPress网站如何通过Schema和llms.txt优化LLM信息抓取
最近在帮一个做本地服务的客户优化网站时遇到了一个挺有意思的问题客户的主营业务是管道维修但 ChatGPT 和 Gemini 这类大语言模型在抓取网站信息时总是显示一个已经停用的旧联系电话。客户很困惑明明网站页脚和联系页面都更新了为什么 AI 还是抓到了历史数据这个问题背后其实是一个很多站长还没意识到的新挑战传统的 SEO 主要针对搜索引擎爬虫但如今越来越多的大语言模型LLM也开始抓取网页内容。它们抓取的方式、理解信息的逻辑和传统爬虫不太一样。如果网站没有针对 LLM 做专门优化就很容易出现信息过时、内容误解甚至关键信息被忽略的情况。而解决这个问题的关键就在于两个新兴的优化点Schema 结构化数据和 llms.txt 文件。前者帮助 LLM 更准确地理解网站内容的结构和含义后者则像是对 LLM 的“使用说明”告诉它们哪些内容可以抓取哪些需要谨慎处理。这篇文章我会结合 WordPress 这个最常用的建站系统详细拆解如何通过 Schema 和 llms.txt 的配合让你的网站不仅对搜索引擎友好更能成为 ChatGPT、Gemini 等大语言模型“喜欢”的信息源。1. 为什么传统 SEO 不够用了LLM 抓取逻辑的三大变化过去我们做 SEO核心是让搜索引擎爬虫能顺利抓取、解析页面内容然后通过关键词密度、外链、用户体验等指标提升排名。但 LLM 的抓取逻辑有几个根本不同1.1 从“匹配关键词”到“理解语义关联”传统搜索引擎爬虫更关注关键词的出现频率和位置而 LLM 是通过理解整个段落的语义来提取信息。比如管道维修客户的案例中旧电话号码可能存在于某个历史页面的 HTML 注释中搜索引擎爬虫通常会忽略注释内容但 LLM 可能会把注释里的信息也当作有效内容抓取。这意味着我们需要确保网站上的每一个公开文本都是当前有效的。任何过时信息即使藏在代码注释、隐藏元素或历史版本中都可能被 LLM 抓取并当作事实使用。1.2 从“页面权重”到“信息可信度”搜索引擎排名很大程度上依赖于页面权重Domain Authority, Page Authority但 LLM 在提取具体事实时更关注信息本身的清晰度和一致性。如果同一个网站在不同页面提供了矛盾的信息比如联系页面是新号码但页脚忘记更新LLM 可能会选择抓取出现频率更高的那个版本而不是判断哪个更权威。这就要求我们在整个网站范围内保持关键信息的一致性不能只更新重点页面而忽略边角位置。1.3 从“爬虫协议”到“内容指引”robots.txt 是给搜索引擎爬虫的指令文件告诉它们哪些目录或文件不能抓取。但 LLM 不一定遵守 robots.txt它们需要更明确的指引——这就是 llms.txt 的作用。llms.txt 不是简单的禁止抓取列表而是告诉 LLM哪些内容是最新且可靠的哪些是历史存档仅供参考哪些是用户生成内容需要谨慎对待。这是一种更细粒度的内容管理方式。2. Schema 结构化数据让 LLM 看懂你的网站内容Schema.org 是一套标准化的词汇表用来给网站内容添加语义标记。通过 Schema我们可以明确告诉 LLM“这段文字是公司名称”、“这个是联系电话”、“那个是服务范围”。2.1 选择与业务最相关的 Schema 类型对于本地服务类网站如管道维修最重要的 Schema 类型是LocalBusiness及其子类型。以下是一个最小化的示例{ context: https://schema.org, type: HomeAndConstructionBusiness, name: 城市管道维修, description: 专业提供管道安装、维修、疏通服务24小时应急响应, telephone: 86-138-0013-8000, areaServed: [北京市, 天津市], serviceType: 管道维修, address: { type: PostalAddress, streetAddress: 朝阳区某某路123号, addressLocality: 北京市, addressRegion: 北京, postalCode: 100000 } }关键字段说明type: 选择最具体的业务类型如Plumber比LocalBusiness更精确telephone: 确保这是当前唯一有效的联系电话areaServed: 明确服务范围避免 LLM 错误推荐给非服务区用户serviceType: 用标准术语描述服务内容2.2 在 WordPress 中实现 Schema 的三种方式方式一使用 SEO 插件推荐给大多数用户主流 SEO 插件如 Rank Math、Yoast SEO 都支持 Schema 标记。以 Rank Math 为例安装并激活 Rank Math进入 Rank Math → Titles Meta → 全局 Meta → Schema 图形选择“企业”或“本地企业”类型填写公司名称、Logo、联系电话等基本信息在页面/文章编辑器中可以为特定内容添加更详细的 Schema这种方式适合不想接触代码的用户但灵活性相对有限。方式二使用专用 Schema 插件如果网站内容类型复杂如同时有产品、服务、活动、文章等可以考虑专用 Schema 插件如 Schema Pro、Schema App。优势是能创建更复杂的 Schema 结构支持动态数据填充但需要付费购买。方式三手动代码添加适合有开发能力的用户在主题的header.php或通过 WordPress 钩子添加function add_local_business_schema() { if (is_front_page()) { // 只在首页添加 $schema [ context https://schema.org, type HomeAndConstructionBusiness, name get_bloginfo(name), telephone 86-138-0013-8000, // ... 其他字段 ]; echo script typeapplication/ldjson . json_encode($schema) . /script; } } add_action(wp_head, add_local_business_schema);手动添加的优势是完全可控但需要确保 JSON 格式正确且及时更新。2.3 Schema 部署后的验证与监控部署 Schema 后需要用工具验证是否生效Google 富媒体结果测试工具虽然主要针对搜索引擎但能检查 Schema 语法是否正确结构化数据验证器验证 JSON-LD 格式是否合规实际测试在 ChatGPT、Gemini 中直接提问“获取 [网站名] 的联系方式”看返回结果是否准确建议每季度检查一次 Schema 数据确保联系信息、服务范围等关键内容没有过时。3. llms.txt给大语言模型的“内容使用说明书”llms.txt 的概念类似于 robots.txt但专门针对大语言模型。它告诉 LLM 如何更负责任地抓取和使用网站内容。3.1 llms.txt 的核心指令解析一个完整的 llms.txt 文件可能包含以下内容# llms.txt - 大语言模型抓取指南 User-agent: GPTBot User-agent: ChatGPT-User User-agent: Google-Extended User-agent: Claude-Web User-agent: * # 允许抓取的范围 Allow: /wp-content/uploads/ Allow: /blog/ Allow: /services/ # 谨慎抓取的内容 Cautious: /user-comments/ # 用户评论可能包含不准确信息 Cautious: /archive/ # 历史存档内容信息可能已过时 # 禁止抓取的范围 Disallow: /wp-admin/ Disallow: /checkout/ Disallow: /user-profile/ # 内容使用指南 Content-usage: 引用时请注明来源和发布日期 Content-usage: 商业服务信息请以最新页面为准 Content-usage: 用户评论不代表官方观点 # 联系信息 Contact: webmasterexample.com Last-updated: 2024-06-15关键指令说明User-agent: 指定适用的 LLM*表示所有模型Allow/Disallow: 与传统 robots.txt 类似控制抓取范围Cautious: llms.txt 特有指令告诉 LLM 这些内容需要谨慎对待Content-usage: 指导 LLM 如何正确使用内容3.2 在 WordPress 中创建和部署 llms.txt步骤一创建 llms.txt 文件使用文本编辑器创建新文件根据上述模板填写适合你网站的内容保存为llms.txt步骤二上传到网站根目录通过 FTP 或 WordPress 文件管理器将llms.txt上传到与robots.txt相同的目录通常是网站根目录。步骤三验证可访问性在浏览器中访问https://你的网站.com/llms.txt确认能正常显示。步骤四在 robots.txt 中引用可选在现有的robots.txt中添加一行帮助搜索引擎发现这个文件# 引用 llms.txt Sitemap: https://你的网站.com/llms.txt3.3 llms.txt 的精细化配置策略不同内容类型的网站llms.txt 的配置重点也不同本地服务类网站如管道维修重点标记联系信息、服务范围、价格的准确性对用户评价区域添加Cautious指令明确服务条款和保障政策的有效性内容媒体类网站区分新闻稿、观点文章、专题报道的不同权威度对转载内容注明原始来源标记付费墙或订阅内容的访问限制电商类网站明确价格、库存信息的实时性要求对用户评价和问答区添加谨慎标记区分官方商品描述和用户生成内容4. Schema 与 llms.txt 的协同优化实战单独部署 Schema 或 llms.txt 都有价值但真正的效果来自于两者的协同配合。4.1 信息一致性检查确保 Schema 中标记的关键信息与 llms.txt 的指引一致。例如Schema 中的联系电话应该是当前唯一有效的号码llms.txt 应该标记包含旧联系方式的历史页面为Cautious服务范围、价格等关键信息在两个文件中保持一致可以建立定期检查清单每月核对一次关键信息的一致性。4.2 内容权威度分层通过 Schema 和 llms.txt 的配合实现内容权威度的分层管理高权威度内容官方信息首页、关于我们、联系页面服务介绍、价格说明公司资质、团队介绍中权威度内容常规内容博客文章、知识库案例研究、白皮书新闻动态低权威度内容用户生成内容用户评论、问答论坛讨论历史存档内容高权威度内容应该用详细的 Schema 标记并在 llms.txt 中明确推荐低权威度内容可以简化 Schema 标记并在 llms.txt 中添加谨慎提示。4.3 监控与迭代优化部署完成后需要建立监控机制主动测试定期在 ChatGPT、Gemini 中查询网站关键信息测试不同问法下的回答准确性检查竞争对手网站在 LLM 中的表现用户反馈收集在网站添加“发现信息错误”的反馈渠道监控社交媒体上用户关于网站信息的讨论关注客服收到的关于信息不一致的咨询数据分析通过 Google Search Console 监控富媒体结果的展示和点击分析用户通过 LLM 引流转化的路径和效果跟踪关键信息页面在 LLM 时代的内容表现5. 超越技术配置LLM 友好型网站的内容策略技术配置是基础但真正让网站在 LLM 时代脱颖而出的是内容策略的调整。5.1 创建 LLM 容易理解的页面结构LLM 更喜欢结构清晰、重点突出的内容标题层级要清晰H1 标签只出现一次明确页面主题H2 标签用于主要章节H3 用于子章节避免跳过层级如 H1 直接接 H3关键信息前置联系信息应该在页面靠前位置服务概述在文章开头明确给出避免把重要信息隐藏在长篇大论中避免过度优化不要为了 SEO 堆砌关键词LLM 能识别这种手法自然语言描述比格式化列表更容易被理解保持内容的可读性和逻辑性5.2 建立内容更新和归档机制确保 LLM 抓取到的是最新、最准确的信息建立内容生命周期管理明确每类内容的更新频率实时、每日、每周、每月、每季度设置内容过期提醒和自动归档机制对过时内容添加明确的时效性提示版本控制意识价格、联系方式等关键信息的变更要全网同步重大更新时考虑使用版本号或更新日志保留重要历史变更记录但明确标记为存档5.3 多渠道信息一致性管理LLM 可能会从多个渠道获取同一家公司的信息需要确保一致性统一官方信息源确定网站为最主要的信息发布渠道社交媒体、商业目录等平台的信息与网站保持同步建立信息变更的同步流程和检查机制监控第三方平台定期检查百度企业名片、天眼查等商业目录的信息准确性关注用户在企业点评平台发布的内容建立不实信息的纠正和申诉流程6. 常见问题与排查指南在实际部署过程中可能会遇到以下问题6.1 LLM 仍然显示过时信息排查步骤检查 Schema 标记是否正确部署且无语法错误确认 llms.txt 文件可正常访问且内容正确检查网站上是否还有其他地方存在过时信息包括代码注释、隐藏元素在多个 LLM 平台测试确认是普遍问题还是个别现象如果问题持续考虑通过 LLM 平台的反馈渠道报告问题解决方案彻底清理网站上的历史过时信息增强 Schema 标记的覆盖面和准确性在 llms.txt 中明确标记过时内容的存档位置6.2 不同 LLM 理解效果差异大原因分析各 LLM 对 Schema 和 llms.txt 的支持程度不同抓取频率和更新周期存在差异内容理解和优先级判断算法不同应对策略以主流 LLMChatGPT、Gemini为基准进行优化保持内容的清晰度和一致性减少歧义关注各 LLM 平台的官方文档了解最新支持情况6.3 流量提升但转化率下降可能原因LLM 直接回答了用户问题用户无需访问网站吸引来的流量与真实目标用户不匹配网站内容与 LLM 描述存在差距用户体验不佳优化方向在 llms.txt 中设置合理的内容展示边界确保网站提供比 LLM 摘要更深入的价值优化落地页的转化路径和用户体验从传统 SEO 到 LLM 优化的转变本质上是从“让机器找到你”到“让机器理解你”的升级。Schema 结构化数据是帮助 LLM 准确理解网站内容的语言而 llms.txt 则是告诉 LLM 如何正确使用这些内容的指南。最关键的其实不是技术实现的复杂度而是内容管理的严谨性。一个电话号码的过时、一个服务范围的模糊描述在传统搜索引擎时代可能只是影响个别页面的排名但在 LLM 时代可能会直接导致品牌信息的混乱。开始优化时不需要追求一步到位。可以先从最重要的联系信息和服务范围入手确保 Schema 标记准确再逐步完善 llms.txt 的指引。每季度做一次全面检查及时更新过时信息。这样积累下来你的网站就能在 LLM 时代建立持续的信息权威度。