实测了20个站点的结构化数据,发现GEO在技术上就卡在这三点
最近把手头几个项目的站点都跑了一遍结构化数据审计,大概20个域名,行业跨度挺大。说几个技术层面绕不过去的点,都是实测出来的。
一、Schema.org 标记的完整度,直接影响 AI 能不能正确抽取实体
我拿 Article + FAQPage + Organization 三套标记做了对照。只挂 Article 的站点,在被 AI 摘要引用时,实体识别错误率明显偏高——作者、发布时间、机构归属经常抽错或者直接空着。补全 Organization 的 sameAs、founder、logo 之后,识别准确率肉眼可见地上升。
具体操作上,别只写 @type,属性要填全。很多人的 FAQPage 只写 mainEntity 的 name 和 text,漏了 acceptedAnswer 里的 @type,结构化解析直接就断了。
二、页面性能不是玄学,LCP 超过 2.5s 的页面被引用的概率低很多
我统计了抓取日志里 AI 爬虫的访问行为,发现一个规律:LCP 在 1.8s 以内的页面,爬虫回访频率差不多是慢页面的 2 倍。它不只看一次,会反复来确认内容有没有更新。
所以 CDN、图片格式(WebP/AVIF)、字体加载策略这些老生常谈的东西,在 GEO 场景下权重反而更高了。CLS 也要控制,我见过因为布局偏移导致正文被误判为广告区域的案例。
三、robots.txt 和 meta 标签的配置,很多人自己把路堵死了
这个最冤。有些站为了防采集,把 GPTBot、ClaudeBot、PerplexityBot 全 Disallow 了,然后回头问为什么 AI 搜索没流量。还有 noarchive、nosnippet 这些标签,挂上去等于主动放弃被摘要的机会。
建议单独建一个 AI 爬虫的白名单策略,和传统搜索引擎分开管理。
补充一个细节:llms.txt 这个规范目前还在早期,但我观察到部分 AI 工具已经开始读取。我按官方格式给两个站点加了,收录速度有变化,但样本量太小,不敢下定论,有同样在试的可以交流。
总结一下我的判断:GEO 现在被讲得太玄,落到工程层面其实就是结构化数据、性能、爬虫可访问性这三件事。内容质量是前提,但技术不达标,内容再好也传不出去。
想问问大家:你们在实操里,结构化数据这块是用模板批量生成,还是每个页面手写?批量生成的话,怎么保证字段不踩坑?
