GEO优化别整虚的:我用Lighthouse跑分,结构化数据才是AI搜索的硬通货
最近在社区里看到不少讨论GEO的帖子,很多都在聊内容策略、品牌露出,这些当然重要,但作为一个写代码的,我总觉得大家忽略了一个底层问题:AI搜索爬虫和传统爬虫在技术上到底吃哪一套?
上个月我给自己公司官网做了一轮GEO技术改造,数据挺有意思,分享出来给各位参考。
先说结论:结构化数据是GEO的地基
我拿公司两个产品页做了A/B测试。A页面保持原样,B页面加了完整的JSON-LD结构化数据(Product、FAQPage、BreadcrumbList),其他内容完全一致。
结果:在Google SGE和Perplexity里查询相关产品词,B页面被引用为信息源的概率是A页面的4.7倍。注意,不是排名提升,是被AI直接拿去当答案素材的概率。
这说明什么?AI搜索不是在“看”你的页面,而是在“解析”你的页面。你给它喂结构化数据,它就能精准理解实体、属性、关系,引用起来自然顺手。
页面速度的影响被低估了
另一个测试是页面速度。我用Lighthouse跑分,把B页面的LCP从4.2s优化到1.8s,其他不动。两周后观察AI爬虫的抓取频次,优化后的页面抓取频率提升了约60%。
有个细节值得注意:AI爬虫对TTFB(首字节时间)特别敏感。我抓过access log,TTFB超过800ms的页面,AI爬虫的二次抓取间隔明显拉长。传统搜索引擎可能还会忍你,AI爬虫直接减少访问。
具体怎么落地
我目前的做法:
- JSON-LD全覆盖:不只是首页,每个内容页都要有对应的Schema类型,Article、FAQPage、HowTo优先。
- 实体消歧:用sameAs指向Wikipedia、Wikidata等权威实体源,帮AI确认“你说的这个品牌就是那个品牌”。
- 语义HTML:别再用div堆页面了,article、section、nav、aside用起来,AI解析DOM树的时候能直接理解内容层级。
- 速度兜底:LCP<2.5s,TTFB<500ms,这是底线。用CDN+边缘缓存,静态化能上就上。
一个踩坑提醒
别用JS动态注入结构化数据。我试过用React的useEffect去插入JSON-LD,AI爬虫基本不执行JS,抓到的就是空壳。服务端渲染或者静态生成,老老实实把Schema写在HTML里。
这些技术活看起来枯燥,但效果是实打实的。内容策略决定AI愿不愿意引用你,技术基建决定AI能不能引用你。
想问问社区里做技术的朋友:你们有没有测过AI爬虫对robots.txt里Crawl-delay的遵守情况?我这边数据有点矛盾,想对比一下。
