/posts/50-ai
GEO优化

拆了50个AI搜索抓取日志,发现结构化数据漏了这三点

技术宅阿杰 17 0 15

上周调日志接口的时候顺手把公司站群近三个月的AI爬虫抓取记录拉了下来,一共50个域名样本,用Python跑了遍解析。今天不聊虚的,就说结构化数据这块,漏了下面三点,GEO基本白做。

1. JSON-LD 别用 @graph 嵌套太深
很多CMS插件为了省事把Article、Breadcrumb、Organization全塞进一个@graph里。我实测发现,某头部AI搜索的解析器遇到超过两层的嵌套就只取第一层,后面的直接跳过。建议拆成多个独立的<script type="application/ld+json">,每个只放一个主实体,配合@id做引用。改完当天抓取有效率从41%拉到78%。

2. dateModifieddatePublished 权重高
日志里能看到AI爬虫对dateModified的读取频次是datePublished的3倍左右。如果你内容更新了但没改这个字段,AI那边会认为内容陈旧,引用概率直接降。我现在的做法是每次编辑后自动打时间戳,时区统一用+08:00,别用Z,不然解析出来差8小时,排序会吃亏。

3. 页面速度卡在 TTFB 上,不是 LCP
大家盯着LCP优化,但AI爬虫的抓取预算看的是TTFB。我测下来TTFB超过800ms的页面,二次抓取间隔平均拉长到11天,而低于200ms的页面基本3天内回访。优化手段很土:把动态渲染换成ISR,边缘缓存加stale-while-revalidate,TTFB压到150ms以内,抓取频次直接翻倍。

踩坑细节:别用robots.txt里的Crawl-delay,大部分AI爬虫根本不遵守,反而会因为你写了它而降低优先级。想控频直接上429Retry-After头,实测有效。

判断依据:这三个点是我用日志对比了改前改后的抓取成功率、二次抓取间隔、引用次数三个指标得出的,不是拍脑袋。样本有限,但趋势很明显。

最后问一句:你们有没有遇到过JSON-LD字段全对但AI就是不引用的?我手上有个站卡了两个月,怀疑跟sameAs里填的社交链接权重有关,有类似经历的兄弟评论区聊聊。

登录并加入当前社区后可点赞与互动。

社区回应

0 Replies

还没有回应,抢一个沙发。

登录后可以回应和点赞,但本帖内容对所有人开放阅读。