/posts/geo-ai-mtzn8ayd-d707
GEO优化

从工程师视角聊聊GEO:结构化数据才是AI引用的硬通货

技术宅阿杰 6 0 4

最近看到社区里不少人在讨论GEO,但很多都停留在“内容为王”的层面。作为一个在深圳写代码的,我想从技术实现角度泼点冷水:没有正确的结构化数据,你的内容再好,AI也读不懂。

上个月我给公司官网做了一次彻底的GEO技术审计,说几个真实发现:

1. Schema.org标记不是可选项,是必选项

我们之前只有基础的Article标记,AI抓取时经常把作者、发布时间搞混。后来我手动补了@graph嵌套,把Organization、WebSite、BreadcrumbList、Person全部关联起来。用Google的Rich Results Test跑了一遍,错误从23个降到0。两周后,ChatGPT引用的摘要里终于带上了正确的公司名和作者信息。

2. 页面速度直接决定AI爬虫的抓取深度

我拿公司博客做了个AB测试:A组是默认配置,LCP 3.8s;B组我上了CDN+图片懒加载+关键CSS内联,LCP压到1.2s。用日志分析AI爬虫(GPTBot、ClaudeBot)的抓取记录,B组的平均抓取页面数比A组高47%,而且B组被引用的段落更完整。AI爬虫没耐心,加载慢它直接跳。

3. 内容分块要配合语义标签

很多人写文章喜欢用<div>堆砌,AI根本分不清哪段是结论、哪段是论据。我的做法是:每个核心观点用<section>包裹,配<h2>标题,关键数据用<data>标签标注。这样AI提取答案时,准确率明显提升。实测同一篇文章,优化后AI引用的段落与原文核心观点吻合度从62%提到了89%。

4. 别忽略llms.txt和robots.txt的AI爬虫规则

我见过有站点直接在robots.txt里把GPTBot全站屏蔽了,然后抱怨AI不引用。还有,llms.txt虽然还没成标准,但提前放一个精简版的内容索引,对AI理解站点结构有帮助。

踩过的坑:

  • 一开始用JS动态渲染Schema,结果AI爬虫不执行JS,标记全丢。后来改成SSR才解决。
  • 图片alt属性写得太随意,AI把配图当成了正文内容,引用时张冠李戴。

我的判断:
GEO的底层是技术基建。内容质量决定上限,但结构化数据和性能决定AI能不能“够得着”你的内容。现阶段,技术优化带来的边际收益远大于盲目堆内容。

你们在技术层面遇到过哪些AI爬虫的奇葩行为?比如不执行JS、忽略meta标签之类的,评论区聊聊,我看看能不能一起排查。

登录后可以为帖子点赞,但本帖内容对所有人开放阅读。

社区回应

0 Replies

还没有回应,抢一个沙发。

登录后可以回应和点赞,但本帖内容对所有人开放阅读。