跳转至

搜索、个性化与 SEO

13,693 字词 · 预计阅读 31 分钟(450 字词/分钟)

3

搜索、个性化与 SEO

SEO 无法自动化,除非你是想把它自动化到失败。

随着 AI 成为董事会会议室里人人谈论的热门词汇,营销人员和搜索引擎优化人员(SEO 人员)将面临适应这一变化格局的压力。营销人员和 SEO 人员已经看到,他们许多常用的工具正在采用 AI 技术。

许多 SEO 团队已经发现,通过将一些重复性较高的任务自动化,他们可以采用“先发布,后测试”的模式,从而更灵活地应对竞争对手的行动。利用 AI 自动执行 SEO 任务,可能会导致发布的内容违反品牌和合规标准。这对企业来说是重大风险,我们将在第 4 章《真实性与权威性》中详细讨论。

现在,我们先概览一下搜索和信息检索,以及 AI 如何融入这个庞大的数据网络。

搜索是一座巨型图书馆

“搜索”,甚至只是“google”,都是我们用来指代信息检索的词语。但搜索信息并借助某种结构检索这些信息的想法,并不是什么新鲜事。最早的信息检索系统始于 200 多年前,而数字信息检索的最初构想也已有 70 多年历史。下面是 1948 年一篇关于机械信息检索的论文中的一段引文:

“……有一种名为 Univac 的机器……字母和数字被编码为长条钢带上的磁点图案。通过这种方式,文档的文本连同其主题代码符号一起被记录下来……这台机器……会自动筛选并打印出以任何所需方式编码的参考资料,速度达到每分钟 120 个单词。”

——J. E. Holmstrom,1948 年1

1 JE Holmstrom(1948)。《第三节:全体会议开幕式》。载于《皇家学会科学信息会议,1948 年 6 月 21 日至 7 月 2 日:报告及提交论文》,第 85 页。

我们认为,有一点既有趣又能带来启发:信息检索原则的出现,远早于网络搜索引擎的诞生。

对于我们当中不太擅长科学的人来说,可以通过思考传统图书馆,把信息检索简化到最基本的层面。旧式卡片目录会提供书籍所在书库区域的信息,而杜威十进分类法则按照一种优先考虑主题内容、而非字母顺序的方式整理这些书籍。

尽管 Book Bot 之类的存储方式能够很好地最大化实体空间的利用率,并在档案保存条件下保护宝贵的历史资料,但也许更好的解决方案是随着时间推移,将所有这些书籍数字化。因为实体空间总会达到容量上限,而数字空间却会不断扩展。

随着对数字空间的需求不断扩大,信息检索方法也必须不断演进。从 10 个选项中选出“最佳答案”,远比从一百万个选项中选出答案容易。正是这种演进需求促成了 AI 的诞生。要理解 AI 如何影响 SEO 和内容营销,以及未来将如何继续产生影响,关键是先了解数字信息检索与 AI 的协作方式。

基于搜索的信息检索发展史

早期的搜索引擎技术只是使用完全匹配的关键词来“查找”文档,而且整体存储空间有限。最早的搜索引擎大约包含 10 万份文档(网页和可访问的文档)。3 这意味着,无论你进行什么搜索,比如“britney spears”或“causes of cancer”,搜索引擎都只能从这 10 万个资源中检索答案。许多非常早期的搜索最终会返回不到 10 个链接,而且这些链接并不全都相关。

3 http://infolab.stanford.edu/pub/papers/google.pdf

搜索引擎工程师知道这是个问题,于是设计了各种方法来帮助解决,但他们也清楚,最大的问题在于存储空间和信息的可用性。因此,他们不断扩充规模,增加资源,以便抓取越来越多的网页。

Google 明确表示,他们的目标是整理全世界的信息,并且一直参与许多旨在实现这一目标的项目。例如,Google Books 于 2004 年推出,通过图书馆项目与各家图书馆开展合作。

不过,该项目也面临挑战:有人提起诉讼,理由是 Google 将书籍数字化,并允许搜索者在未经出版商许可的情况下访问书籍的部分内容,违反了版权法。

提示

当 AI 获准使用受版权保护的内容进行训练时,就会在什么最有利于搜索与法律允许什么之间造成严重冲突。这一点之所以对 AI 很重要,是因为本书将在后续章节中加以讨论。

尽管面临这些挑战,Google Books 项目仍在继续。到 2019 年,Google 报告称,他们已经扫描了全球预计 1.3 亿种书名中的 4,000 万种4。5

4 https://blog.google/products/search/15-years-google-books/

5 https://www.pcworld.com/article/508405/google_129_million_different_books_have_been_published.html

到 2005 年,Google 的索引中总共约有 30 亿份文档,其中包括书籍。在最近的一次审判中,Google 作证称,其活跃索引中总共有约 4,000 亿份文档。图 3.1 展示了该索引规模随时间的增长情况。6 在 Google 开展这项工作的同时,Bing 和 Yandex 等其他搜索引擎也在做同样的事情。

Images

图 3.1 2010 年后 Google 索引增长的速度

6 https://zyppy.com/seo/google-index-size/

2010 年至 2020 年间索引量的大幅跃升,很大程度上源于 Google 对其系统进行的一项名为“Caffeine”的更新。这项更新提高了 Google 的索引速度,使新内容能够更快地被发现。

这改变了当时的 SEO 策略,使其重点转向“新鲜度”,因为 Google 对新内容的索引和排名速度更快,优先级也更高。后来,Google 对此进行了调整,允许常青内容(即使年代久远仍然保持相关性的内容)获得排名,但 SEO 人员早已纷纷跟风,认为不断产出新内容是获得良好排名的关键。这种谬误一直延续至今,Semrush 旗下网站 Exploding Topics 的一项统计就证明了这一点。该网站估计,“互联网上每天新增 4.0274 亿 TB 的数据”。7

7 https://explodingtopics.com/blog/data-generated-per-day

遗憾的是,对于内容营销人员来说,其中很大一部分数据都是由 AI 生成的。这几乎让人无法抗拒地想要批量产出海量 AI 生成内容。亚马逊云科技(AWS)的一组研究人员于 2024 年 6 月发表了一项研究,估计所有基于网络的文本中,有 57% 是由 AI 生成或通过 AI 算法翻译的。8 Amazon 仍在面临 AI 生成书籍被列出销售的问题。9 AI 专家兼政策顾问 Nina Shick 最近接受引述时表示,她认为到 2025 年的某个时候,90% 的在线内容将由 AI 生成。

8 https://arxiv.org/pdf/2401.05749

9 https://www.npr.org/2024/03/13/1237888126/growing-number-ai-scam-books-amazon

“我认为,到 2025 年,在线内容中由 AI 生成的比例可能会达到 90%,因此这项技术正呈指数级发展。我相信,大部分数字内容都将开始由 AI 生产。你看,ChatGPT……但还有大量其他平台和应用正在不断涌现。”10

10 https://finance.yahoo.com/news/90-of-online-content-could-be-generated-by-ai-by-2025-expert-says-201023872.html

——Nina Shick,AI 专家兼政策顾问

创建 100% 由 AI 生成的内容确实很诱人,但这是一个你不应掉进去的陷阱,因为这类内容可能会损害品牌的真实性,进而削弱品牌的权威性。第 4 章将进一步解释其中原因。

信息检索的搜索引擎演进

搜索引擎必须随着时代、可用的数字空间以及搜索者的需求不断演进。随着互联网上随时可获取的信息越来越多,搜索引擎必须设法为这些信息建立目录,并让普通人能够访问。

可用数据的爆炸式增长,使旧有的关键词匹配系统完全失效。

有一段时间,搜索引擎采用了其他方法。其中一种叫作 TF-IDF(词频–逆文档频率),采用词汇分析方法,只关注某个词在页面上出现的次数。这对某些搜索很有用,但当搜索内容是“windows”这类需要搜索引擎考虑上下文的词时,效果就不那么好了。如果算法无法判断你搜索的是家里的平开窗,还是 Microsoft Windows,就只能同时显示两类结果。

较新的模型采用一种称为“向量空间建模”的机器学习概念,将对象(例如文本)表示为令牌。令牌是一个表示数值的数学术语。令牌可以是文本、概念、图像,或任何能够定义的事物。向量空间建模会在代数方程中为每个令牌分配一个值。这些值之间可能具有不同的长度(以线条表示)或距离(以空白表示)。最重要的是要理解,这些长度和距离表明各个令牌彼此之间有多相似或多不同。通过在多维空间中对这些向量进行建模,模型可以显示哪些令牌之间的关联最为紧密。

通过使用向量来表示内容,而不仅仅是使用内容中的词语,模型除了计算精确匹配之外,还能计算相似度和部分匹配。

简单来说,我们把这称为“语义搜索”或“实体搜索”。其理念是,搜索引擎对内容的“理解”足够深入,能够知晓不同概念之间的联系。

例如,这意味着你可以撰写一篇关于莎士比亚诗歌的文章,即使文中没有明确使用“十四行诗”这个词,搜索引擎仍可能在“莎士比亚十四行诗”的搜索结果中提供你的文章。向量空间建模会将十四行诗与莎士比亚,以及十四行诗与诗歌,连接为相关概念。看起来搜索引擎似乎理解了这种联系,但实际上,它所做的是计算相似概念的相对权重。

作为内容营销人员,你可以在文章中加入更多与“十四行诗”相关的关键词,例如“抑扬格五音步”,从而让内容更有利于搜索;这也会强化搜索引擎与“莎士比亚十四行诗”这一整体实体之间的联系。

正是这一整套流程,使 OpenAI 的 ChatGPT 和 Google 的 Gemini 等 AI 工具与助手能够生成有用且有帮助的结果。

向量空间建模基础

向量空间建模的一个经典例子是:将“巴黎”和“法国”与“波兰”配对时,会显示出它们与“华沙”之间的向量关系。这些词之间的向量差异捕捉到了“首都”这一概念,机器随后便能确定,“巴黎、法国”这一关系对应于“华沙、波兰”。从本质上说,这是一种利用机器解决词语联想谜题的方法,只不过规模极其庞大。

你可以在图 3.2 中看到,在向量建模图中,法国与波兰之间的距离很近。法国—巴黎与波兰—华沙之间的距离相同。二维向量图上看不到的额外维度是“首都”。如果你能想象有两条线从页面中延伸出来,分别连接波兰和法国,那么你可以想象,这两条线相交的点会标示“首都”。

Images

图 3.2 由 SERPrecon 提供支持的首都词向量可视化

图 3.3 展示了三维模型下向量空间中的情况。

Images

图 3.3 词向量散点图可视化

图 3.4 展示了另一个例子。

Images

图 3.4 由 SERPrecon 提供支持的导航中心词向量可视化

驾驶舱是飞机的导航中心。驾驶室是卡车的导航中心。飞机和卡车都是交通工具。所有这些词都根据彼此在概念上的距离相互连接起来;不过,再次想象一下多维空间中的情形,你就能看到图表上方还漂浮着其他点,分别表示“交通工具”和“导航”等概念。

让我们在图 3.4 的示例中再加入第三组词。在图 3.5 中,我们加入了“船”和“桥”,因为桥是船的导航中心。同样,船与桥之间的距离,与其他词语对之间的距离相近。想象一下那组虚拟的线条,以及悬浮在上方、连接所有这些不同导航中心的点。

如果你仔细观察图 3.4 和图 3.5 中的图表,就会发现“卡车”和“驾驶室”比另外两组词更接近。这可能是因为“驾驶室”也可以指另一种车辆,例如黄色出租车。由于存在多种连接,“卡车”和“驾驶室”这两个词的距离就更近了。

Images

图 3.5 由 SERPrecon 提供支持的三组导航中心词向量可视化

但是,“桥”既可以指船上的导航舱,也可以指跨越另一条道路或水域的高架道路,因此,让我们在图 3.6 中看看把桥理解为高架道路的例子。

Images

图 3.6 由 SERPrecon 提供支持的词语其他用法向量可视化

将这些元素结合起来时,“桥”和“船”实际上变得更加分离,因为加入如此多的额外元素会使各个连接彼此扩散得更远,如图 3.7 所示。这很好地说明了,如果向量空间模型没有掌握所有可用信息,就可能得出错误结果。换句话说,如果我们不知道图 3.7 中的所有词都存在,就很容易误以为“船”和“桥”像图 3.5 中那样彼此接近。

Images

图 3.7 由 SERPrecon 提供支持的关系增加词向量可视化

这些图表限制了我们能够展示的内容。向量空间存在于无限多个维度中,而一本书最多只能展示三个维度,因此你需要发挥一些想象力。

图 3.8 是图 3.7 的扩展示例:通过从“桥”向量中减去“道路”向量,再加回“船”向量,进行更复杂的算术可视化。

Images

图 3.8 由 SERPrecon 提供支持的复杂算术词向量可视化

现在,想象一下:如果你把“时装”加入“跑道”,或把“邮轮”加入“船”,还可以创造出多少额外维度;这样一来,你就很容易看出,多维体验会复杂到人脑无法处理。这正是机器学习要应用数学模型的原因。

可用数据是限制因素。正因为数据有限,内容营销人员不能指望 AI 和机器学习建立创作卓越内容所需的全部联系。正如作家会受到自己接触过的数据以及对某一主题知识广度的限制一样,大型语言模型(LLM)(进而 AI)也会受到可用数据的限制。

为什么搜索的现在和未来都以实体为基础

借助机器学习实现向量空间建模等进步,只是这项技术实现规模化后可能性中的冰山一角。接下来是 AI,具体来说,是结合生成式 AI(GenAI)的自然语言处理(NLP)。利用你在第 1 章“AI 对营销人员的影响”中了解到的、由机器生成的神经网络,搜索引擎可以在概念(实体)之间建立几乎无限的联系,并利用这些信息生成更有效的搜索结果。

你可能已经在 Google 的生成式 AI 搜索结果中看到过这一点。Google 于 2023 年开始测试这一功能,自 2024 年起称其为 AI 概览(AIO)。11

11 https://blog.google/products/search/generative-ai-search/

AI 概览利用 Google 的大型语言模型中的数据,直接在搜索引擎结果页(SERP)上生成详细的搜索结果,而不只是提供包含相关信息的网站链接。没有 AI 概览时,搜索结果会如图 3.9 所示。

Images

图 3.9 没有 AIO 的 Google 搜索结果页

有了 AIO 后,页面如图 3.10 所示。

Images

图 3.10 带有 AIO 的 Google 搜索结果页

在这个例子中,Google 将搜索词“木材”替换成了“硬木”。这很重要,因为有些木地板并不是由硬木制成的,但排名前十的所有结果都把“木地板”称为“硬木地板”。这很好地说明了,AI 可能会让多数人的观点凌驾于事实准确性之上。

随着 AIO 出现得越来越频繁、篇幅越来越长,传统搜索结果会被推到页面更下方,使特定网站更难获得展示,更不用说被点击了。这要求我们彻底改变衡量 SEO 的方式,我们将在第 8 章“AI、分析与人的洞察”中讨论这一点。

这并不意味着你应该放弃传统的搜索排名。同一项研究发现,在规模较小的 36,000 个关键词样本中,排名前十的 SERP 结果中有一个或多个被纳入 AIO 的比例达到了 99.5%。如果你能进入排名前 3,或者如图 3.11 所示进入第 1 名,根据“SEOClarity 研究”侧栏中的信息,情况会更好。

Images

图 3.11 某一排名类别出现在 Google AIO 中的比例(数据来自 seoClarity)

如图 3.11 所示,在 SERP 中取得较高排名,也有助于提升在 AIO 中的可见度。SEO 并没有消亡,其重要性一如既往。

检索增强生成(RAG)

尽管图 3.11 所示的数据很有说服力,但需要注意的是,幕后发生的事情更加复杂。

在最近于马德里举行的 Search Central Live 活动上,Google 确认,AIO 主要由大型语言模型生成,而不是由 AIO 旁边显示的可点击页面(图 3.12 中以蓝色突出显示)生成。

Images

图 3.12 Google.com 上“花粉是什么”的 AIO 搜索结果页

Google 解释说,他们使用一种称为检索增强生成(RAG)的技术。RAG 利用可点击页面上的信息,为 AI 的回答“提供依据”。由于这些页面通常已经在相关查询中取得了较高排名,Google 认为它们是高质量来源,可以信赖它们对大型语言模型生成的答案进行“事实核查”。

RAG 通过运用信息检索原理,扩展特定主题的可用信息,从而改变生成式 AI 与大型语言模型之间的交互方式。尽管大型语言模型使用的是静态训练数据,RAG 技术却能让它在得出结果之前,从其他来源收集新信息。采用这一策略后,生成结果的生成式 AI 就可以利用其他已经存在、并经过 Google 索引流程审核的内容,对大型语言模型写出的内容进行实时“事实核查”。

这有两个方面的重要意义:

  • ◆ 这强化了 Google 的说法:由于内容首先由大型语言模型生成,因此他们在 AIO 中并未侵犯版权。

  • ◆ 通过利用 Google 系统中的前十个结果为 AIO“提供依据”,他们也承担了一项风险:搜索引擎一开始选出的前十个网页可能并不“正确”。

RAG 并不是一项新技术;事实上,它已经应用于各种 AI 实现中。正如你在第 1 章中了解到的,RAG 常用于减少幻觉,即错误结果。它的成功程度各不相同,取决于用于为结果“提供依据”的数据。

让我们来看一个简单的例子。假设你想不起 1995 年由 Al Pacino 主演的电影《Heat》中有哪些演员。图 3.13 展示了对“安吉丽娜·朱莉出演了《Heat》吗”的搜索。

Images

图 3.13 Google.com 上“安吉丽娜·朱莉出演了《Heat》吗”的 AIO

生成这一 AIO 的大型语言模型缺少以搜索意图形式存在的关键数据。在此之前,我搜索过“《Heat》是哪一年上映的”,Google 很有帮助地回答说是 1995 年。如果 Google 的大型语言模型在这个例子中使用 RAG,将我的搜索历史与当前查询联系起来,它本可以给出更好的答案。预计这一点会随着时间推移而改善。

图 3.14 展示了一个例子:如果我们搜索影片中的真实演员 Ashley Judd,大型语言模型就能利用 RAG 数据,更有效地为回答提供依据。

Images

图 3.14 Google.com 上“阿什莉·贾德出演了《Heat》吗”的 AIO

通过使用 RAG 为大型语言模型提供依据,Google 终于弄清楚了我在搜索什么。但如果把搜索历史纳入 RAG 模型,他们同样也可以针对 Angelina Jolie 得出正确结果。

让我们实现个性化

现在你已经了解了 AI 借助机器学习运行的基本原理,在理解搜索引擎如何使用这项技术方面,你已经领先一步。理解大型语言模型的工作方式,以及它们受到所存储数据量的限制,对于主张在人类参与下开展内容营销和 SEO 至关重要。大型语言模型只能根据可用向量,预测下一个最有可能出现的元素。个性化是 AI 助手和 AI 智能体能够实现的下一个要素,但它也存在一些问题。

许多最重要、最有用的数据并不在网站上,而是存在于科学文献、用户行为数据或付费墙背后的信息中。

你的医生之所以告诉你,在来就诊前不要“用 Google 搜索”自己的症状,是有原因的;搜索引擎无法比肩某一特定专科的执业医生所具备的诊断能力。至少目前还不能。

如果你回想一下上一节讨论的那些多维模型,然后开始加入搜索历史、位置、购买行为和人口统计信息等额外的个人信息层,你或许就能想象出,这些数据最终可以变得多么强大。

曲棍球界有句俗语:不要滑向冰球所在的位置,要滑向冰球将要到达的位置。

虽然这是曲棍球界的一句流行俗语,但它同样适用于 SEO。几十年来,SEO 从业者一直围绕当时最热门的新趋势制定策略。很长一段时间里,热门的是互惠链接,后来变成了客座文章,再后来则是作者身份。经验丰富的 SEO 从业者明白,追逐闪亮的新事物只能奏效一时,但最终它会失去光泽,或者搜索引擎会进行调整,让它不再有效。面对每一种新策略,关键在于进行批判性思考:搜索引擎在哪里、如何使用这些数据来改进结果?这是一个可扩展的概念吗?搜索引擎能否将其应用于数百万个网页和文档?如果这两个问题中有任何一个答案是否定的,那么它很可能只是短视的策略,而不是长期战略。

此前,我们曾以 Google 的 Caffeine 更新和内容新鲜度为例,讨论过这种情况如何实际发生。对新鲜内容的追求,导致 SEO 从业者不断产出越来越多的内容,即使有些旧内容其实只需更新即可。归根结底,有许多 SEO 概念有助于解释搜索引擎如何选择结果,但它们并不是能够直接执行、用来获得更高排名的策略。

当前 SEO 内容发布领域最前沿的一个绝佳例子,是生成式引擎优化(GEO)这一概念。其理念是,既然如今有些人开始把 ChatGPT 或 Perplexity 等工具当作搜索引擎,那么你就可以通过某些方式优化网站,使其出现在这些工具的结果中。

这种想法充其量是被误导的,也暴露出对大型语言模型工作方式缺乏理解。正如我们在第 1 章以及本章前文所讨论的,大型语言模型受到可用数据的限制。这意味着,如果你希望在 ChatGPT 对“综合表现最好的笔记本电脑是什么”这一问题的回答中占据一席之地,就需要通过独立评测网站赢得这一位置。ChatGPT 的最新版本甚至会在针对这一问题组织回答时显示“正在搜索网页”。

当被问及信息来源时,ChatGPT 会列出一些顶级评测网站的名称(图 3.15)。

Images

图 3.15 ChatGPT(OpenAI,2025)的提示词与回答

图 3.15 中提到的评测网站,与 Google 结果中 prominently 出现的评测网站相同;ChatGPT 使用 Google 认为高度可信的同一批来源,并不令人意外。事实上,许多 SEO 从业者报告称,ChatGPT 经常利用 Google 搜索来完善回答;此外,外部链接和提及也仍然是排名时衡量权威性和真实性的重要信号。

GEO 只是给同一个老过程起了一个时髦的新名称,并没有带来其他实质性变化。

现在,你已经了解了大型语言模型是什么、如何工作,Google 如何生成 AIO,以及如何批判性地评估 SEO 策略;让我们把这一切整合起来:

  • ◆ 我们知道,搜索引擎受到其能够索引和存储的数据量限制。

  • ◆ 我们还知道,搜索引擎通过提取实体,并利用大型语言模型处理数量庞大的实体和概念,提升了理解网站和网络内容的能力。

  • ◆ 随着搜索引擎利用大型语言模型扩展数据集,它们会寻求更多数据,以形成更好的结果。这意味着,它们会利用一切可用来源,尽可能多地收集数据。

以医生诊断疾病为例,Google 或其他搜索引擎可以创建一种 AI,将目前只有在相关内容属于网络信息时才能处理的医学和科学数据纳入其中。如果 Google 能够访问哈佛医学院目前教授的所有教材中的内容,会怎么样?现在,他们急于为书籍建立索引的原因可能就开始变得清晰了。你已经可以看出,Google 想要为你“扮演医生”:搜索“我的喉咙为什么疼”之类的短语,看看 AIO 结果如何详细列出喉咙可能疼痛的所有原因(图 3.16)。

Images

图 3.16 Google.com 上“我的喉咙为什么疼”的 AIO 搜索结果页

Google(Gemini)、Apple(Siri)以及其他开发 AI 助手和 AI 智能体的公司,都在努力尽可能深入地了解你。十多年来,这些助手一直在利用你的位置和人口统计数据、搜索历史,甚至你的电子邮件内容(如果你使用 Gmail),为你投放相关广告,并提供更好的搜索结果。

Google 再也不必猜测你想要的是平开窗,还是微软 Windows。Google 助手知道,周六你去了 Best Buy,并用 iPhone 上的 Apple Pay 买了一台新笔记本电脑。所以,你当然想要的是新软件,而不是建筑房屋的产品。

想象一下,从世界各地每部手机、每个系统中收集的数据能够发挥出多大的力量。由 AI 提供信息支持的虚拟助手,其能力还只是初露锋芒。作为消费者,这可能会让人有些害怕;作为营销人员,这让我们能够以前所未有的方式进行精准定位并传递信息。

AI 助手

Gemini 等 AI 助手已经开始融入本章介绍的一些能力。

想想你上一次使用搜索引擎查找信息时的情形,以及你提出了哪些类型的查询。也许你当时想在观看百老汇演出前决定去哪里吃饭。你的搜索查询可能如图 3.17 所示。

Images

图 3.17 Google.com 上“百老汇的《汉密尔顿》在哪里演出”的 AIO 搜索结果页

现在你知道《汉密尔顿》正在纽约的理查德·罗杰斯剧院上演,下一步可能就是前往 Google 地图,搜索这家剧院(图 3.18)。

Images

图 3.18 maps.google.com 上“理查德·罗杰斯剧院”的地图结果

接着,进入 Google 地图后,你可能会点击“附近”,再选择“餐厅”(图 3.19)。

Images

图 3.19 在 maps.google.com 上搜索“Richard Rogers Theatre”并选择“餐厅”后显示的地图结果

然后,你大概会花几分钟浏览餐厅列表,查看菜单和评价,决定去哪家餐厅。完成这些步骤需要进行多次搜索,也要花上一些时间。有了 AI 助手,这个过程就会轻松、快捷得多。例如,用 Google 的 Gemini 进行同样的搜索,只需输入这样一个查询:

“周二晚上《汉密尔顿》开演前,Richard Rogers Theatre 步行范围内仍在营业、评价最好的意大利餐厅是哪家?”

Gemini 会给出类似图 3.20 的回答。

Images

图 3.20 在 Google.com 上使用 Gemini 进行详细查询后,包含 AI 概览的搜索引擎结果页(SERP)

Google 于 2024 年 5 月在 Google I/O 大会上发布了这项 Gemini 技术。13 通过一次查询回答包含多个部分的问题,这对搜索引擎而言是一项突破,但也只是初步展现了这项技术的潜力。

13 https://blog.google/products/search/generative-ai-google-search-may-2024/

如果你认同“滑向冰球即将到达的位置”这种前瞻思路,就不难猜到,Gemini 最终会将能否订位、具体饮食需求等因素纳入考虑。再进一步考虑个性化,Gemini 也许会知道你要和配偶一起去看演出,而你的配偶对虾过敏,于是建议你去一家更传统的意大利餐厅,因为那里的菜单上海鲜菜品较少。

SEO 从业者或内容营销人员究竟该如何针对这种极其具体的查询进行优化?答案是着眼于自己能掌控的因素。这些餐厅之所以出现在结果中,是因为它们被收录在观看《汉密尔顿》时的用餐指南中,而且在 Google 上的用户评价都很高。Tony’s 餐厅还在自己的网站上注明,其位置就在剧院区。正如我们在上一章所讨论的,只要认真考虑客户的需求,SEO 从业者和内容营销人员都可以精心组织网站内容,让网站出现在高度细分、个性化的搜索结果中。

将 AI 融入 SEO 工作

如果你想让自己的网站在 Google 上持续保持相关性,规则仍然和过去一样:

  • ◆ 创作引人入胜的内容。

  • ◆ 提供独特的产品或服务。

  • ◆ 成为满足用户需求的最佳答案(想想用户的搜索查询)。

虽然 AI 可以通过建议内容写法或应纳入的关键词,帮助你朝这些目标迈进,但它目前还无法充分考虑上一节所讨论的那类高度个性化的查询。

有人问 Google 高级搜索分析师 John Mueller,一家公司需要做些什么才能获得良好的搜索排名,他回答:“做到出色。”14

14 https://x.com/JohnMu/status/905343694391439361

即使有了 AI,这条建议在今天也再贴切不过。AI 技术和工具能帮你简化一些耗时的流程,更快地处理数据,并将工作分配给多个团队。但它并非万能解药。那些大量依赖 AI 提供服务、撰写内容和与客户互动,却不让人参与其中的公司,终将失败。AI 或许能在一定程度上缩小竞争差距,让规模较小的团队也能高效处理大规模工作,但它无法替代真正的经验。

提示

考虑如何将 AI 融入工作流程,同时不减少你与客户或最终用户的接触,也不削弱彼此的联系。

在 SEO 工作中,你有很多方式可以运用 AI 工具。具体的提示词会变化,但随着工具不断演进,以下几点值得牢记。我们推荐的工具完整清单见附录 A“工具与资源”。

关键词研究

虽然 AI 工具可以预测哪些关键词最有可能吸引客户,并为你可能想使用的相关关键词提供参考,但它仍然受限于可用数据。Google 表示,所有搜索中有 15% 是此前从未有人搜索过的,15 而近 95% 的关键词每月搜索量不超过 10 次,16 因此,在关键词研究方面,没有哪种 AI 工具能完全比得上人的直觉。不过,如果你能让 AI 工具结合客户服务团队、客户邮件、调查以及其他关键词研究来源的数据,它就会强大得多。表 3.1 展示了关键词研究如何从传统方法转变为 AI 辅助方法。

15 https://www.google.com/intl/en/search/howsearchworks/how-search-works/

16 https://ahrefs.com/blog/long-tail-keywords/

表 3.1 关键词研究的新旧方法

流程

传统方法

使用 AI

收集

大量关键词来源

生成的主题及搜索量列表

查找

使用工具查询搜索量

使用 AI 工具查找向量相似度

分类

根据推断的意图对关键词分类

使用 AI 工具进行意图映射

结果

关键词及类别列表

所有页面的目标关键词及主题缺口列表

使用 AI 工具加强关键词研究策略,可以更快地判断所有关键词的意图和相似性,并在现有内容中找到与之匹配的内容(或发现没有匹配的内容)。

使用 AI 将关键词归入不同的内容集群,再结合用户行为进行分析,可以帮助你确定关键词的真实意图。我们在 LL Flooring 工作期间,就遇到过一个涉及“floor”和“flooring”这两个关键词的例子。传统关键词研究工具告诉我们,“floor”是更宽泛的词(属于信息型查询),而“flooring”更偏向交易型查询。实际上,情况恰恰相反。我们分析了通过这两个关键词进入网站的客户的点击率(CTR)和浏览路径,才发现这一点。搜索“flooring”的客户往往会浏览信息类资源,而搜索“floor”的客户通常会进入产品页面。我们通过人工研究发现了这一点,但不妨想象一下,如果当时能借助 AI 大规模开展这项研究,研究的效力会提升多少。

如果你使用的 SEO 工具还能提取搜索结果数据,就可以持续收集排名高于你的页面的信息,并将其与已有数据结合,不断迭代这一流程,确保关键词与意图准确匹配。

SERP 分析

SERP 是一个行业术语,指你进行在线搜索时出现的页面,即搜索引擎结果页。多年来,各种 SEO 工具一直在分析各个上榜页面包含哪些内容。这些工具主要关注每个页面有多少词、使用了哪些具体关键词,以及有多少链接指向这些页面。一些更先进的工具还会跟踪搜索结果页中各类特色展示的数量和类型,例如 AI 概览(AIO)、PAA(其他人还问了)、问答、视频、精选摘要、图片等。不过,有了 AI 技术,尤其是机器学习,这些分析就能覆盖更大的范围,并深入得多。使用 AI 工具进行 SERP 分析,是发现特定实体、关键词或概念并据此制定策略的好机会(表 3.2)。

表 3.2 SERP 分析

流程

传统方法

使用 AI

收集

定期抓取某一时点的搜索结果

持续、实时收集,并大规模汇总

竞争对手

人工审查,并对部分网站进行汇总分析

根据类型、反向链接和声量份额(SOV)识别并分组

排名波动

可显示数周或数月内的排名变化

通过近实时跟踪,及时发现排名波动带来的机会

SERP 特色展示

人工识别精选摘要、视频等

按关键词发现机会并分类

审计与技术 SEO

AI 工具非常适合开展初步审计,确保各个方面都得到检查。它可以提供一份类似核查清单的指引。但解读信息、确定优先级,以及根据数据提出可执行的建议,仍然需要人来完成。要大幅提升审计效能,可以使用具备反馈循环、能够持续从多种来源获取新数据的 AI 工具。这将有助于确定优先级,并在今后主动发现问题。

借助 AI 工具,SEO 团队可以更好地发现和缓解困扰网站的各种问题。本书并非技术 SEO 专著,所以我们只会简单提及这些问题。如果你不明白这些术语的含义,把这本书交给你的 SEO 团队就好。AI 已经部署在大多数主流服务器和云备份系统中。它可以用于检测意外的抓取错误、不受欢迎的机器人行为、响应时间异常,以及许多其他关键情况,为主动式 SEO 策略提供支持。不过,将这些专用 AI 工具纳入更大的框架后,团队就可以部署边缘解决方案(服务器端实现),在着手全面修复的同时,暂时解决其中许多问题。

不过,这类 AI 工具真正发挥优势的时候,是 SEO 从业者将数据反馈给它的时候。反馈可以有多种形式,既可以是来自 Google Search Console 和 Analytics 的定量数据,也可以是定性分析,例如“提高操作指南类博客页面的 CTR 后,销售额增至原来的 2 倍”。在这种情况下,AI 工具真正的价值在于,它可以充当集中存储信息的资料库。即使 SEO 从业者更换了,工具仍会保留那些表明操作指南类博客页面的 CTR 比其他页面的 CTR 更重要的数据。这可以促使 AI 工具在今后遇到类似机会时,据此确定优先级。

想象一下,你早上到公司,就能拿到一份按优先级排序的 URL 列表,其中列出了夜间发生故障的 URL,排序依据是 Googlebot 尝试抓取它们的频率。这已经成为现实。再想象一下,你还能将这份列表与这些页面在指定时间段内的销售数据进行交叉比对,并标出将在下一次促销活动中使用的页面。借助 AI 工具,这也将很快成为现实。表 3.3 列出了 AI 提高 SEO 审计效能的一些方式。

表 3.3 SEO 审计

流程

传统方法

使用 AI

抓取与分析

人工抓取并审查,可进行一定程度的趋势分析

持续抓取并分析趋势,使用自然语言处理(NLP)提出建议

内部链接

人工审查链接和锚文本

根据相关性和权威性信号推荐链接结构

技术问题

识别问题,但在确定优先级或大规模处理方面能力有限

根据工作流程和资源确定问题的优先级

结构化数据

如果你还没有使用 AI 来帮助你从内容中提取和创建结构化数据(有时也称为 schema 或微数据),那你就已经落后于行业发展了。结构化数据通过标记语言帮助搜索引擎理解页面内容。结构化数据有多种语言,但 SEO 从业者通常使用 schema.org 上的语言。使用结构化数据的好处在于,它能让 Google、Bing 及其他搜索引擎的 SERP 中显示各种“富结果”。这些结果可能包括星级评分、常见问题解答、产品详情、食谱和活动等。这些 SERP 特色展示为营销人员提供了脱颖而出的机会,从而提高 CTR。

尽管 AI 和大型语言模型不断进步,结构化数据似乎显得没那么重要,但事实恰恰相反,它比以往任何时候都更重要。结构化数据(表 3.4)仍将是向搜索引擎提供页面和内容附加数据的关键机会。事实上,在 2025 年 4 月 9 日于马德里举行的 Google Search Central Live 大会上,Google 的 John Mueller 提醒与会者,结构化数据对于排名仍然非常重要,并确认使用结构化数据能够提升 AI 理解网站的能力。17

17 https://x.com/aleyda/status/1909893624730370462

表 3.4 结构化数据

流程

传统方法

使用 AI

与页面内容保持一致

人工操作

使用自然语言处理(NLP)推荐匹配项

编码

人工确定数据类型并编写 JSON-LD(代码)

自动生成并插入数据

错误检测

使用 Google 站点地图或商业工具进行检测

自动识别并大规模修复缺失的数据类型

跟踪

使用 Google Search Console 或商业工具显示其是否出现在 SERP 中

与 SERP 跟踪集成,提供实时使用情况指标

内容

我们最喜欢的一种 AI 增强 SEO 项目的方式,就是用于内容创作。将 AI 能够提供的出色关键词研究和意图映射,与内容创作实践结合起来,可以大幅提升 SEO 效果。

在最基础的层面上,你可以使用 AI 分析目标关键词的 SERP,了解哪些内容最有可能取得良好竞争表现并引起搜索者共鸣,如何匹配搜索意图,应该使用哪些其他关键词,以及如何将该关键词归入整体内容集群。这些工作现在已经可以通过一些出色的 SEO 工具完成。

再说一次,AI 工具带来的最大好处是规模化。AI 工具可以非常快速地生成大量内容,达到大多数作者单凭个人力量无法实现的规模。不过,正如我们将在第 4 章“真实性与权威性”中讨论的,在创建基于 AI 的内容时,务必让人参与生成和编辑过程。

作为 SEO 从业者,如果你想大幅提升 AI 内容的效果,可以在作者使用的内容工具中花几分钟,尝试各种提示词,找到一个你作为 SEO 从业者认为合适的提示词。然后,你可以将这个特定提示词交给内容团队,作为起点。

生成式 AI 工具可以快速产出大量内容,其中有些甚至能很快获得排名。你还可以通过提示词,让 AI 工具使用特定关键词或标题。这听起来好得让人难以置信。

确实,这样的好事并不现实。

本书将说明,这种做法可能通过哪些途径造成严重问题。但这并不意味着你应该完全放弃使用 AI 内容。使用 AI 内容时,最重要的是让人参与编辑和审核。