伪装(Cloaking)是指向爬虫展示一个版本的页面,而向人类访客展示另一个版本。这就是完整定义,它涵盖了两种经常被混淆、但截然不同的做法:一种是会受到 Google 处罚的欺骗性技术,另一种则是大多数大型网站都会执行的常规过滤步骤,却通常不会有人称其为伪装。
了解自己在做的是哪一种很重要,因为其中一种会让你失去搜索可见性,而另一种则是让机器人流量不影响你的数据的方式。
SEO 中的伪装是什么?
Google 使用的定义
在搜索领域,伪装是指为了改变页面排名,向 Googlebot 提供与普通用户所见不同的内容。向爬虫展示堆砌了大量关键词的页面,同时向访客展示照片图库,就是典型案例。
这违反了 Google 的垃圾内容政策,处罚结果是从索引中移除。 这不存在灰色地带,也没有任何“聪明”的变体能够长期有效。
为什么仍然有人尝试
因为它看起来似乎能在几周内奏效。某个页面会为它本不应获得的关键词排名,流量随之而来,然后网站会毫无预警地从搜索结果中消失,而且几乎没有轻松恢复的方法。收益是暂时的,代价却是永久性的。
如果你正在为搜索优化页面,诚实的答案是:爬虫和访客应该看到相同的内容。
链接路由中的伪装是另一个问题
这个词也被用于与搜索排名无关的场景:决定自动化请求访问链接时会收到什么,与真实用户会收到什么之间的差异。
你在社交平台上发布的每个链接,都会在被用户访问之前,且通常甚至会替代用户访问,而被机器抓取。预览生成器、安全扫描器、垃圾信息过滤器、监测服务和爬虫都会请求该 URL。其中一些会如实表明身份,许多则不会。
为什么要进行过滤
有三个原因,均与搜索排名无关。
衡量。 如果访问你链接的请求中有三分之一来自自动化程序,那么你的点击数就是虚构的,基于这些数据做出的每一个决策都会出错。将机器与用户区分开来,是分析数据与噪音之间的区别。
预览控制。 当链接被分享时,预览由读取你页面元数据的爬虫生成。控制该爬虫收到的内容,就是控制预览卡片的方式,这是发布链接时正常且预期的组成部分。
防止抓取。 对所有请求都返回完全相同内容的链接,很容易被大规模采集。过滤自动化请求是标准做法,其背后的逻辑与市场上所有限流器和机器人管理产品相同。
界限在哪里
以下是关键区别,值得准确说明。
过滤自动化流量以保持分析数据干净并防止内容被抓取,属于常规基础设施。为了发布原本会被拒绝的内容,而向平台审核系统提供欺骗性内容,则是另一回事;它违反平台条款,并且会使账户面临风险,而不是保护账户。
我们不会为第二种情况构建产品,也不会推荐这样做。如果某个目标页面无法通过平台审核,正确做法是修改目标页面,而不是隐藏它。这是更困难的答案,也是唯一经得起执法团队审查的答案。
LinkScale 实际做什么
我们的过滤层针对第一种情况构建:区分机器和用户,并对它们进行不同处理。
| 到达的请求 | 收到的内容 | 原因 |
|---|---|---|
| 真实访客 | 你的页面,并将其路由至自己的浏览器而非应用内 Webview | 缩短访客与目标页面之间的步骤 |
| 预览爬虫 | 用于预览卡片的干净元数据 | 链接在分享时显示正确 |
| 数据中心请求、代理或已知爬虫 | 中性响应 | 它不是访客,因此不应被计入访客数据 |
路由部分与过滤同样重要。落在社交应用内置浏览器中的访客没有登录账号,也没有保存的支付信息,因此同一个页面会因打开位置不同而产生不同的转化效果。我们在 什么是深度链接 中详细介绍了这一机制。
流量质量才是有价值的输出
区分机器与用户的重点不在于区分本身,而在于之后得到的数字。
排除自动化请求后,你的点击数才具有意义。你可以诚实地比较各个平台,了解哪个来源带来了真正到达的用户,并停止根据虚高数据优化营销活动。我们的流量质量页面介绍了我们使用的信号,分析功能则介绍了你可以查看的数据。







