机器人流量:它是什么、为什么重要、以及如何过滤它
并非对您网站的每个请求都来自人类。网络流量的很大一部分是由机器人生成的——自动程序,为各种目的访问网站。如果您的分析将机器人访问与人类访问一起计算,您依赖的每个指标都被夸大和扭曲了。
了解哪些机器人访问您的网站、哪些是无害的、如何将它们从您的分析中过滤出来,可以获得真正反映真实用户如何与您的内容交互的数据。
机器人实际上在您的网站上做什么
机器人访问网站的原因很多,其中大多数是合法的。最常见的类型:
搜索引擎爬虫
谷歌机器人、必应机器人和其他搜索引擎蜘蛛爬取您的页面以在搜索结果中索引它们。如果没有这些机器人,您将无法排名。它们通常在用户代理字符串中清楚地标识自己,遵循您的 robots.txt 指令,并以受控速率访问。这些是好机器人,应该从您的人类流量分析中排除,但永远不要被阻止爬取。
社交媒体预览机器人
当您在 Twitter、LinkedIn 或 Facebook 上发布链接时,该平台会发送一个机器人来获取您页面的开放图谱元数据以生成链接预览卡。这些访问是瞬间的,从不在您的页面上超过一瞬间。
监控和正常运行时间机器人
UptimeRobot、Pingdom 和 Better Uptime 等服务定期检查您的网站是否响应。这些会产生有规律、可预测的流量——如果您的分析没有过滤它们,则会导致"访客"计数虚高。
安全扫描器和爬虫
不太受欢迎的类别。安全扫描器探测您的网站以查找漏洞。内容爬虫未经许可复制您的页面。垃圾机器人寻找要滥用的联系表格。这些机器人可能会也可能不会标识自己,它们会为您的分析添加噪声,同时也可能是一个潜在的安全问题。
AI 训练爬虫
一类较新的机器人,爬取网站以收集大型语言模型的训练数据。它们经常使用 GPTBot、ClaudeBot 或 CCBot 等用户代理字符串来标识自己。内容丰富的网站的流量可能很高。
机器人流量如何扭曲您的分析
机器人影响每个核心指标:
- 页面浏览量:由机器人爬取的每个页面虚高。彻底的爬取可以每个会话访问数百个页面。
- 会话:每个不与真实用户共享会话的机器人访问都会创建一个虚拟会话。
- 跳出率:访问一个页面然后离开的机器人被计为跳出,人为地推高了跳出率。
- 会话时长:机器人通常不会在页面上停留。它们接近零的会话时长拉低了您的平均参与度。
- 地理位置数据:来自数据中心 IP 范围(AWS、Google Cloud、Azure)的机器人显示为来自特定城市的访客,扭曲了您的位置细分。
综合效果可能会使网站看起来不如实际情况那样吸引人,导致对内容质量和受众兴趣的错误结论。
分析工具如何检测和过滤机器人
机器人检测在多个层面运作。首先是用户代理匹配——大多数表现良好的机器人在用户代理字符串中标识自己,包含"bot"、"spider"、"crawler"、"fetch"等单词或机器人名称。针对维护列表的模式匹配可以捕获大多数。
第二层是 IP 范围匹配。已知的爬虫,如谷歌机器人和必应机器人,从已发布的 CIDR 范围运行。将传入请求 IP 与这些范围进行匹配会捕获可能无法清楚标识自己的机器人。
第三层捕获 UA 欺骗机器人:如果同一 IP 在短时间内向同一网站发送超过阈值数量的请求——例如,5 分钟内 30 多次点击——无论其用户代理声称什么,它的行为都像机器人。基于速率的检测可以捕获伪装成浏览器的爬虫。
statpx 自动过滤机器人——您的数据仅显示真实用户
statpx 使用三层机器人检测(UA 模式、IP 范围、基于速率的检测)将机器人流量排除在您的参与指标之外。机器人流量页面让您准确检查过滤了什么。
免费获取干净的分析数据 →最后总结
机器人流量是任何公共网站生活中的一个事实。关键是确保您的分析自动将机器人点击与人类访问分开,以便您根据真实用户的实际行为做出决策——而不是包括爬虫流量的虚高数字。定期查看您的机器人流量报告,以发现异常峰值,这可能表明新扫描器发现了您的网站或进行了异常活跃的爬取。