区分机器人流量与真实访客会话的仪表盘面板

机器人流量:statpx 的三层机器人检测如何让您的数据保持干净

搜索引擎爬虫、AI 训练抓取工具、SEO 工具,以及纯粹的脚本滥用行为,都会和真实访客一起访问您的网站——如果这些都没有被过滤掉,您的会话数、跳出率和转化率就会悄悄偏离真实情况。机器人流量页面(bot_traffic.php)正是 statpx 用来区分两者的地方,在一次访问真正计入您的主要统计数据之前,会经过三层独立的检测。

第一层——用户代理(UA)特征匹配

每个请求都带有一个 User-Agent 字符串,很大一部分机器人——尤其是"守规矩"的那些——会在其中如实表明身份。statpx 会将传入的 User-Agent 与一份持续维护的已知爬虫和机器人特征列表进行比对,其中包括主要搜索引擎、AhrefsBot 等 SEO 爬虫,以及新一代 AI 爬虫,比如 GPTBotClaude 的爬虫——它们如今在大多数网站的非人类流量中已占据相当大的比例。任何匹配已知特征的请求会立即被标记为机器人,在其他检查运行之前就已完成判定。

第二层——IP 速率限制

特征匹配只能捕捉那些主动表明身份的机器人。为了捕捉那些伪装成正常浏览器 User-Agent 的机器人,statpx 还会监控每个 IP 地址的请求频率。如果单个 IP 在短时间内发出的请求数量远超任何真实人类浏览会话可能产生的量,就会被标记出来——这正是用来捕捉脚本抓取和那些完全跳过第一层"如实申报"的未标注爬虫的手段。

第三层——已知机器人 CIDR 网段

第三层会将请求的来源 IP 与已知机器人运营商和常用于运行自动化流量的托管服务商所公布的 CIDR 网段进行比对。这能捕捉到那些运行在云基础设施网段上、懒得设置独特 User-Agent、也还没有触发速率限制阈值的机器人,弥补了前两层各自单独存在的漏洞。

三层检测各自独立运行。一次访问只需匹配三层中的任意一层即可被判定为机器人——它们不是必须全部未命中才会放行的顺序关卡,而是三张分别捕捉不同机器人行为的独立"网"。

如何解读机器人流量页面

机器人流量页面会显示所选日期范围内的专属机器人请求计数器,以及热门机器人 IP 地址(如有可用信息则附带 ASN/所属组织)和按原始请求数排列的热门机器人 User-Agent 字符串。这在两种截然不同的场景下都很有用:确认您在 statpx 其他页面看到的真实流量数字没有被爬虫噪音夸大,以及发现值得在服务器或防火墙层面直接封锁、而不仅仅是从分析数据中过滤掉的恶意抓取模式。如果您想实时查看机器人与真人的流量占比,而不是事后才看到,可以对照您的实时分析数据。

用 statpx 让您的分析数据摆脱机器人噪音

statpx 自动通过三层独立检测过滤机器人,并在专属的机器人流量页面上准确展示被拦截的内容。隐私友好,无需 Cookie。

免费开始 →

总结

机器人流量不会消失——如果说有什么变化,那就是 AI 爬虫的兴起在原本就持续访问您网站的搜索引擎和 SEO 工具之上,又增加了全新的一类。仅依赖单一检测方法(例如只做 User-Agent 匹配)会留下漏洞,让脚本流量轻易溜过。statpx 的分层方法——特征匹配、速率限制和已知网段——能捕捉到远更多的机器人流量,让您用来做决策的数字反映的是真实的人类访客,而不是爬虫。

Continue reading

Technical
How to Identify and Block Referrer Spam in Website Analytics
Metrics
How to Track and Reduce Shopping Cart Abandonment with Analytics
Privacy
Google Consent Mode v2 Explained: What It Means for Your Analytics
Analytics by statpx