开发人员说robots已经放行,Sitemap也提交了,企业很容易把这句话理解成“AI很快就会收录网站”。
robots放行,相当于没有在入口处把爬虫挡住。Sitemap提交以后,平台又多了一条找到网址的路径。做完这两项,先别急着写“已经收录”。页面有没有被抓取、是否出现在结果里,要另外查看。
robots管的是访问规则
robots.txt放在网站根目录,合规爬虫访问网站时会先读取其中的规则。网站可以按目录和爬虫名称表达允许或禁止抓取的范围。
它不是网站门锁。报价单、客户资料和内部文件真正不能公开,就应该放在登录或权限控制后面。只在robots里写一句禁止,不能阻止不遵守规则的人访问。
“AI爬虫”也不是同一种用途。以OpenAI公开信息为例,用于搜索发现的OAI-SearchBot和可能用于模型训练的GPTBot可以分别设置。企业不想开放训练抓取,不等于必须同时退出搜索发现。
这只是OpenAI的规则。其他海外平台要查看各自说明,国内平台没有公开对应资料时,也不能自己猜一个爬虫名称写进去。
Sitemap给平台一份网址清单
Sitemap里应该放企业准备长期公开的规范网址。新服务页上线,平台可以从清单中发现它。旧页面已经删除或跳转,就别继续留在里面反复提交。
一张服务页在8月12日改过正文,lastmod就写8月12日。页面没有修改,保留原来的时间即可。如果程序每天把整站日期刷新一遍,Sitemap看起来天天在更新,实际已经分不出哪些页面真的变过。
Sitemap也不是收录申请表。网址写进清单,表示企业希望平台发现它。平台有没有抓取、怎样处理,以及AI会不会采用,是后面的事情。
两边对不上,配置就会互相打架
一张服务页出现在Sitemap里,robots却禁止访问,平台拿到了地址也进不去。页面可以打开,但同时带着noindex,也说明企业不希望它进入搜索索引。
还有些Sitemap放着旧网址,打开以后先跳转几次才进入新页面。清单看起来很长,真正可以直接使用的页面却不多。
验收时可以先拿一张主推服务页来试。直接打开网址,看看有没有报错或跳到别处;再检查robots和页面代码里有没有拦截,尤其是noindex。接着打开Sitemap找这个网址,并从官网导航实际点进去一次。一张页面走通以后,再用同样的方法抽查其他重要页面。
如果页面能打开,没有被robots或noindex挡住,在Sitemap和站内链接中也能找到,技术配置这一关基本走通了。接下来可以去站长工具或服务器日志看有没有抓取记录,再用原来准备的问题复查AI回答。配置截图只能证明当时怎样设置,不能证明页面已经被采用。