Robots.txt
你可能会说
请让爬虫少抓重复筛选路径,但不要把 robots.txt 当成管理页的访问权限。
放在站点根目录、告诉自动爬虫哪些路径可以抓取的规则文件购物车和重复筛选路径可能浪费爬虫请求,可以在根目录的 robots.txt 中写抓取规则。它只表达对遵守规则的爬虫的抓取建议,不会阻止普通用户打开页面,也不能代替登录、权限或敏感数据保护。
也常被叫作robots 文件Robots Exclusion Protocol
延伸阅读 · 权威出处
请让爬虫少抓重复筛选路径,但不要把 robots.txt 当成管理页的访问权限。
User-agent: *Disallow: /cartDisallow: /admin/products200 OKDisallow 不是权限控制;私密页面仍要由认证和授权保护。
文件位置决定适用范围:robots.txt 通常放在站点根目录,例如 https://example.com/robots.txt;规则只对对应的协议、主机和端口范围生效。
爬虫读取规则后决定是否请求:遵守规则的爬虫会根据 User-agent、Allow 和 Disallow 判断路径;普通浏览器不会因为这份文件而自动失去访问能力。
请在站点根目录生成 robots.txt,只限制重复筛选路径的抓取,保留正常商品页;检查文件位置、规则匹配和普通浏览器仍可访问。管理页和客户数据必须另用认证授权,不要用 Disallow 代替权限。