robots.txt文件放在网站根目录,告诉搜索引擎哪些页面可以抓取、哪些不能抓取。
robots.txt基本语法
User-agent:指定搜索引擎蜘蛛名称,*表示所有蜘蛛。
Disallow:禁止抓取的路径。
Allow:允许抓取的路径(优先级高于Disallow)。
Sitemap:声明网站地图位置。
常见配置示例
允许所有蜘蛛抓取所有页面:
User-agent: *
Disallow:
禁止抓取后台目录:
User-agent: *
Disallow: /admin/
Disallow: /api/
禁止抓取但允许AI搜索引擎:
User-agent: *
Disallow: /
User-agent: GPTBot
Allow: /
配置注意事项
1. 不要用robots.txt隐藏敏感页面,它会被公开访问;2. 被Disallow的页面如果已被收录,不会立即从搜索结果消失;3. robots.txt不影响已被收录页面的排名;4. 确保sitemap路径在robots.txt中声明。
AI搜索时代的robots.txt
随着AI搜索引擎兴起,robots.txt新增了对AI爬虫的支持。允许GPTBot、ClaudeBot等AI爬虫抓取,有助于在AI搜索中获得曝光。
河南卫民网络提供SEO优化服务,咨询热线400-671-2014。