SEO 实操 / 抓取收录
robots.txt、noindex 与登录保护:三种需求别混用
“不要让搜索引擎看到”可能指不抓取、不展示在搜索结果,或任何未授权的人都不能读取。这三个目标需要不同措施。外贸独立站上线验收时,应先给页面分类,再决定技术设置。
先问页面为什么需要限制
报价草稿、客户图纸和管理后台属于访问权限问题,应使用认证与服务器权限控制。公开但不希望进入搜索的感谢页,属于索引管理问题。大量无价值的筛选组合,可能涉及抓取管理。不能把所有路径写进 robots.txt 就认为资料已经保密。
建立一张页面清单,列出产品、文章、搜索结果、账户、测试页等类型,分别指定期望行为。尤其检查测试环境迁移到正式域名时,是否把整站限制也带了过去。
三种方法的边界
| 方法 | 主要作用 | 不能代替什么 |
|---|---|---|
| robots.txt | 指导遵守规则的爬虫是否抓取路径 | 不能代替登录保护,也不保证网址从搜索消失 |
| noindex | 被读取后告知搜索系统不要索引该内容 | 不能限制人访问,通常需要允许抓取才能读取 |
| 身份认证与权限 | 阻止未授权访问受限资料 | 不能作为公开产品页的常规 SEO 设置 |
HTML 页面可通过相应 meta 标记表达 noindex,其他文件可考虑响应头中的 X-Robots-Tag。实际采用哪种方式取决于服务器与内容类型,不应在不了解配置的情况下直接复制全站规则。
用四个样例验收,不只看配置文件
选一个应收录产品页、一个公开但不应收录页面、一个后台地址和一个静态资源。分别检查状态码、响应头、HTML 标记及未登录访问结果。再用 Search Console 的网址检查验证公开页面的可抓取情况。
假设产品页写了 noindex,同时 robots 又不允许抓取,搜索系统可能无法读取新标记。此时不要连续添加更多限制,应先确认目标和处理顺序。移除结果也需要处理时间,不能把设置保存成功等同于搜索结果即时变化。
把上线检查写入交接单
对于 WordPress,要检查阅读设置、SEO 插件与主机规则是否重复控制索引;对于 AI 建站或静态站,要检查模板是否给所有页面复制了测试标记。云典项目交接时,可记录四个样例的检查日期与结果,后续迁移再次复查。
执行清单
- 敏感资料由权限保护,不依赖搜索引擎规则。
- 产品与知识文章没有误加 noindex。
- 限制规则不会挡住关键渲染资源。
- 已上线变更有样例、责任人和复查计划。
官方资料与延伸阅读
资料核对:2026-09-28。操作建议为本文独立整理;教学示例不代表客户实际成绩。平台功能以官方说明为准,发布与技术配置不保证收录或排名。