如果常用地址打不开,不必慌。找97在线免费碰成视频用自己留过的备用,别在评论区追短链。免登录能看完才对得起在线。中途要登录、弹会员,当半套。弹幕挡字幕就关,点赞收藏刷新还在,才像能追。全集缺集,目录里对数。原文见https://m.pktvh.cn/blogs/206387750.html
截图我就不贴了,你可以想象一下:Google Search Console 里一片红,已发现但未抓取的页面从三千掉到三百,核心词位置从第 4 页消失到 10 页开外。时间是 9 点 47 分,我刚给淄博一家园林公司做完上线验收,客户那边的技术负责人姓李,三十来岁,看过截图后把杯子重重撂在桌上:“昨天还正常的,你昨晚改了什么?”
事情是这样的。那个站是我自己手搭的 WordPress,图省事在根目录塞了个 robots.txt 就上线了。你猜怎么着?我写了一条 Disallow: /*?*,本意是想拦住参数乱飘的搜索页,结果把整站的分类页、标签页、甚至连文章分页全拦了。没错,那些带问号的 URL 我一个也没放过。这就是我今天要跟你说的事——舞蹈robots,不是跳舞,是机器人在你的规则里反复横跳,进得来出不去。
全景:robots 文件从来不是“随便写写就行”
先给你一个大局观。我接过十几个给同行做外包的 SEO 项目,八成以上都有 robots 文件的问题。不是里面写了什么惊天动地的东西,而是——它根本没被当回事。项目排期里,一般写“上线前配置 robots.txt”,负责的同学顺手抄一份网上的模板,改个域名就塞进去了。你别说,十个里能中七个,因为那模板真的“能用”。能用和好用是两码事。
这次出事的是 舞蹈robots 的一种典型症状:蜘蛛来了,发现文件存在,于是老老实实按规则走,结果走到一半发现“此路不通”,回头再走另一条,又发现“此路不通”,反复几次后蜘蛛就直接放弃了你的站——相当于你告诉外卖小哥“小区东门进不来,北门也进不来”,那他只能把餐扔门口就走。你站的更新频率再高、内容再好,蜘蛛得不到正向反馈,慢慢就来得越来越少。
我这边的经验是:上线前除了测功能、测速度,一定拿 robots.txt checker 之类的工具、或者直接用 GSC 的“测试 robots.txt”功能跑一遍。花不了你五分钟,但能省一周的扯皮时间。
淄博那家园林——我被“允许”这个词坑了一把
致命的 Allow 和 Disallow 顺序
李总的站是做罗汉松造型和庭院设计的,页面有两三千条,不算大。我一开始加的规则是:
Disallow: /tag/Allow: /tag/bonsai-art
逻辑上我想的是“把标签页全关掉,只留罗汉松这个标签”。但你猜怎么着?有些搜索引擎对 Allow 的优先级识别不一样。Yandex 和 Bing 不管那个 Allow,直接认 Disallow,把那一个目录也挡了。Google 是听话的,它看到 Allow 先于 Disallow,所以放行了 /tag/bonsai-art,但百度那边的表现就时好时坏。结果就是三个搜索引擎的收录表现完全不一样,你根本无法统一分析数据。
我后来是怎么修的?我把 Allow 和 Disallow 的顺序调了个个,改成 Allow: /tag/bonsai-art 写在最上面,下面是 Disallow: /tag/,然后针对百度单独做了个 Baiduspider 的例外段。说实话,这方法不优雅,但有效——至少李总的站现在标签页只收录了那一个,其他全拦住了。代价?多测了两天,多写了两百来行的用户代理规则。
长治那个苗圃——我是怎么把蜘蛛绕死的
死循环的典型案例
另一个案例是长治的一家苗圃,规模大,三十来人,做工程苗和草皮批量供应。他们站用的是自己开发的 PHP 系统,URL 结构里习惯加 ?cat=123&sort=price 这种参数。我一开始没怎么细看,直接用了个通配符:Disallow: *?*。结果蜘蛛访问首页“/”之后,跳去了“/products?cat=1”,被拦;又跳去“/products?cat=2”,也被拦。蜘蛛在整个站里就找不到一个能正常抓取的分页。
你可能会说“那不是有首页吗?”——对,蜘蛛确实能抓首页。但内页一个都进不去,两个多月后站点的收录量只有 5 页(包括首页和 4 篇新闻稿)。客户发来 Screaming Frog 跑的结果,看得我脸都绿了。我一开始还怀疑是外链的问题,把反向链接清单查了三遍,又去一个个确认 sitemap 有没有提交成功,折腾了三天才发现是 robots 文件里那一行“*?*”搞的鬼。
这件事教会我:你永远不要以为 robots.txt 只是个“加不加索引”的小开关。它是一套独立于你 CMS 的访问控制方案,一旦写错,蜘蛛就不会再来好好干活。我现在的习惯是:上线前先去 GSC 看“robots.txt 测试报告”,看看有多少 URL 因为规则被意外拦截。如果红字超过 10 条,就一定回头改。
老师傅们常踩的几个坑(我自己全踩过)
一是通配符用得太多
很多教程教你可以用 * 做通配,但滥用就是灾难。比如 Disallow: /*.pdf$ 这种,想拦 PDF 不抓取,结果连 PDF 的目录页、甚至带 .pdf 的查询字符串都给拦了。你想要精准控制,就用正则式的注释,或者干脆把 Disallow 里的路径写完整。
二是忘了做多搜索引擎差异
Google 支持 Allow 覆盖 Disallow;百度官方文档说也支持,但实际表现不那么稳定;搜狗、360 这些就更不用说了。我现在的做法是:对 Google 和 Bing,用一套标准规则;对百度单独写一段 User-agent: Baiduspider 的例外。虽然增加了维护成本,但至少不会出现“百度啥都不抓”的情况。
三是没给 sitemap 指路
很多人的 robots 文件里根本没有 Sitemap: https://xxx.com/sitemap.xml 这一行。你可能会说“提交给站长平台就行啊”——对,但蜘蛛第一次来的时候,它最先看的就是 robots.txt,如果这里不指路,它就得多跳一步去爬首页再找 sitemap。我家这边的经验是:加上这行后,新站首次收录速度从平均 14 天缩短到 8 天左右。不保证每个人都能复制,但聊胜于无。
舞蹈robots的真谛——不是让蜘蛛跳,是让你自己跳出来看
讲白了,舞蹈robots 这个词,我理解的意思是:你写的 robots 规则就像一段编舞,蜘蛛是舞者,你的站是舞台。你编了一段很漂亮的舞,但蜘蛛不按你教的动作来——它只按你写的规则来。一旦写错,它要么原地转圈、要么打翻舞台道具、要么直接退场。
我后来给李总和长治苗圃各写了一份“robots 规则评审清单”,列了十几个要点,每上线一个新项目就先过一遍。说实话,大部分客户不懂这些,你解释半天也不一定听得进去,但你自己得心里有数。写错了就得认,然后花时间补。我现在接手一个外包项目,第一天不是看代码,是先翻根目录下的 robots.txt。如果写得敷衍,我基本能预见后面至少有一周的时间要花在改索引问题上。
最后说个真实数据:我那家淄博客户,修好机器人文件后,第 8 天百度就恢复了每日抓取,第 14 天原来掉到 10 页开外的“罗汉松造型”这个核心词回到了第 2 页末尾。长治那家苗圃更惨,修好后第 19 天才有明显起色。为什么长治更慢?因为空窗期太长,站点的历史数据已经被蜘蛛打上“不怎么更新”的标签了。所以如果你现在刚上线一个新站,文件写错了,赶紧改,越快越好。拖一个月以上,恢复周期就要乘以二。
换备用之后的97在线免费碰成视频,高清和流畅档怎么切,新手先看 免费观看高清-新浪视频