网站备案谷歌SEO影响:英文页3周不收录的解决办法
阿里云位于杭州的华东1可用区机房内,一台配置为2核4G的云服务器正满负荷运转。加利福尼亚州山景城的谷歌蜘蛛发出一条抓取指令。太平洋海底光缆传输这条包含几十个字节的TCP握手指令需要160毫秒。经过多级骨干网路由器的层层转发,响应数据包艰难返回美国西海岸。总耗时经常超过3500毫秒。蜘蛛抓取日志里留下一条刺眼的504超时错误。
中国大陆要求企业必须取得ICP备案凭证才能开放网页的80端口和443加密端口。这套行政审查流程通常耗费7到14个工作日。备案档案锁在工信部的数据库系统内。谷歌的排名评分代码完全不读取这些中国境内的行政登记数据。国内机房分配给中小企业的国际出口带宽普遍在1M到5M之间。3个位于欧洲的真实访客同时打开一个带有12张高清产品大图的网页,这根仅有5M的带宽水管就会立刻跑满。谷歌爬虫在这个极度拥挤的网络信道里排队。等待响应的时间一旦超过5000毫秒的容忍红线,抓取任务会被强制中断。新上线的英文页面在谷歌搜索控制台中死死卡在“未发现”状态。长达21天的漫长等待期就此开始。
打开谷歌搜索控制台左侧导航栏的“网页”报告板块。电脑屏幕上会用深灰色字体显示极其具体的排查代码:
代码403禁止访问:国内服务器安装的安全狗防护软件,把美国加州那批以66.249开头的谷歌IP地址段当成了恶意攻击者,强行拦截在门外。
代码503服务不可用:蜘蛛发起抓取请求的瞬间,云服务器的CPU占用率突然飙升突破了90%,系统物理上无法分配额外的内存资源来给爬虫打包网页源代码。
代码404找不到网页:英文页面的静态化生成程序出现乱码,带有动态参数
?id=889的网址被伪静态规则写漏了三个英文字母。已发现-目前尚未编入索引:蜘蛛读取了网站根目录下的Sitemap地图文件,确认有这个URL存在,把它排入了下周的抓取队列,迟迟不去下载HTML代码本身。
排查人员对照着屏幕上的数字,可以照着下面这份执行清单排查:
测试首字节时间:打开网页测速工具,查验TTFB(首字节响应时间)指标,数值大于800毫秒直接判定为网络线路不达标。
统计蜘蛛频率:把服务器根目录下的log日志文件下载到本地电脑,用文档软件搜索“Googlebot”字样,统计过去7天的总访问行数。
核对语言标签:检查网页顶部代码区域是否正确写有
hreflang="en-US"这行专门写给爬虫看的语言规范化代码。审视指令文件:用记事本打开
robots.txt文件,查验里面有没有写着Disallow: /english/这样绝对禁止外部访问的代码字符。统计内部链接:运行电脑上的尖叫青蛙扫描软件,查看全站指向这篇未收录英文页的内部超链接数量是否低于3条。
单纯的机器翻译留下了大量极其生硬的语法错误。一个1200个汉字的中文机床产品介绍网页,被机器软件在短短3秒内强行转换成850个英文单词。整个页面里出现了整整15次“We supply high quality”这样毫无辨识度、干瘪空洞的陈词滥调。谷歌的自然语言处理服务器集群每天要扫描数十亿计完全相同的B2B英文外贸商品页面。
没有提供独特的机器转速参数表。没有海外买家收货后的开箱实拍视频。文字与互联网已有页面的重复率高达78%。内容增量处于完全停滞的状态。同样尺寸规格的螺丝钉参数列表已经在其他500家同行的独立站上被收录存储过了。蜘蛛走马观花般抓取完毕,把这条URL无情地扔进低质量内容沙盒里。21个日夜过去,在搜索框里输入产品长尾词,搜索列表里根本查不到这篇网页的踪影。
给国内服务器挂载国际内容分发网络CDN服务。洛杉矶、法兰克福、新加坡、悉尼等地部署有超过200个离散的缓存节点。海外爬虫发起访问,直接从距离它物理直线距离不到20公里远的当地CDN节点服务器上,调取早已缓存好的静态HTML文件和JPG图片。抓取网络耗时从3500毫秒断崖式下降到120毫秒以内。
一份具体到字数限制的内容修改清单能拉高爬虫的评分:
填充硬指标数据:在产品详情页的正文里塞进至少5项具体的工业标准数据,例如机器最大承重500公斤、线缆抗拉强度达到400MPa。
压缩原产地图片:放置3张产品在真实工厂流水线上的实拍图片,用图片工具把大小严格压缩至150KB以下,手动敲上包含产品型号的英文ALT描述属性。
修剪描述语标签:把网页头部的Description标签里的英文字母数量缩减到155个字符的边界内,把产品适用环境写清楚。
埋入结构化代码:在后台编辑器插入一段JSON-LD格式的产品代码,清清楚楚地标明99美元的单价和当前库存300件的数字。
重写买家问答区:收集海外买家在邮件里最常提问的4个售后问题,请英语母语人士撰写出长度在50个单词左右的短平快解答段落。
对照下方的排障修复计划表,按图索骥去改动网站代码:
| 异常现象表现 | 对应查看的工具软件 | 代码或内容修改操作 | 预估恢复正常天数 |
|---|---|---|---|
| 服务器日志里找不到爬虫IP记录 | 阿里云或腾讯云防火墙面板 | 把66.249开头的网段手动添加入白名单 | 48到72小时 |
| 控制台提示网页无法被提取 | 搜索控制台顶部的网址检查框 | 删除Robots文件里误写的屏蔽斜杠 | 3到5天 |
| 爬虫来过但搜索页面不展示 | Copyscape英文防抄袭检测工具 | 把前两段产品简介全部用人工重写一遍 | 14到21天 |
| 手机端页面内容超出屏幕边缘 | 移动设备适合性测试工具 | 修改CSS样式表把按钮间距放大到48像素 | 7天以内 |
网页孤岛现象让新建的英文产品目录成为无人问津的死胡同。中文主页的导航条上没有任何显眼的“English”点击入口。整个外贸网站那200个中文页面在内部互相传递权重,这15个全新的英文页面连一条来自首页的超链接都拿不到。
搜索引擎的蜘蛛完完全全是顺着超链接这条线索在互联网上爬行的。一个在网站首页侧边栏拥有3个入口位置的子页面,比深藏在4层文件夹目录底下的网页,能拿到多出几十倍的抓取配额。给中文版首页的页脚区域挂上一张清晰的英文版引导海报。在公司发展历史的中文介绍段落里,加插一段提及洛杉矶海外办事处的短句,在短句底部挂上通向英文网页的绝对路径URL。
安排运营人员每天向3家带有高评分的海外工业机械论坛投递2篇纯文字的行业趋势分析文章。文章底部附带上你们的企业拼音名称。海外买家读完文章产生兴趣,会在谷歌搜索框里敲下你们的公司名称寻找官网。成百上千次真实的键盘搜索与鼠标点击行为,在谷歌后台服务器里汇聚成一份份沉甸甸的数据包。英文页面长达3周不收录的僵局被真实用户的访问流量生生打破。