实验遇到点问题,遂搜索之,然后发现,不同的搜索结果,点进去很可能是相同的内容。
比较过分的一个网站,把小木虫的帖子全盘复制过去,内容、评论、甚至评论者的名称都是一样的。
我相信很多人也见过以下类似的网站:
●
网站内容中的图片都无法显示或者统一显示为一张相同图片,因为被复制的网站图片防盗链了。
●
找到一篇较新发布的技术文章,但内容却是错误或者无效的,或者是针对几年前的旧版本的。这些文章都是直接简单的复制粘贴,都没亲自试一下或者仔细求证,甚至全文都没看一遍。
●
网页内容里有一些特殊格式或者标签的符号,或者有一段段的版权声明。复制或者爬取后也不仔细看看,导致正文夹杂很多“[*]”之类的内容或者不断重复的不相关语句,影响阅读。
也见过几个博主抱怨文章被人抄袭,连个署名都不留。其实,我以前也发现过自己的博文被某站复制了几篇,显然是爬虫自动抓取的,因为一个将自己标榜为技术类的网站,你抓我生活日记类的文章干嘛?当然,后来那个站,打不开了。
而这些简单复制的网站,大都有一个共同目的:以最少的投入获得尽可能多的索引量和访客数。
抛开不尊重原创或者版权的错误,我觉得这种完全复制的内容是无意义的,它们只会导致互联网重复率提高,甚至浪费访客的时间,想想看,一页搜索结果,打开后全是相同的内容,是什么感觉?
记得以前看过一个统计,说互联网流量的很大一部分是机器爬虫产生的,我想,互联网内容的很大一部分也来源于复制吧?
很多的网站都是靠采集起家,规模大了以后依然延续最低投入的发展模式,那只能继续采集。这种网站太多了,同时也看出某些站长的急功近利心态
是啊,毕竟采集是充实网站内容最便捷的方法。
对于被网站,也该反思了。自己人的站点有”原创“内容,也有”转载“内容,往往不分门别类厘清楚。不好维权。也就让那种喜欢转载的人有机可乘。所以啊,我决心“全站100%“原创;若有侵权,就诉诸法律手段了。
我也是,不转载。
对啊,采集的还看啥内容,有那心就不采集了。
我也被抄袭过,不过说实话,现在的站长愿意自己花时间原创的特别少。
你的文章有文采,采集我的就有点品味低了,哈哈。
~如果我需要一些高大上的,我就自己写匹配规则来采集你~
哈哈,先不说你对于“高大上”的标准有多低,就我这规模,还用得着写程序采集么?
以前也玩过采集,基本上都是相同的内容,然后一轮一轮的重新发布……无聊透顶!
开始时内容少,可能很多人选择采集,但毕竟不是个长远之计。
表示很多赚钱的流量站,内容都是采集的。。
确实每次查找资料,都会有相同的内容,这是常有的事情!
对,一个个看下来,确实很浪费时间。
采集被K几率很高,损人不利已。
的确是损人不利己,虽然短期可能觉得很爽。
现在很多采集站了
是啊,越来越多了。
呵呵,分析得到位。“以最少的投入获得尽可能多的索引量和访客数。”
不排除有人喜欢这种事情,并认为不无聊,而且认为是种“网赚”事业,且乐此不彼。
我觉得是他们没有尝到接到律师函的滋味。
可是,有多少人因为被采集而发律师函呢~
采集快啊,自己写那要多久。
对,就是因为省时省力。
复制过来其实根本没有什么用
短期内还是有点利益的~所以那么多人乐意采集。
记得之前听某人讲课的时候说,我国人对不能马上变成钱的东西是没兴趣的。
搞原创,初期 很困难还不一定能挣得到钱,采集就不同了,所以依着这种想法成千上万个垃圾站就诞生了。
是啊,这个态势很不好,弊端终会显现。