亿万宝宝黑道妈这两天偶然上网的时候,被知乎上一个名为“玉皇大帝住在平流层还是对流层”的问题吸引。
本以为只是小打小闹,殊不知这个问题却在知乎上引发了强烈共鸣,浏览次数 500W+,7000+ 关注:
于是乎就激发了去探索知乎上“沙雕”问题的想法,通过 Python 爬取这些问题的内容,浏览次数,关注人数,总结一份权威(搞笑)的“沙雕”问题排行榜!
知乎非常“贴心”地专门有一个问题可以满足我们的需求,出人意料的是这个问题居然有 243 个回答,并且陶飞同学获得了 3W+ 的赞同。
我们从中爬取了所有回答中出现的问题链接,共用 400 多个问题,其中陶飞就提供了 200+,在此向陶飞同学表示感谢,帮助我们构建了“沙雕数据库”。
获得到了问题的对应的编号后,就可以去各自的页面获取各个问题对应的的标题、浏览数等信息,如下图所示:
在分享出最终的“沙雕排行榜”前,我们首先严肃认真(lixinggongshi)的进行一波分析,主要看一下问题中的关键词。
看来这些问题大多是源自于大家对于人生的探索,否则“为什么”,“如果”,“怎么办”也不会出现那么多。
出人意料的是“体验”这个知乎专属 tag 居然并不多,可能是出于对知乎的尊重,和“体验”相关的问题都不会问得那么“沙雕”。
这个图看来,读者关注的问题还是很极端:一方面在关注男女朋友“你冷酷、你无情、你无理取闹”这种问题;另一方面却在关注宇宙、地球这种关乎全人类的问题,很符合知乎“人均 985,各个过百万”的人设。
好吧,其实看不出来才是正常,能看出来的可能现在去知乎提个问题,下期就会上榜。
不知道大家能不能看清,说实话我自己是看不清的,也没准备让大家看清,目的就是引出下面真正的排行榜。
通过综合问题观看数,关注数,回答数,关注占比,回答占比,综合得到分数的流量指数和新奇指数,最终获得一个整体的分数。
听起来是不是很复杂,实际上最终还是通过 10% 的数据+90% 的主观来进行了排名,为大家精选了 15 个最为“沙雕”的问题。
也选取部分网友的回答,问问题的操作诚然很风骚,面对这些“沙雕”问题,认真回答的绝对是风骚 PLUS,特此声明,以下回答来自于知乎网友。
小结:后经多方考证,证明了猪八戒的黑猪身份,这下子身价进一步暴增,对此我们表示:黑猪白猪,不涨价的猪就是好猪。
小结:知乎上各种关于邹市明能打多少人的问题层出不穷,没想到最终还是要向自己动手了!
小结:珍爱生命,远离袋鼠,切莫为了一个高赞回答去和袋鼠亲身肉搏,否则可能还没来得及分享“刚编出来的故事”就
小结:这个问题应该就是“一本正经的胡说八道”集大成者,评论区好多相关领域人士进行了认真解答,不过究竟住哪也没搞明白,可能只能只有孙悟空知道答案了!
小结:这是怎样的神仙读者,居然问出了这种“惊天地,泣鬼神”的问题,想必各路神仙也在跃跃欲试,准备拉他过去现场讲解!
小结:自产自销,果然够厉害,而且不要用人类“996”的思想去要求向日葵,人家太阳落山就下班了,不多说了,已泪崩!
小结:这位朋友为了苍蝇的生活操碎了心,不如让他们大家族都在自己的家里生活,实现大团圆的美好结局!
本文主要是通过这些问题图大家一乐,只有你在看文章的时候笑了,我们的目的就达到了。
知乎上实际上还是有很多很有价值的问题,即使是这些“沙雕”的问题,也有些非常有意思的回答,大家可以多去了解了解,开拓视野。
最近学习了一点网络爬虫,并实现了使用Python来爬取知乎的一些功能,这里做一个小的总结。网络爬虫是指通过一定的规则自动的从网上抓取一些信息的程序或脚本。我们知道机器学习和数据挖掘等都是从大量的数据出发,找到一些有价值有规律的东西,而爬虫则可以帮助我们解决获取数据难的问题,因此网络爬虫是我们应该掌握的一个技巧。
随着云原生技术的飞速发展,各大公有云厂商提供的云服务也变得越来越标准、可靠和易用。用户不仅可以在不同的云上低成本部署自己的业务,而且还可以享受到每个云厂商在特定技术领域上的优势服务,因此多云架构备受青睐。伴随着多云架构的广泛应用,缓存机制的设计对系统的性能影响至关重要,本次分享将结合知乎中缓存机制的设计演进,介绍多云缓存技术的应...
也许很多人还不知道,知乎在规模上是仅次于百度贴吧和豆瓣的中文互联网最大的UGC(用户生成内容)社区。知乎创业三年来,从0开始,到现在已经有了100多台服务器。目前知乎的注册用户超过了1100万,每个月有超过8000万人使用;网站每个月的PV超过2.2亿,差不多每秒钟的动态请求超过2500。
|