尊敬的客户,您好!我们是北京一家专注互联网技术服务公司,可以提供收录效果好,文章排名好的网站进行发文,发得多,各种关键词排名就多,流量越多越稳定,如果您有需要欢迎您前来资讯!可以随意添加图文和视频广告,助您的企业或者项目服务实现推广效果!如需合作欢迎请加微信
1.大数据思维
自从2011年、2012年大数据概念开始火爆之后,可以说近几年来,很多传统企业、互联网企业都开始依赖大数据来做业务,也更多地提到大数据思维。
那么什么是大数据思维?我们来看两个例子:
案例一:输入法
首先我们来看一个输入法的例子。
2001年我上大学,那时候最常用的输入法是智能ABC、微软拼音、五笔,那时候的输入法比现在慢很多,很多时候都要选中一个词才能输入,有好几次都要选中词或者调整一下才能打出来,效率很低。
2002、2003年,紫光拼音输入法问世,输入速度非常快,甚至还没按键,字就已经出来了。但是很快人们就发现,紫光拼音也有问题,比如当时互联网发展很快,经常会出现一些新词,如果这些词不在紫光拼音的词库里,就很难打出来。
2006年左右,搜狗输入法出现,搜狗输入法是基于搜狗本身,是一个搜索引擎,积累一些用户输入的搜索词的数据,通过分析用户使用输入法时产生的这些词的信息,逐渐把一些新词加入到词库中,并通过云端进行管理。
比如去年流行一个词叫“然合卵”,如果用传统的方法找这个词,因为是重构词,在输入法里直接通过拼音“ran bing luan”是找不到的。但是在大数据思维下就不一样了,也就是说我们不知道有这个词,但是发现很多人输入了这个词,那么我们就可以通过统计,找出近期的新词,把一个高频词加入到词库里,更新给大家,大家用的时候直接就能找到这个词。
示例 2:地图
我们来看一个地图的例子。在电脑地图和手机地图出现之前,我们都是用纸质地图。这种地图几乎一年更新一次,因为很多地址可能会变,而纸质地图并不总是一成不变的。你无法从地图上知道从一个地方到另一个地方的最佳路线是什么?中途会不会堵车?这些都是需要有经验的司机才能判断的事情。
如果有百度地图这样的产品就更好了,比如能告诉你现在这条路堵不堵?半个小时后会不会堵?能预测路况吗?
另外它能够当你去一个地方的时候,给你规划另外一条路线,这一切都是因为它收集了很多的数据,比如你用百度地图的时候,里面有GPS的位置信息,根据你所在位置的运动信息,你就可以知道,另外它能够收集很多的用户使用信息,能够从交管局或者其他部门收集到其他摄像头、地面传感器采集到的车辆数量等数据,从而做出这样的判断。
这里我们来看一下纸质地图与新版手机地图、智能ABC输入法与搜狗输入法之间的区别。
这里最大的区别就是有没有用到新的数据。这就给我们带来了一个概念——数据驱动。有了这些数据,我们可以通过基于数据做统计或者其他挖掘,让一个产品变得更高效。智能变得更好。这对应的情况可能是之前没有数据,我们可能用我们的直觉,或者用过去的经验。我们想清楚为什么,然后去做。数据驱动的方式效率要高很多,可以很好的解决很多之前无法解决的问题。
2.数据驱动
关于数据驱动,可能有些人从没有看数字的习惯,到有看数字的习惯,这是一个很大的进步。能看几个数字就一定是数据驱动吗?这还远远不够。我的意思就是,什么是数据驱动?或者说现有的创业公司在实施数据驱动方面存在哪些问题?
一种情况是,公司里有一个数据工程师,他的工作是运行数据。
不管是市场、产品、运营、老板,每个人都会有各种各样的数据需求,但都会交给他,但是这个资源也是有限的,他的工作时间也是有限的,只能一个一个的需求去处理。他工作很忙,需求提出来之后不一定能立刻处理,可能需要一些时间。就算他处理了需求,一方面他可能没有完整的数据准备,如果他需要收集一些数据或者做一些升级,他就需要拿到数据,拿到数据之后,他需要对数据做一些分析,这个过程本身可能就需要两三天的时间,如果加上等待的时间,可能就需要更长的时间。
对于有些人来说,这个等待的时间太长,可能会错过整个机会。比如你当时正忙着赶假期或者开学时间,然后想做一些跟运营相关的事,这个机会就可能错过了。很多人等不及了,有的学生干脆就决定不等数据了。这个过程其实非常低效,不是拿不到数据,而是效率低下。我们错过了很多机会。
对于一些公司来说,他们以前可能连数字都没有,但现在他们有一个仪表盘,通过仪表盘他们可以看到公司上个季度和昨天的整体数据,这非常好。
这对于老板来说肯定是一件高兴的事,但是对于营销、运营专业的学生来说可能就不够了。
比如,我们发现某一天的用户数量下降了 20%,我们不能置之不理,需要找出问题所在。我们需要对数据进行细分,按区域、按渠道、按不同方式进行追踪,以找出缺失的部分,无论是整体数据还是特定渠道的数据。单靠一个仪表盘是不够的。
理想的数据驱动系统应该是什么样的?它应该是一个自助式的数据分析系统,让每个业务人员都可以分析数据、掌握数据。
前面我提到过一个模型,我们的源头是一堆乱七八糟的数据,中间有一个工程师跑数据,右边是各种业务同事提出需求,然后排队处理。这种方式效率很高。最理想的情况是,我们有一个组织良好的大数据源,完整详细,并且提供强大的分析工具,让每个业务员都能直接操作,每个人都能并发做一些业务工作。数据要求效率要高很多。
3. 数据处理过程
从非技术角度来讲,大数据分析可以分为一个金字塔,从下到上分为三个部分:第一部分是数据收集,第二部分是数据建模,第三部分是数据分析。第一部分是数据分析,我们分别来看。

数据收集
首先说一下数据收集,我在百度做了七年数据相关的事情,我最大的体会就是,如果想把数据做的更好,最重要的是数据源,之后的一切就都好办了。
使用好的查询引擎或者慢的查询引擎可能只是花费的时间不同,但是如果数据源较差,那么即使是最复杂的算法也可能无法解决问题,并且可能很难得到正确的结论。
我认为一个好的数据处理流程有两个基本原则,一个是完整性,一个是细节。
完全的:
就是说我们要用多个数据源,不能只用一个客户端数据源,没有服务器数据源,没有数据库数据源,你做分析的时候如果没有这些数据,可能会搞错。大数据是总量,不是样本,不能只拿一些省份的数据,然后就说全国都是这样,有些省份可能很特殊,比如新疆、西藏,这些地方的客户端可能跟内地的客户端特点很不一样,差别很大。
薄的:
其实就是强调多维度,在收集数据的时候,尽量收集每一个维度、属性、字段。比如把“谁”、“如何”这些词替换掉,这样后面分析的时候就不会跳出这些词。能选的维度,不是一开始根据需求,根据这个需求,产生一些数据,后面有新的需求来的时候,又需要收集新的数据,迭代周期就会慢很多,效率也会低很多。尽量从源头去收集数据。
数据建模
数据有了之后,还需要进行加工,原始数据不能直接汇报给上面的业务分析师,因为可能比较杂乱,逻辑性也不好。
这就涉及到数据框架的问题了,首先我介绍一个概念叫数据模型,很多人可能对数据模型这个词有恐惧感,觉得模型是个很深奥很复杂的东西,但其实这个东西很简单。
春节期间在家做了一些事情,家里的长辈说家谱之类的东西一定要存档,由于我会用电脑,所以就帮忙用电脑把家里的资料和关系,以及整个族谱资料都整理了一遍。
我们的现实是,我们有个人,有家谱,通过树形结构和他们之间的数据关系,我们可以用一些简单的图表来表示真实的实体。这就是数据模型。
数据模型是对现实世界的抽象表示,对于我们这样的创业公司来说,这种情况经常发生。对于我们现在的业务,前端通常发出请求,处理请求,然后更新到数据库中。数据库中会构建一系列的数据表,数据表之间会存在很多的依赖关系。
比如像我这个图,一个业务项开发一年多,可能涉及到几十张甚至上百张数据表,然后这个表直接提供给业务分析师去用,去理解,弄起来难度很大。
这个数据模型是为了满足你正常的业务运作,是为了产品正常运行而建立的数据模型。但是,它并不是给分析师用的模型。如果一定要用它来做数据分析的话,那么会带来很多问题。比如:它非常难以理解。
另外数据分析非常依赖表与表之间的网格,比如有一天我们为了提高性能拆分了一个表,增加了一个字段,或者删除了一个词,这个调整都会影响你的分析的逻辑。
这里最好是把数据按照分析需求重新解码一下,它的内容可能是一样的,只是我们的组织方式变了,就拿用户行为数据来说,我们可以把它抽象出来,然后成一个判断表。
用户对商品进行的一系列操作,比如浏览一个商品,谁浏览的,什么时候浏览的,使用的什么操作系统和浏览器版本,浏览的是什么商品。这个商品的属性是什么?这个东西已经给它做了很好的抽象,这样抽样的很大好处就是容易理解,一眼就能知道这个表是什么,也比较方便分析。
在数据分析,特别是用户行为分析方面,目前比较有效的模型是多维数据模型,是一种在线分析处理模型,它包含两个关键概念:维度和指标。
维度包括城市(北京和上海)、维度西边的一些属性、操作系统(IOS和)以及维度内的属性。
通过跨维度,我们可以看一些指标,比如用户数、销量等,比如通过这个模型,我们可以看到北京地区使用iOS的用户整体的销量。
这里只列举了两个维度,可能还有很多,总之通过维度的组合,你可以看到一些指标的数字,你可以回想一下,你经常用到的这些业务的很多数据分析需求,是不是都可以用这种方式来解决。简单的模式就这么抽样出来了。
4. 数据分析方法
接下来我们看一下互联网产品所采用的数据分析方法。
互联网产品常用的用户消费分析有四种类型:
方法一:多维事件分析
首先我们来看一下多维事件的分析,这是运营、产品改进中常见的效果分析,其实大多数情况下都可以用到多维事件分析,然后对其进行统计分析。
1. 三个关键概念
它其实由三个关键概念组成:事件、维度、指标。

2. 多维分析的价值
让我们看一个例子来了解多维分析的价值。
比如订单支付事件,按照时间曲线来看,总交易金额曲线是一路下跌的,但是下跌的时候不能眼睁睁的看着,要分析原因。
那怎么分析这个原因呢?常见的做法就是进行维度分解。我们可以按照一定的维度进行分解,比如按地区、按渠道,也可以按照其他的方法进行分解百度怎么发帖让大家都看到,比如按年龄段、按性别等等。我们把它分解一下,看看这些数据是整体下降,还是某一类数据下降。
这是一个假设的例子,分解一下支付方式,有三种支付方式:支付宝,支付宝,微信支付,或者银行支付。
数据上看支付宝和银行支付基本是稳定的,但是我们如果看微信支付的话就会发现,从一开始的最高数字,下降到现在非常低的数字,这个分析说明微信支付肯定是存在一些问题的。
比如:是不是因为界面升级了,或者是微信本身出现了什么问题,导致音量下降了?
方法二:漏斗分析
漏斗分析将根据数据显示用户从第一步到后续每个步骤的旅程可能是一个复杂的过程。
比如说有一批用户首先浏览了你的首页,浏览完首页之后,有一部分人可能直接离开了,有一部分人可能点击了某个商品,点击了商品之后,可能很多人又离开了,然后,有一部分人真的买了,这其实就是一个漏斗。
通过这个漏斗,我们可以一步步分析转化情况,因为每一步都有损失,所以我们可以分析不同渠道的转化情况,比如做广告的时候发现百度用户的转化效果不错,就加大对百度的投入。
方法 3:保留分析
比如你搞一个促销活动,一批注册用户来了,那你就可以看看他们关键行为的特征,比如当天有操作,第二天会有多少人进行关键操作,第N天又有多少人进行关键操作,这个就是看它是否能留下来。
方法4:跟踪分析
回访的目的是看某个行为的一些适度特征,比如对于买黄金这个行为,一周内至少一天买黄金的人数有多少,两天买黄金的人数有多少,七天买黄金的人数有多少,或者买多少次的分布,就是回访和再购买的分析。
结合上述四种分析,可以比仅仅关注访问量或活跃用户的宏观层面更深入地了解产品的数据支持和数据驱动性质。
5. 运筹分析实践
下面我想和大家分享一下我个人在操作和分析方面的实践。
案例一:UGC产品
首先我们来看一个UGC产品的数据分析例子,可能分析它的访问量,新增用户数,获取用户数,发帖数,减少量等。
像贴吧、百度知道、知乎等产品都属于这一类,对于这样的产品,会有很多的数据指标,可以通过某个角度来观察产品的情况。那么,问题来了——这么多的指标,我们应该重点关注哪些?在不同的阶段,我们应该重点关注哪些指标?这就涉及到指标本身的处理,以及重点指标的问题。
案例二:百度知道
2007年我加入百度知道之后,一加入就开始写东西,作为RB,每天也都会收到一系列的报告邮件,里面包含了很多统计数据,比如百度知道的访问量,减少量,IP地址数,申请量,提问量,回答量,附加答案的设置,回答量,这一连串的指标,当时看到这些其实心里是挺反感的。
我在想:这么多指标,总不能只改进这个改进那个吧?每个阶段都要思考,哪些才是最关键的,哪些指标是需要重点关注的。其实一开始是没有区分的,不知道哪些是重要的,哪些是不重要的。
后来我逐渐有了感悟,发现其实还是和访问量、流量减少有关。因为百度知道,它所需要的流量全部来自于大搜索,所以调整或者引导它的展示,对流量的影响是巨大的。虽然和百度知道本身的表现有直接关系,但很大程度上还是受渠道的影响——大搜索渠道的影响。
在开始做问答量的时候,我觉得很重要,怎么把问答量增加,那么整个百度知道平台的问题就多起来了,增加回答量,让这些问题都能回答出来,就会出现很多优质的内容,然后再增加问答量,再增加回答量,然后增加回复量——其实是两种不同类型的人。至于怎么做,当时我有点迷茫,有点矛盾,什么才是最关键的。
每个季度都会开产品会,当时整个部门的产品经理就是孙云峰,在百度工作过或者熟悉百度产品体系的人都会认识这个人,是一个非常有能力的产品经理。我当时问过他这个问题,对于问答量增加,我感到很疑惑。
他说,提问数量并不是一个关键问题,为什么呢?我们可以通过大搜索来找到,如果一个用户在大搜索里搜索,发现这次搜索没有很好的答案,我们可以引导他去问一个问题就好,提问的数量其实可以迅速增加。

我一听就解惑了,最关键的是答案的数量,我能做的就是增加答案的数量。
这里,百度知道产品的抽样就成为了最关键的改进——也就是如何增加答案的数量。在这个问题上我们当时做的一个事情就是推荐问题。
百度知道有一群活跃的用户喜欢回答问题。所以我们想:我们能不能给他们推荐一些他们可以回答的问题,让他们回答各种各样的问题?怎么做呢?
思路很简单,个性化推荐现在挺普遍的,大家都默认了,但是2008年还是推荐比较发达的一年,我了解的国内市场是2010年,个性化推荐引擎技术在2008年就火了,但是后来一些做这个领域的公司倒闭了。
实现策略很简单,我们就是看一个用户的历史答题记录,看看一开始题目的答案是什么,内容是什么。
百度在自然语言处理方面非常擅长,在此基础上提取用户的兴趣词和主题,然后把要解决的问题和与该问题相关的主题的相关用户进行匹配,就把这个问题推荐给这个用户。
当时我们做的一个事情是把过去几个月响应过推荐的用户提取出来,给他们训练一个模型——就是每个用户有一系列的话题兴趣,然后每个点有一个度,就是某个用户的模型项量,也就是兴趣项量。当时抽样了35万个用户。
效果是这样的,现在我把我们当年做的图都找出来了,整个风格其实是我前段时间截的图,大致类似,比如我答了很多数据分析相关的问题,它就会给我推荐数据分析相关的问题。
我们已经开发这个功能将近三个月了,实际上我们非常期待上线这个功能。那么结果如何呢?
上线之后我们发现回答总数没有变化,所以我们进一步分析了原因,一开始这些核心用户回答问题的时候都是找分类页面,比如在计算机分类里,他们看的是计算机相关的问题,有兴趣就回答。
后来我们做了一个实验:我们在个人中心里加了一个我们猜他会喜欢的问题,然后推送给他。结果,用户从在分类页回答问题,转到了个人中心。但是,每个人平均回答的数量并没有变化。根据我们当时做的统计,这些核心用户只回答了 6 个问题。如果超过 6 个,他们就没有动力去回答了。
我们事后分析了原因,一个原因是他大概回答的量就有限,谁能每天连续回答问题呢?另一个同事分析说,当时对他来说,这是一件很痛苦的事情,因为我们在连续回答问题,后来他发现,回答了几个问题之后,还有几个问题,回答了几次之后,他就感觉自己要崩溃了,不想继续回答了。
其实知乎在问题推荐上也下了不少功夫,在新年之前也做过很多测试。新年之前有一段时间,它每天都会推荐一些新问题给我,然后我就去回答。后来我发现推荐的问题太多了,太多了,回答起来就没有动力了。
我们发现无法从这些核心用户身上挖掘出新的价值。所以我们把注意力转向了另一个角度:我们能否撒下更大的网,吸引更多用户来回答问题?库里建议道。
当你访问百度的时候,不管用户是否登录,百度都会在用户的数据库中设置一个用户ID,这个ID可以用来追踪用户,虽然你不知道这个用户是谁,但至少可以追踪到同一个用户。这样我们就可以根据他的历史搜索,各种搜索词,以及他流量的各个页面的记录,提取一些证据,然后针对这些数据库问题建立一个模型。
这样有一个好处,可以覆盖非常庞大的用户群。前面说的核心用户推荐只覆盖了35万核心用户,但是这种方式可以覆盖几亿百度用户。每次用户登录或者访问百度知道之后,我们都会根据他自己的兴趣进行搜索,搜索符合他的解决方案并推荐给他。
比如前段时间,我在没有登录的情况下,其实读了马尔克斯的作品。我很喜欢马尔克斯的作品,就搜索了一些马尔克斯相关的内容。这提取了我对马尔克斯的理解。如果他们对马尔克斯感兴趣,他们会推荐马尔克斯相关的问题给我,但他们可能知道我不会点击答案。
这个功能的效果非常好,整体的回答数量提升了 7.5%。要知道百度从 2005 年就开始研发这个产品,到 2007、2008 年,产品已经非常成熟了,想要在一些关键指标上做出明显的提升还是很有挑战性的。在这种情况下,我们通过这种方式,让回答数量提升了 7.5%,我觉得很有成就感,还因此获得了季度之星的称号。
案例三:召回流失用户
这种形式对于其他产品来说可能非常有效,但是对于我们的产品来说,因为我们的目标比较明确,比较小众,所以这种植入的效果可能不是那么明显。
今年元旦的时候,很多人申请试用我们的产品,但是有1万多人没有回来,虽然我们给了他们账号。所以我们祝大家新年快乐,然后汇报一下进展。能不能找几个人?
这是我们产品在元旦当天的整体用户情况,到元旦的时候,从 9 月 25 日产品上线到现在已经有两三个月了,当时大概有 1490 人申请试用,但是真正试用的只有 724 人,差不多有一半,另一半跑掉了,流失了。
我们想把这些人提取出来,然后对他们进行一个re- ,我们可以把流失用户的名单导出来,这是我们自己产品就有的功能,可能有人会疑惑我们是怎么得到用户的这些信息的呢?
这些就不加了,因为我们申请试用的时候,让他填写姓名,联系方式,公司信息,填写邮箱的我们会发邮件,填写手机号的我们会发短信,这两个渠道的效果我们分析一下。
我们来说说总体数量,总共发给了 716 个人,比之前少了一点,我手动去掉了一些不靠谱的信息,接下来我们看看实际体验过这个产品的人,有 35 个人,然后在这 35 个人当中,有 4 个人申请了数据访问。
因为我们在产品上做了一个小的改进,在测试环境里,对于那些测试环境本身,有一些数据可以让他去玩,玩了之后他可能会感兴趣然后去尝试他自己的真实数据。有一个链接引导他去申请访问他自己的数据,到达这一步之后他就更有可能成为我们的正式客户。
我们其实很关心这两种方式的转化效果,召回效果怎么样呢?我们看下面红框,发了394封邮件,最后真正来试用的人有32个人,打了322个电话,邮件差不多,但是来的人只有3个,也就是说两种效果相差了8倍。
这个其实也提醒了大家,很多人是很少看短信的,当然另一方面也跟我们自身产品的特点有关系,我们的产品是在PC上使用比较方便的产品,很多人可能在手机上点击这个链接不方便,而且点击之后还要输入账号,也比较麻烦,所以效果比较差。
作者:桑文锋,数据宝创始人兼CEO,原百度大数据部技术经理。