惠普本月初在波士顿举办了第三届年度大数据大会。众多规模不一的机构参与其中,聆听了包括Facebook、Michael Stonebraker、Nate Silver等在内的众多嘉宾的主题演讲,深入了解大数据的未来发展趋势。大会还举办了40多场分组讨论,由客户主导,分享了各种项目和实战经验。惠普也在大会上发布了Vertica的最新进展和一项新的创业计划,但大会的重点仍然是大数据项目的实施。以下是大会的一些关键要点,这些要点来自一线从业者,为我们展望大数据的未来提供了一些启示。
数据湖是营销废话
这或多或少是 2014 年图灵奖获得者迈克尔·斯通布雷克 (Michael Stonebraker) 提出的观点。 他的评论引起了人群的欢呼,他们显然厌倦了行业推出的营销信息。 他没有对数据海啸或其他气象大数据现象发表评论,但可以肯定地假设他发现它们也属于 BS 类别。 这里的底线是,该行业正在努力向大数据分析的概念妥善鞠躬。 在某种程度上它需要,大多数组织在使其数据可操作方面远远落后于曲线。 此外,他们很难制定收集数据的计划,因此数据湖的可视化是有意义的。 但是,仅仅将数据放入湖中只是组织面临的问题的一小部分。 这就引出了下一点。
Hadoop 不是大数据
许多组织从 Hadoop 实例开始他们的大数据之旅。 虽然这是一个令人钦佩的开端,但仅使用 Hadoop 并不意味着您正在处理“大数据”。 Facebook 分析总监肯·鲁丁 (Ken Rudin) 在他的大数据迷思演讲中打破了这一点,他强调了推动影响力而非洞察力的差异。
虽然推动影响的概念似乎很基本,但许多组织都在关注不会推动变革或带来更好结果的技术或数据。 驾驶影响需要平衡,这导致了我在活动中向不同的人问过十几次的问题。
你如何提出正确的问题?
组织可以拥有最好的技术、最聪明的数据科学家和出色的数据集,但这并不能保证成功。 提出正确的问题是推动业务影响的基础。 为实现这一目标,与我交谈过的大多数公司都将他们的数据科学家嵌入到业务部门中。 这使他们对业务面临的问题有了更多的经验,并使业务主管可以直接访问以数据为中心的问题。 虽然组织结构图根据你问的人而有所不同,但一致认为嵌入式数据科学家是正确的结构。 这种结构有助于确保提出更好的问题,其附带好处是可以更快地获得有意义或可操作的数据。
未来的许多挑战
就像这个领域的领导者一样,还有很多工作要做。 大多数大数据难题仍未解决。 当然,角块在大部分边界内,但大部分块仍然倒置成一堆。 大部分痛苦都与速度有关。 移动数据集,有时是从遗留系统或构建时未着眼于数据可移植性的系统,是一个大问题。 对于大多数企业来说,仅仅是及时将数据导入分析平台就需要做大量工作。 传输速度非常快,数据进入分析平台的速度越快,查询和业务计划调整就越快。 销售数据是这一点上最常见的线索,与我交谈过的一些人几乎可以实时访问,许多人在不到一天后就看到了数据。 尽管许多人谈到了不得不等待很多天才能获得销售明细的痛苦,这在某些情况下意味着采取行动为时已晚。
惠普拥有一套全面的硬件、软件和服务,可帮助组织解决这些历来属于咨询领域的问题。 通过使企业能够主动从他们自己的数据以及在许多情况下的外部来源中寻求影响,惠普正在帮助组织推动增量收益。 这可能是对大数据前景的最大误解之一。 当然,可以找到巨大的胜利,也许数据会产生一些变革性的东西。 但更有可能的是,适当的分析更像是棒球运动员的平均命中率。 一串普通的单打很好,随着时间的推移会增加很多。




Amazon