Hadoop+SQL Server+Excel=大数据分析

2019-03-28 13:11|来源: 网络

  几个月前,微软宣布了自己的用于大数据管理、分析和挖掘的Hadoop发布版HDInsight。InfoQ联系到了SQL Server的高级产品营销经理Val Fontama,希望进一步了解微软的企业级大数据到底如何。

  关于企业中数据集规模的增长趋势:

  数据的海洋一直在增长。有预测表明业务信息存储量每年都会加倍。例如,Gartner发现全世界的信息量每年在以最少59%的速率增长,而其中大约85%的数据是“非结构化”的——比如视频剪辑、RFID标签和网站日志。这些非结构化数据用传统的数据管理系统来处理并不容易。此外,在很多场景下,客户在实时收集新数据时发现数据增长速率还在增加。

  客户将需要一个与业务及所收集数据的发展相适应的现代数据平台。对全球企业而言,大数据为从所收集数据(不管是结构化的还是非结构化的)中找到新颖可行的观点创造了大量商机。因为到最后,大数据的最大前景就是推动来自数据的、更智能的决策。而智能决策就要收集来自各类数据的观点。

  HDInsight是微软应对大数据的解决方案:

  微软希望通过支持Windows Server和Windows Azure的Hadoop发布版,提供可移植、性能优越、安全且易部署等特性,促进Hadoop的应用。微软还将通过在HDInsight中集成Active Directory来增强Hadoop的安全性。此举将使IT部门能够将同样的一致性安全策略用于包括Hadoop集群在内的所有IT资产。

  此外,通过与System Center集成,HDInsight简化了Hadoop的管理,并支持IT部门在同一面板上管理Hadoop集群、SQL Server数据库和应用程序。

  基于Hadoop的Windows平台应用程序集成了如Excel、Power View和PowerPivot等微软的商业智能(BI)工具,可以很容易地分析大量的业务信息,从而创造独特的、差异化的商业价值。

  为实现与Apache Hadoop百分之百的兼容性,微软的Hadoop发布版HDInsight是基于Hortonworks Data Platform(HDP)构建的。因此,客户能够将其MapReduce作业从自己的Windows服务器移到云中,甚至是移到运行在Linux上的Apache Hadoop发布版中。目前还没有其他厂商提供该功能。此外,在Windows Server和Azure平台上提供这些功能,也使客户能够利用熟悉的工具(如Excel、PowerPivot for Excel和Power View)轻松地从数据中抽取可行的观点。

  SQL Server如何适应这种解决方案:

  在帮助企业处理大数据集方面,SQL Server 2012与SQL Server 2008最重要的区别之一就是与Hadoop的兼容性。Hadoop允许用户处理大量的结构化和非结构化数据并快速从中获得观点,而且,因为Hadoop是开源的,成本较低。Hadoop与SQL Server 2012兼容的特性是微软与Hortonworks合作开发的,微软最近也宣布Microsoft HDInsight Server和Windows Azure HDInsight Service已经可以预览,这都使用户能够使用微软开发的Hadoop连接器来从数据中获得最好的观点。通过Hive ODBC Driver把SQL Server连接到Hadoop,客户现在可以使用如PowerPivot和Power View等微软的BI工具在SQL Server 2012中分析各种类型的数据,包括非结构化数据。此外,利用SQL Server 2012中新的Data Quality Services,客户可以通过将原始数据转换为适于建模的可靠且一致的数据来提高数据质量。

  微软最近宣布了Office 2013 中的一些新特性,并介绍了开发者应该如何利用这些特性来构建构建应用和处理数据的服务。不足为奇,微软自己在Excel正是利用这一点来提供大数据服务的:

  Excel是微软平台上支持大数据分析的主要客户端工具之一。在Excel 2013中,我们的主要工具是数据建模工具PowerPivot和数据可视化工具Power View,而且恰好它们都构建进来了,无需额外下载。这支持各个层次的用户使用熟悉的Excel界面进行自助式BI分析。

  通过Excel的Hive插件,我们的HDInsight服务很容易集成Office 2013中的BI工具,使用户能够用熟悉的工具轻松地分析海量的结构化或非结构化数据。

  除了Excel之外,微软还提供了其他的大数据交互工具:BI专业人员可以使用BI Developer Studio来设计OLAP cube或在SQL Server Analysis Services中设计可伸缩的PowerPivot模型。开发者可以继续使用Visual Studio来开发和测试用.NET编写的MapReduce程序。最后,IT运维人员可以使用他们目前所使用的System Center来管理HDInsight上的Hadoop集群。

  总的说来,微软的策略看起来是要为客户使用大数据提供一种最简单的方法——扩展现有工具(如SQL Server和Office等),使之能够无缝处理新数据类型,从而允许各公司在处理新业务时能利用原有投资。

更多Hadoop相关信息见Hadoop 专题页面 http://www.linuxidc.com/topicnews.aspx?tid=13

相关问答

更多
  • 十几二十万的数据用excel确实吃力了一些呀 学sql的时间根据你对IT技术的接受程度不同所需要的时间不同 如果你现在知道excel的各种公式,包括sumproduct、index、match,以及可以直接手写出来而不用鼠标的话,相信你的sql一周之内即可学会基础的使用了 如果你现在已经熟悉vba代码,能够用代码来处理一些公式所不能及的功能,相信你的sql三天之内即可学会基础的使用了 如果要问从哪里开始学起…… 建议直接上sql server 2008 因为sql server有比较好的交互界面,并且在创建 ...
  • 大数据分析工具有哪些,有什么特点? 答:1. 开源大数据生态圈 Hadoop HDFS、Hadoop MapReduce, HBase、Hive 渐次诞生,早期Hadoop生态圈逐步形成。 开源生态圈活跃,并免费,但Hadoop对技术要求高,实时性稍差。
  • Hadoop被设计用来在大型数据集上能进行有效的工作。Hadoop有一个专为大尺寸文件(如几G)设计的文件系统(HDFS)。因此,如果你的数据文件尺寸只是几M的话,建议你合并(通过zip或tar)多个文件到一个文件中,使其尺寸在几百M到几G范围内。HDFS把大文件们拆分存储到以64MB或128MB或更大的块单元中。 如果你的数据集相对较小,那它就不会是hadoop的巨型生态系统的最佳使用之地。这需要你去对你的数据比以往理解更多一些,分析需要什么类型的查询,看看你的数据是否真得“大”。另一方面,只是通过数据库 ...
  • 做运维 ,又不需要太好的java ,最基础的Linux 环境配置,
  • 学习这个了会比较好,也可以不学这个,学别的替代Hadoop,看你之后想往哪一方面发展
  • HADOOP是一种分布式结构的数据库,但是仅仅学会这个还不够,你还得学会ORACLE、SQL SERVER等传统的数据库,最好学会GA等网络分析工具,因为大数据必然是在互联网方面优势更大(尤其是移动互联网),还有要学会EXCEL、SPSS或SAS等分析软件,同时你还要懂业务,否则数据分析也是无源之水。
  • R语言和Hadoop让我们体会到了,两种技术在各自领域的强大。很多开发人员在计算机的角度,都会提出下面2个问题。问题1: Hadoop的家族如此之强大,为什么还要结合R语言? 问题2: Mahout同样可以做数据挖掘和机器学习,和R语言的区别是什么?下面我尝试着做一个解答:问题1: Hadoop的家族如此之强大,为什么还要结合R语言? a. Hadoop家族的强大之处,在于对大数据的处理,让原来的不可能(TB,PB数据量计算),成为了可能。 b. R语言的强大之处,在于统计分析,在没有Hadoop之前,我们 ...
  • CDA数据分析研究院大数据中心研发Hadoop大数据分析师应用课程,零基础学习,每位学员亲自架构真实大数据环境,感觉特别有成就感。从数据分析基础、JAVA语言入门和linux操作系统入门知识学起,系统介绍Hadoop、HDFS、MapReduce和Hbase等理论知识和hadoop的生态环境,详细演示hadoop三种模式的安装配置,以案例的形式,重点讲解基于mahout项目的大数据分析之聚类、分类以及主题推荐。区别于普通的JAVA程序员,重点基于Hadoop架构的大数据分析思想及架构设计,通过演示实际的大数 ...
  • 以Python Disco项目为例。 好。 玩这个 使用RHIPE包并查找玩具数据集和问题区域。 精细。 也玩这个。 不要发现“大”数据集。 即使是小数据集也是非常有趣的问题。 的确,任何数据集都是一个起点。 我曾经建立了一个小星空模式来分析一个组织的6000万美元预算。 源数据是电子表格,基本上是不可理解的。 所以我把它卸载成一个星型模式,并在Python中编写了几个分析程序来创建相关数字的简化报告。 找到正确的信息,以便我决定是否需要从RDBMS类型的数据库移动到NoSQL 这很容易 首先,获取数据仓库 ...
  • a)Job Tracker,Task Tracker是软件还是硬件? 两者都是软件。 即在集群的节点上运行的服务。 b)正如其中一个例子中给出的那样,关于map reduce用于查找某些(例如3个)文件中所有单词的出现,那么你在哪里给出查询,即在map reduce程序中“查找单词的出现次数”? 地图如何知道要做什么 除非您使用配置单元,否则没有查询语言。 你基本上在Mapper和Reducer类中实现你的逻辑。 a) Whether the Job Tracker,Task Tracker comes a ...