天才领路者

总算认识大数据要学些什么

发布时间: 2019-10-07 14:01:21

学习Oracle是一个漫长艰辛的过程。如果没有兴趣,只是被迫学习,那么是很难学好的。学习到一定程度的时候,要想进一步提高,就不得不接触很多Oracle之外的东西。以下是小编为你整理的大数据要学些什么  

如Unix,如网络、存储等。因此,要真的决心学好Oracle,就一定要有兴趣。有了兴趣,就会一切变得简单快乐起来。简单总结一下,那就是:兴趣、学习、实践。

大数据要学些什么

 

如何入门是许多初学者最头疼的事情。Oracle涉及的方面太多了:SQL、管理、优化、备份恢复……那么从哪开始学好呢?如果在*期间学过数据库理论,或有一定的数据库基础自然很好;如果没有的话,真的是个大问题。我个人认为还是应该从SQL语句学起。比较好的教材是Oracle OCP认证的《SQL and PL/SQL》。学习SQL的时候,尽可能坚持使用Oracle自带的工具:SQLPLUS。  

有了一定的SQL基础后,就要尽可能的了解Oracle的体系结构,这就涉及到了Oracle管理的内容了。我学习的时候,机械工业出版社的《Oracle9i DBA手册》这本书对我的帮助挺大。或许现在都出11g版本的了吧。Oracle公司的《Oracle Concepts》是非常棒的书,对了解Oracle体系结构很有好处。每个Oracle版本都有对应的版本,可以认真多读几次,每次都会有新的收获。  

   

大数据应用案例  

Keen IOKeen IO赢得了Structure 2012 Launchpad的比赛,该赛事致力于为移动开发者提供强大的分析工具。开发者仅需要把一行代码插入到指定的追踪位置,该公司同时表示,开发者可以追踪他们应用程序中的任意代码。如果是这样的话,只需要再创建一个显示面板或者查询进程就可以把所有的数据转化成有用的信息。  

Kontagent:Kontagent的基本业务主要是靠对移动、社交以及Web应用的分析平台,不过这一切都是建立在Hadoop基础设施之上。在今年的早些时候,该公司扩展了一项新业务:使用Hive打造了一个数据挖掘服务,并且提供了一个类似SQL的接口进行查询存储在Hadoop上的数据,取代了追踪预定义变量,他们可以对选择项进行更深入的挖掘。

 

Mortar Data:Mortar Data宣称“Hadoop,没有复杂性”。该公司提供了自己的云服务——整合了Pig和Python进而取代了MapReduce——已经有一年的时间了。在11月份,它发布了一个开源的Mortar框架旨在构建一个社区,这样不仅有利于成员之间共享数据集,也让构建Hadoop管道变得更容易。Mortar Data在AWS之上运行,目前支持来自Amazon S3以及MongoDB(托管在Amazon EC2之上)的数据源。  

Precog:Precog提供了一项服务Labcoat,它是一个交互式的开发环境,可以用来编写基于开源的Quirrel(由Precog实现的统计查询语言,Quirrel很多方面都与R编程语言比较相似)查询语言的分析工作,该集成开发环境包含了一个语言学习教程以及一些复杂的函数。Precog的COO告诉Derrick,即使没有任何编程经验的人也能在几个小时内学会操作。  

Precog可http://m.fulinmenst.com/m/contact.aspx?FId=n7:7:7以从各种数据源抓取输入数据,其中包括SQL数据库、Amazon S3、Hadoop、MongoDB、客户端Web应用和后端服务器等。RESTful API支持开发者从外部源(如Twitter或Facebook)、CSV文件或移动设备抓取数据。抓取的数据保存到一个叫做PrecogDB的定制数据库中,而且还可以使用人群统计、态度、位置和其他信息,使数据更为丰富。在一次采访中,Precog的CEO和创始人John A.De Goes解释到:“系统的架构与数据库分析有些相似,比如都包括面向列的存储。但是其区别在于:前者支持完全异构的、非规范化的数据,通过对Quirrel的支持,相对于使用RDBMS进行分析,使用这种类似于“面向大数据的R”的语言,能够很方便地执行很多更为高级的计算。”  

   

大数据的学习理念  

做大数据,企业的规模不一样,要求也不一样。如果企业规模足够大,比如说是电信运营商或者电力、银行这样的行业,可能会形成一个大数据的团队。如果不是,比如说就是简单的服务企业,那么形成理念就可以了。现在我们认为比较好的数据科学家,也不是说就是特别擅长或适应网络,这样的人不重要了,重要的是要有武器,什么样的问题来了知道怎么解决。  

关键我们认识是要培养四种理念:  

除了结构化数据以外还有文本、音频、图像、遥感、网络、行为轨迹、时间数据,这些数据怎么处理,它存在的大挑战是什么。  

一定要懂预测,因为绝大部分的大数据应用回到预测中,预测里面很多方法都是基准学习的,而基准学习目前最火的方向是集群学习。  

要走分布式存储计算,这绝对不是说我知道给Hadoop、Mapreduce、Hbase就够了,关键问题是首先要知道怎么样去搭一个混合式的,你的数据来了,我到底是应该牺牲我的一致性还是牺牲操作性,大概的成本多少,哪些数据挖掘的重要算法我要把他Hadoop、Mapreduce实现,哪些算法要通过SPTA,可变逻辑治理是在硬件里面,从而替代CPU、GPU。  

需要整个数据向外的发展,知道哪些数据可能在外部产生什么样的重要价值,或者外部的数据能够在你的企业产生什么样的重要价值。企业应该培养出这四个能力,建立起企业数据挖掘的人才团队。  

我们都说“书到用时方恨少”,很多的企业,比如说像服装销售这样的传统行业,我要进的货在淘宝、天猫上卖的怎么样?在淘宝、天猫哪一个店铺怎么样?它的竞争品牌是什么样售价,怎么样销售的?对于这样一些数据,如果到需要的时候才去找,往往都来不及了。同样的道理。比如银行给中小企业发放贷款的时候,希望了解到它的用水、用电、生产、交通数据,例如通过摄像头就能知道这个企业到底有多少车运行,这些数据可能对于中小企业发放贷款决策都很重要。但是当你要发贷款的时候,再去问已经没有机会了,或者说成本太高了。我们建议,企业应该学会通过公共渠道或者数据交换的方法,根据自己的业务需求来量身定做自己的外部数据和战略数据。  

大企业一定要有数据侦测的能力,需要有创新思维的人随时思考这些问题,比如企业占有的数据到底在外部能够产生什么样大的作用  

就像我们经常拿雅昌艺术中心的例子,它存了很多艺术品的数据,所以*它可以发布艺术指数。同样*电网也发布两个指数,一个叫重工业用电指数,一个叫轻工业用电指数。淘宝网有它的CPI指数,还有很多企业的一些数据,实际上都可以发挥想象不到的价值。一个大数据企业包括未来现代化企业,一定要有开放共享的态度  

一方面需要企业把自己的很多问题社会化,另一方面企业要尽量去通过一些平等办法,通过数据交换的方式互相共享形成数据化。  

一种模式叫做产业链布局,比如说海尔、长虹可以投物联网,对物联网企业创新进行投入。比如说中信集团可以关注医疗,在这个方面寻找相关的数据应用。第二个方面就是技术,你要知道哪些是硬技术创新,特别是在基础术设施层面的,比如加速存储,云计算的一些技术,比如数据挖掘,垂直应用分析,这个方面集中了很多创新也可以形成很大的规模。第三种模式是数据集方面的投资,我们知道阿里巴巴投资高德是为了数据,它投资新浪微博不仅是要投钱还要花钱买数据,所有这一切本质还是想把数据流动起来做更大的事情。这种投资就是集成数据,强调数据流动性。这些投资里面有几点是需要注意的,一是要去关注企业的数据价值,其次要关注早期的投资,去长期指引而不是短期追逐回报率,*还要多关注传统行业。  

更多培训课程,学习资讯,课程优惠,课程开班,学校地址等学校信息,请进入 天才领路者网站详细了解
咨询电话:400-850-8622

相关文章

最新文章

相关课程2

温馨提示:提交留言后老师会第一时间与您联系! 热线电话:400-850-8622