-
[数据仓库] 数据挖掘札记-分类-决策树-4
数据挖掘笔记-分类-决策树-4之前写的代码都是单机上跑的,发现现在很流行hadoop,所以又试着用hadoopmapreduce来处理下决策树的创建。因为hadoop接触的也不多,所以写的不好,勿怪。?看了一些mahout在处理决策树和随机森林的过程,大体过程是Job只有一个Mapper处理,在ma...
286
热度 -
[数据仓库] 数据挖掘札记-分类-决策树-1
数据挖掘笔记-分类-决策树-1之前一直做的都是J2EE,最近开始接触数据挖掘,特做笔记记录一下。第一次写东西,写的不好,望大家谅解。先上一些基础概念,大致了解下决策树这个东西:决策树(decisiontree)是一个树结构(可以是二叉树或非二叉树)。其每个非叶节点表示一个特征属性上的测试,每个分支代...
390
热度 -
[数据仓库] 数据挖掘札记-关联规则-Apriori-1
数据挖掘笔记-关联规则-Apriori-1今天看了一下关联规则分析中的Apriori算法,先了解下基本概念:关联规则分析用于发现隐藏在大型数据集中的有意义的联系。在交易数据、关系数据或其他信息载体中,查找存在于项目集合或对象集合之间的频繁模式、关联、相关性或因果结构。?关联规则挖掘形式化定义:?原始...
167
热度 -
[数据仓库] 数据挖掘 决策树算法 ID3 粗浅演绎
数据挖掘决策树算法ID3通俗演绎决策树是对数据进行分类,以此达到预测的目的。该决策树方法先根据训练集数据形成决策树,如果该树不能对所有对象给出正确的分类,那么选择一些例外加入到训练集数据中,重复该过程一直到形成正确的决策集。决策树代表着决策集的树形结构。决策树由决策结点、分支和叶子组成。决策树中最上...
77
热度 -
[数据仓库] JAVA,DBA,ETL,该怎么解决
JAVA,DBA,ETL我现在是在做JAVA开发,想转向Oracle方向,做DBA,现在有一个ETL的工作机会,我跟我朋友说,他劝我直接找DBA的工作,做ETL再转DBA还会有转行的阵痛期,我的想法是先做ETL,再做DBA,慢慢转,我想问一下,ETL转DBA的话好转么?ETL具体做的都是什么工作?-...
64
热度 -
112
热度 -
608
热度 -
620
热度 -
572
热度 -
533
热度 -
[数据仓库] 科普文—常见的45个有关问题解答(数据挖掘之Hadoop)
科普文—常见的45个问题解答(数据挖掘之Hadoop)Hadoop科普文—常见的45个问题解答?Hadoophadoop工作linux?1.Hadoop集群可以运行的3个模式?????单机(本地)模式?????伪分布式模式?????全分布式模式2.??单机(本地)模式中的注意点?在单机模式(stan...
130
热度 -
[数据仓库] 【数据挖掘导论】——导言
【数据挖掘导论】——绪论数据挖掘导论读书笔记之绪论数据挖掘的前提:数据收集和数据存储技术的快速进步。数据挖掘是一种技术,它将传统的数据分析方法与处理大量数据的复杂算法相结合。为探查和分析新的数据类型以及用新方法分析就有数据类型提供了令人振奋的机会。数据挖掘是在大型数据存储库中,自动的发现有用信息的过...
153
热度 -
[数据仓库] 续前篇-数据挖掘之聚类算法k-mediod(PAM)原理及实现
续前篇---数据挖掘之聚类算法k-mediod(PAM)原理及实现上一篇博文中介绍了聚类算法中的kmeans算法.无可非议kmeans由于其算法简单加之分类效率较高已经广泛应用于聚类应用中.然而kmeans并非十全十美的.其对于数据中的噪声和孤立点的聚类带来的误差也是让人头疼的.于是一种基于Kmea...
113
热度 -
[数据仓库] 数据挖掘之clara算法原理及范例(代码中有bug)
数据挖掘之clara算法原理及实例(代码中有bug)继上两篇文章介绍聚类中基于划分思想的k-means算法和k-mediod算法本文将继续介绍另外一种基于划分思想的k-mediod算法-----clara算法clara算法可以说是对k-mediod算法的一种改进,就如同k-mediod算法对k-me...
44
热度 -
[数据仓库] 数据挖掘之分类算法-knn算法(有matlab例证)
数据挖掘之分类算法---knn算法(有matlab例子)knn算法(k-NearestNeighboralgorithm).是一种经典的分类算法.注意,不是聚类算法.所以这种分类算法必然包括了训练过程.然而和一般性的分类算法不同,knn算法是一种懒惰算法.它并非像其他的分类算法先通过训练建立分类模型...
59
热度 -
[数据仓库] 【数据挖掘导论】——数据品质
【数据挖掘导论】——数据质量数据质量数据挖掘使用的数据通常是为其他用途收集或者收集的时候还没有明确目的。因此数据常常不能在数据的源头控制质量。为了避免数据质量的问题,所以数据挖掘着眼于两个方面:数据质量问题的检测和纠正(数据清理);使用可以容忍低质量数据的算法。测量和数据收集问题完美的...
134
热度 -
[数据仓库] 数据挖掘-机器学习:Kmean聚类思维
数据挖掘-机器学习:Kmean聚类思想一、概述?????数据聚类是对于静态数据分析的一门技术,在许多领域内都被广泛地应用,包括机器学习、数据挖掘、模式识别、图像分析、信息检索以及生物信息等。聚类是把相似的对象通过静态分类的方法分成不同的组别或者更多的子集,这样让在同一个子集中的成员对象都有相似的一些...
131
热度 -
[数据仓库] 数据挖掘-基于dom树的网页属性抽取步骤应用
数据挖掘-基于dom树的网页属性抽取方法应用提纲???一、简介???二、应用举例???三、思想???四、实现???五、html-Dom树特征?一、简介????基于Dom树的抽取技术根据html网页所具有的树形层次结构特征来实现html网页中的数据抽取。其系统通常先把html网页结构按照其中的html...
41
热度 -
[数据仓库] 数据挖掘算法学习(1)K-Means算法
数据挖掘算法学习(一)K-Means算法博主最近实习开始接触数据挖掘,将学习笔记分享给大家。目前用的软件是weka,下篇文章会着重讲解。算法简介:K-Means算法是输入聚类个数k,以及包含n个数据对象的数据库,输出满足方差最小标准的k个聚类。并使得所获得的聚类满足:同一聚类中的对象相似...
75
热度 -
[数据仓库] Teradata 系统表,该怎么解决
Teradata系统表请问Teradata系统表有没有类似于DB2或ORACLE一样的系统表,能通过查询系统表把一些业务表的表结构信息全部查出来的譬如说通过系统表能查出schema,table,column,typename,length,scale,default,nulls,PK,FK,Inde...
278
热度