-
[数据仓库] 数据仓库课题(3)-分布式数据仓库事实表设计思考
数据仓库专题(3)-分布式数据仓库事实表设计思考一、前言最近在设计数据仓库的数据逻辑模型,考虑到海量数据存储在分布式数据仓库中的技术架构模式,需要针对传统的面相关系型数据仓库的数据存储模型进行技术改造。设计出一套真正适合分布式数据仓库的数据存储模型。二、事实表设计基础事实表记录发生在现实世界中的操作...
122
热度 -
[数据仓库] 数据仓库课题(2)-Kimball维度建模四步骤
数据仓库专题(2)-Kimball维度建模四步骤一、前言四步过程维度建模由Kimball提出,可以做为业务梳理、数据梳理后进行多维数据模型设计的指导流程,但是不能作为数据仓库系统建设的指导流程。本文就相关流程及核心问题进行解读。二、数据仓库建设流程以下流程是根据业务系统、组织结构、团队结构现状设定的...
153
热度 -
[数据仓库] 数据仓库课题(1)-数据仓库生命周期模型
数据仓库专题(1)-数据仓库生命周期模型一、前言工作内容的变更,导致重新回到数据仓库模型的架构和设计,于是花点时间比较系统的回顾数据仓库建模和系统建设的知识体系,记录下来,作为笔记吧。二、模型无论数据仓库技术如何变化,从RDBMS到NoSQL,从传统技术到大数据,其实只是实现技术手段的变化,数据仓库...
149
热度 -
[数据仓库] 数据仓库专题(5)-怎么构建主题域模型原则之站在巨人的肩上(二)NCR FS-LDM主题域模型划分
数据仓库专题(5)-如何构建主题域模型原则之站在巨人的肩上(二)NCRFS-LDM主题域模型划分一、前言分布式数据仓库模型的架构设计,受分布式技术的影响,很多有自己特色的地方,但是在概念模型和逻辑模型设计方面,还是有很多可以从传统数据仓库模型进行借鉴的地方。NCRFS-LDM数据模型是金融行业事实上...
87
热度 -
[数据仓库] 数据仓库专题(5)-怎么构建主题域模型原则之站在巨人的肩上(一)IBM-FSDM主题域模型划分
数据仓库专题(5)-如何构建主题域模型原则之站在巨人的肩上(一)IBM-FSDM主题域模型划分一、前言如何构建主题域模型原则是构建企业级数据仓库重要的议题,最好的路径就是参照成熟的体系。IBM金融数据模型数据存储模型FSDM,是金融行业应用极为广泛的数据模型,可以作为我们构建企业级数据仓库主题域模型...
138
热度 -
[数据仓库] 数据挖掘算法之关联规则开掘(二)FPGrowth算法
数据挖掘算法之关联规则挖掘(二)FPGrowth算法之前介绍的apriori算法中因为存在许多的缺陷,例如进行大量的全表扫描和计算量巨大的自然连接,所以现在几乎已经不再使用在mahout的算法库中使用的是PFP算法,该算法是FPGrowth算法的分布式运行方式,其内部的算法结构和FPGrowth算法...
131
热度 -
[数据仓库] 数据挖掘算法之关联规则开掘(一)apriori算法
数据挖掘算法之关联规则挖掘(一)apriori算法关联规则挖掘算法在生活中的应用处处可见,几乎在各个电子商务网站上都可以看到其应用举个简单的例子如当当网,在你浏览一本书的时候,可以在页面中看到一些套餐推荐,本书+有关系的书1+有关系的书2+...+其他物品=多少¥而这...
94
热度 -
[数据仓库] 数据仓库课题(6)-数据仓库、主题域、主题概念与定义
数据仓库专题(6)-数据仓库、主题域、主题概念与定义一、数据仓库关于数据仓库概念的标准定义业内认可度比较高的,是由数据仓库之父比尔·恩门(BillInmon)在1991年出版的“BuildingtheDataWarehouse”(《建立数据仓库》)一书中所提出:中文定义:数据仓库是一个面向主题的、集...
324
热度 -
[数据仓库] 数据挖掘之决策树算法ID3算法的有关原理
数据挖掘之决策树算法ID3算法的相关原理ID3决策树:针对属性选择问题,是决策树算法中最为典型和最具影响力的决策树算法。ID3决策树算法使用信息增益度作为选择测试属性。其中p(ai)表示ai发生的概率。假设有n个互不相容的事件a1,a2,a3,….,an,它们中有且仅有一个发生,则其平均的信息量可如...
114
热度 -
142
热度 -
[数据仓库] 数据仓库课题(8)-维度属性选择之维护历史是否应该保留
数据仓库专题(8)-维度属性选择之维护历史是否应该保留一、背景数据仓库建模过程中,针对事务型事实表设计,经常会遇到维度属性选择的问题,比如客户维度,在操作型系统中,为了跟踪客户状态的变化,往往会附加客户记录的四个属性:1.addtime:添加时间;2.adduser:添加用户;3.modtime:修...
79
热度 -
[数据仓库] 数据仓库简介-数据集市
数据仓库简介---数据集市一、数据集市定义??数据集市就是满足特定的部门或者用户的需求,按照多维的方式进行存储,包括定义维度、需要计算的指标、维度的层次等,生成面向决策分析需求的数据立方体。独立型数据集市:数据来自于操作型数据库,是为了满足特殊用户而建立的一种分析型环境。这种数据集市开发周期一般较短...
78
热度 -
100
热度 -
[数据仓库] hadoop学习(Map、Reduce、日志分析跟数据挖掘、大数据处理)
hadoop学习(Map、Reduce、日志分析和数据挖掘、大数据处理)对于hadoop,我也处于了解学习中,参考大量资料,现在同大家分享下学习内容。Hadoop是Apache下的一个项目,由HDFS、MapReduce、HBase、Hive和ZooKeeper等成员组成。其中,HDFS和MapRe...
223
热度 -
[数据仓库] 数据仓库顺利的评价标准
数据仓库成功的评价标准在北京年会上我曾向Sybase公司的卢总监提问过关于数据仓库项目的失败率太高的问题,来表达数据仓库不仅仅是数据存储问题,而是一整套方案和方法论的问题;卢总监的回答是数据仓库的失败率并非80%都是失败的,很多项目介于成功失败之间;数据仓库项目实施周期比较长,不容易看到成果;其次有...
142
热度 -
[数据仓库] 【地质空间数据挖掘】关联规则发现
【地理空间数据挖掘】关联规则发现关联规则是当前数据挖掘研究的主要方法之一,主要用于确定数据中不同领域之间的联系,找出满足给定支持度和可信度阀值的多个域之间的依赖关系。在时空分析中,除了经典因子之间的关联(简单关联、时序关联和因果关联等)规则的发现,关联规则分析还可用于探索上下不同事件之间的关联性,如...
117
热度 -
[数据仓库] kaggle数据挖掘——以Titanic替例介绍处理数据大致步骤
kaggle数据挖掘——以Titanic为例介绍处理数据大致步骤Titanic是kaggle上的一道justforfun的题,没有奖金,但是数据整洁,拿来练手最好不过。本文以Titanic的数据,使用较为简单的决策树,介绍处理数据大致过程、步骤注意,本文的目的,在于帮助你入门数据挖掘,熟悉处理数据步...
135
热度 -
[数据仓库] 数据挖掘十大经典算法之K最比邻算法
数据挖掘十大经典算法之K最近邻算法k-最近邻算法是基于实例的学习方法中最基本的,先介绍基于实例学习的相关概念。基于实例的学习已知一系列的训练样例,很多学习方法为目标函数建立起明确的一般化描述;但与此不同,基于实例的学习方法只是简单地把训练样例存储起来。从这些实例中泛化的工作被推迟到必须分类新的实例时...
151
热度 -
[数据仓库] 浅谈数据挖掘中的关联规则开掘
浅谈数据挖掘中的关联规则挖掘数据挖掘是指以某种方式分析数据源,从中发现一些潜在的有用的信息,所以数据挖掘又称作知识发现,而关联规则挖掘则是数据挖掘中的一个很重要的课题,顾名思义,它是从数据背后发现事物之间可能存在的关联或者联系。举个最简单的例子,比如通过调查商场里顾客买的东西发现,30%的顾客会同时...
136
热度 -
[数据仓库] 常见的机器学习与数据挖掘知识点之常见遍布
常见的机器学习与数据挖掘知识点之常见分布常见的机器学习与数据挖掘知识点之常见分布CommonDistribution(常见分布):DiscreteDistribution(离散型分布):0-1Distribution(0-1分布)定义:若随机变量X只取0和1两个值,且其分布律为P{X=k}=pk(1...
153
热度