一、描述性統(tǒng)計
描述性統(tǒng)計是一類統(tǒng)計方法的匯總,揭示了數據分布特性。它主要包括數據的頻數分析、數據的集中趨勢分析、數據離散程度分析、數據的分布以及一些基本的統(tǒng)計圖形。
1、缺失值填充:常用方法有剔除法、均值法、決策樹法。
2、正態(tài)性檢驗:很多統(tǒng)計方法都要求數值服從或近似服從正態(tài)分布,所以在做數據分析之前需要進行正態(tài)性檢驗。常用方法:非參數檢驗的K-量檢驗、P-P圖、Q-Q圖、W檢驗、動差法。
二、回歸分析
回歸分析是應用極其廣泛的數據分析方法之一。它基于觀測數據建立變量間適當的依賴關系,以分析數據內在規(guī)律。
1. 一元線性分析
只有一個自變量X與因變量Y有關,X與Y都必須是連續(xù)型變量,因變量Y或其殘差必須服從正態(tài)分布。
2. 多元線性回歸分析
使用條件:分析多個自變量X與因變量Y的關系,X與Y都必須是連續(xù)型變量,因變量Y或其殘差必須服從正態(tài)分布。
3.Logistic回歸分析
線性回歸模型要求因變量是連續(xù)的正態(tài)分布變量,且自變量和因變量呈線性關系,而Logistic回歸模型對因變量的分布沒有要求,一般用于因變量是離散時的情況。
4. 其他回歸方法:非線性回歸、有序回歸、Probit回歸、加權回歸等。
三、方差分析
使用條件:各樣本須是相互獨立的隨機樣本;各樣本來自正態(tài)分布總體;各總體方差相等。
1. 單因素方差分析:一項試驗只有一個影響因素,或者存在多個影響因素時,只分析一個因素與響應變量的關系。
2. 多因素有交互方差分析:一頊實驗有多個影響因素,分析多個影響因素與響應變量的關系,同時考慮多個影響因素之間的關系
3. 多因素無交互方差分析:分析多個影響因素與響應變量的關系,但是影響因素之間沒有影響關系或忽略影響關系
4. 協(xié)方差分祈:傳統(tǒng)的方差分析存在明顯的弊端,無法控制分析中存在的某些隨機因素,降低了分析結果的準確度。協(xié)方差分析主要是在排除了協(xié)變量的影響后再對修正后的主效應進行方差分析,是將線性回歸與方差分析結合起來的一種分析方法。
四、假設檢驗
1. 參數檢驗
參數檢驗是在已知總體分布的條件下(一股要求總體服從正態(tài)分布)對一些主要的參數(如均值、百分數、方差、相關系數等)進行的檢驗 。
2. 非參數檢驗
非參數檢驗則不考慮總體分布是否已知,常常也不是針對總體參數,而是針對總體的某些一般性假設(如總體分布的位罝是否相同,總體分布是否正態(tài))進行檢驗。
適用情況:順序類型的數據資料,這類數據的分布形態(tài)一般是未知的。
1)雖然是連續(xù)數據,但總體分布形態(tài)未知或者非正態(tài);
2)總體分布雖然正態(tài),數據也是連續(xù)類型,但樣本容量極小,如10以下;
主要方法包括:卡方檢驗、秩和檢驗、二項檢驗、游程檢驗、K-量檢驗等。
定性數據(Qualitativedata):包括分類數據和順序數據,是一組表示事物性質、規(guī)定事物類別的文字表述型數據,不能將其量化,只能將其定性。
定性數據說明的是事物的品質特征,是不能用數值表示的,通常表現為類別.定量數據說明的是現象的數量特征,是必須用數值來表現的.分為離散數據(Discretedata)和連續(xù)數據().定性分析與定量分析應該是統(tǒng)一的,相互補充的;定性分析是定量分析的基本前提,沒有定性的定量是一種盲目的、毫無價值的定量;定量分析使定性分析更加科學、準確,它可以促使定性分析得出廣泛而深入的結論。
數據分析落實到實處,一般就是圍繞用戶漏斗展開的。也就是人們常說的訪問-激活-留存-交易-推薦。
這核心的5步會有不同維度的細分。
獲客:來源、渠道、關鍵字、著陸頁、地域、設備、訪問時間、跳出率、訪問深度、停留時間、新客量等等;
激活:DAU(日活躍用戶)、MAU(月活躍用戶)
留存:日留存率、周留存率、月留存率
交易:訂單量、訂單金額、LTV
推薦:是否傳播(k>1)
需要獲取以上數據,可以通過ptengine通過漏斗細分得到可視化圖表。一般來講,同比(本周和上周)、環(huán)比(本月第一周和上月第一周)、定基比(所有數據和當年第一周)即可獲得數據的變化情況。
以上,其實不用很專業(yè)也能做好數據分析,獲取數據并不難,難的是你能洞察數據背后的意義。
分析大數據,R語言和Linux系統(tǒng)比較有幫助,運用到的方法原理可以翻翻大學的統(tǒng)計學,不需要完全理解,重在應用。
分析簡單數據,Excel就可以了。Excel本意就是智能,功能很強,容易上手。我沒有見過有人說自己精通Excel的,最多是熟悉Excel。Excel的函數可以幫助你處理大部分數據。
數據分析是指用適當的統(tǒng)計分析方法對收集來的大量數據進行分析,提取有用信息和形成結論而對數據加以詳細研究和概括總結的過程。這一過程也是質量管理體系的支持過程。在實用中,數據分析可幫助人們作出判斷,以便采取適當行動。
數據分析的數學基礎在20世紀早期就已確立,但直到計算機的出現才使得實際操作成為可能,并使得數據分析得以推廣。數據分析是數學與計算機科學相結合的產物。
“啤酒與尿布”的故事產生于20世紀90年代的美國沃爾瑪超市中,沃爾瑪的超市管理人員分析銷售數據時發(fā)現了一個令人難于理解的現象:在某些特定的情況下,“啤酒”與“尿布”兩件看上去毫無關系的商品會經常出現在同一個購物籃中,這種獨特的銷售現象引起了管理人員的注意,經過后續(xù)調查發(fā)現,這種現象出現在年輕的父親身上。
在美國有嬰兒的家庭中,一般是母親在家中照看嬰兒,年輕的父親前去超市購買尿布。父親在購買尿布的同時,往往會順便為自己購買啤酒,這樣就會出現啤酒與尿布這兩件看上去不相干的商品經常會出現在同一個購物籃的現象。如果這個年輕的父親在賣場只能買到兩件商品之一,則他很有可能會放棄購物而到另一家商店, 直到可以一次同時買到啤酒與尿布為止。沃爾瑪發(fā)現了這一獨特的現象,開始在賣場嘗試將啤酒與尿布擺放在相同的區(qū)域,讓年輕的父親可以同時找到這兩件商品,并很快地完成購物;而沃爾瑪超市也可以讓這些客戶一次購買兩件商品、而不是一件,從而獲得了很好的商品銷售收入,這就是“啤酒與尿布” 故事的由來。
當然“啤酒與尿布”的故事必須具有技術方面的支持。1993年美國學者Agrawal提出通過分析購物籃中的商品集合,從而找出商品之間關聯關系的關聯算法,并根據商品之間的關系,找出客戶的購買行為。艾格拉沃從數學及計算機算法角度提 出了商品關聯關系的計算方法——Aprior算法。沃爾瑪從上個世紀 90 年代嘗試將 Aprior 算 法引入到 POS機數據分析中,并獲得了成功,于是產生了“啤酒與尿布”的故事。
現實中的很多現象可以劃分為兩種可能,或者歸結為兩種狀態(tài),這兩種狀態(tài)分別用0和1表示。如果我們采用多個因素對0-1表示的某種現象進行因果關系解釋,就可能應用到logistic回歸。
1、把所有變量代如回歸方程,逐步回歸分析,必要是多用幾種篩選變量得技術,同時要考慮因素得交互作用,綜合分析”
2、單因素分析的結果和多因素分析的結果不一樣是很正常的事情,因為單因素分析往往存在混雜因素的影響
3、要明白在建立多元回歸模型之前,單因素分析的主要作用是起到篩選的作用,通常選取p小于0.1或者0.2的因素進入多元回歸模型,而多元回歸模型中偏回歸系數有意義才是真正的有意義;
借助工具,未至科技魔方是一款大數據模型平臺,是一款基于服務總線與分布式云計算兩大技術架構的一款數據分析、挖掘的工具平臺,其采用分布式文件系統(tǒng)對數據進行存儲,支持海量數據的處理。
采用多種的數據采集技術,支持結構化數據及非結構化數據的采集。通過圖形化的模型搭建工具,支持流程化的模型配置。
通過第三方插件技術,很容易將其他工具及服務集成到平臺中去。數據分析研判平臺就是海量信息的采集,數據模型的搭建,數據的挖掘、分析最后形成知識服務于實戰(zhàn)、服務于決策的過程,平臺主要包括數據采集部分,模型配置部分,模型執(zhí)行部分及成果展示部分等。
原發(fā)布者:婷婷_709
醫(yī)學統(tǒng)計學各種資料比較選擇方法小結來源:桑苗的日志一、兩組或多組計量資料的比較1.兩組資料:1)大樣本資料或服從正態(tài)分布的小樣本資料(1)若方差齊性,則作成組t檢驗(2)若方差不齊,則作t'檢驗或用成組的Wilcoxon秩和檢驗2)小樣本偏態(tài)分布資料,則用成組的Wilcoxon秩和檢驗2.多組資料:1)若大樣本資料或服從正態(tài)分布,并且方差齊性,則作完全隨機的方差分析。如果方差分析的統(tǒng)計檢驗為有統(tǒng)計學意義,則進一步作統(tǒng)計分析:選擇合適的方法(如:LSD檢驗,Bonferroni檢驗等)進行兩兩比較。2)如果小樣本的偏態(tài)分布資料或方差不齊,則作KruskalWallis的統(tǒng)計檢驗。如果KruskalWallis的統(tǒng)計檢驗為有統(tǒng)計學意義,則進一步作統(tǒng)計分析:選擇合適的方法(如:用成組的Wilcoxon秩和檢驗,但用Bonferroni方法校正P值等)進行兩兩比較。二、分類資料的統(tǒng)計分析1.單樣本資料與總體比較1)二分類資料:(1)小樣本時:用二項分布進行確切概率法檢驗;(2)大樣本時:用U檢驗。2)多分類資料:用Pearsonc2檢驗(又稱擬合優(yōu)度檢驗)。2.四格表資料1)n>40并且所以理論數大于5,則用Pearsonc22)n>40并且所以理論數大于1并且至少存在一個理論數<5,則用校正c2或用Fisher's確切概率法檢驗3)n£40或存在理論數<1,則用Fisher's檢驗3.2*C表資料的統(tǒng)計分析1)列變量為效應指標,并且為有序多分類變量,行變量為分組變量,則行評分的CMHc2或成組的Wilcoxon秩和檢驗2)列變量為效應指標并且為二分類,列變
利用數據挖掘進行數據分析常用的方法主要有分類、回歸分析、聚類、關聯規(guī)則、特征、變化和偏差分析、Web頁挖掘等, 它們分別從不同的角度對數據進行挖掘。
①分類。分類是找出數據庫中一組數據對象的共同特點并按照分類模式將其劃分為不同的類,其目的是通過分類模型,將數據庫中的數據項映射到某個給定的類別。它可以應用到客戶的分類、客戶的屬性和特征分析、客戶滿意度分析、客戶的購買趨勢預測等,如一個汽車零售商將客戶按照對汽車的喜好劃分成不同的類,這樣營銷人員就可以將新型汽車的廣告手冊直接郵寄到有這種喜好的客戶手中,從而大大增加了商業(yè)機會。
②回歸分析。回歸分析方法反映的是事務數據庫中屬性值在時間上的特征,產生一個將數據項映射到一個實值預測變量的函數,發(fā)現變量或屬性間的依賴關系,其主要研究問題包括數據序列的趨勢特征、數據序列的預測以及數據間的相關關系等。它可以應用到市場營銷的各個方面,如客戶尋求、保持和預防客戶流失活動、產品生命周期分析、銷售趨勢預測及有針對性的促銷活動等。
③聚類。聚類分析是把一組數據按照相似性和差異性分為幾個類別,其目的是使得屬于同一類別的數據間的相似性盡可能大,不同類別中的數據間的相似性盡可能小。它可以應用到客戶群體的分類、客戶背景分析、客戶購買趨勢預測、市場的細分等。
④關聯規(guī)則。關聯規(guī)則是描述數據庫中數據項之間所存在的關系的規(guī)則,即根據一個事務中某些項的出現可導出另一些項在同一事務中也出現,即隱藏在數據間的關聯或相互關系。在客戶關系管理中,通過對企業(yè)的客戶數據庫里的大量數據進行挖掘,可以從大量的記錄中發(fā)現有趣的關聯關系,找出影響市場營銷效果的關鍵因素,為產品定位、定價與定制客戶群,客戶尋求、細分與保持,市場營銷與推銷,營銷風險評估和詐騙預測等決策支持提供參考依據。
⑤特征。特征分析是從數據庫中的一組數據中提取出關于這些數據的特征式,這些特征式表達了該數據集的總體特征。如營銷人員通過對客戶流失因素的特征提取,可以得到導致客戶流失的一系列原因和主要特征,利用這些特征可以有效地預防客戶的流失。
⑥變化和偏差分析。偏差包括很大一類潛在有趣的知識,如分類中的反常實例,模式的例外,觀察結果對期望的偏差等,其目的是尋找觀察結果與參照量之間有意義的差別。在企業(yè)危機管理及其預警中,管理者更感興趣的是那些意外規(guī)則。意外規(guī)則的挖掘可以應用到各種異常信息的發(fā)現、分析、識別、評價和預警等方面。
⑦Web頁挖掘。隨著Internet的迅速發(fā)展及Web 的全球普及, 使得Web上的信息量無比豐富,通過對Web的挖掘,可以利用Web 的海量數據進行分析,收集政治、經濟、政策、科技、金融、各種市場、競爭對手、供求信息、客戶等有關的信息,集中精力分析和處理那些對企業(yè)有重大或潛在重大影響的外部環(huán)境信息和內部經營信息,并根據分析結果找出企業(yè)管理過程中出現的各種問題和可能引起危機的先兆,對這些信息進行分析和處理,以便識別、分析、評價和管理危機。
聲明:本網站尊重并保護知識產權,根據《信息網絡傳播權保護條例》,如果我們轉載的作品侵犯了您的權利,請在一個月內通知我們,我們會及時刪除。
蜀ICP備2020033479號-4 Copyright ? 2016 學習鳥. 頁面生成時間:3.442秒