国产强伦姧在线观看无码,中文字幕99久久亚洲精品,国产精品乱码在线观看,色桃花亚洲天堂视频久久,日韩精品无码观看视频免费

      正在閱讀:AI應(yīng)用需夯實(shí)底層構(gòu)建,聚類算法起何作用?

      AI應(yīng)用需夯實(shí)底層構(gòu)建,聚類算法起何作用?

      2021-02-03 13:23:09來源:OFweek人工智能網(wǎng) 關(guān)鍵詞:聚類算法算法閱讀量:25122

      導(dǎo)讀:聚類(Cluster)分析是由若干模式(Pattern)組成的,通常,模式是一個度量(Measurement)的向量,或者是多維空間中的一個點(diǎn)。
        聚類分析又稱群分析,它是研究(樣品或指標(biāo))分類問題的一種統(tǒng)計分析方法,同時也是數(shù)據(jù)挖掘的一個重要算法。
       
        聚類(Cluster)分析是由若干模式(Pattern)組成的,通常,模式是一個度量(Measurement)的向量,或者是多維空間中的一個點(diǎn)。
       
        聚類分析以相似性為基礎(chǔ),在一個聚類中的模式之間比不在同一聚類中的模式之間具有更多的相似性。
       
        在商業(yè)上,聚類可以幫助市場分析人員從消費(fèi)者數(shù)據(jù)庫中區(qū)分出不同的消費(fèi)群體來,并且概括出每一類消費(fèi)者的消費(fèi)模式或者說習(xí)慣。它作為數(shù)據(jù)挖掘中的一個模塊,可以作為一個單獨(dú)的工具以發(fā)現(xiàn)數(shù)據(jù)庫中分布的一些深層的信息,并且概括出每一類的特點(diǎn),或者把注意力放在某一個特定的類上以作進(jìn)一步的分析;并且,聚類分析也可以作為數(shù)據(jù)挖掘算法中其他分析算法的一個預(yù)處理步驟。
       
        聚類分析的算法可以分為劃分法(Partitioning Methods)、層次法(Hierarchical Methods)、基于密度的方法(density-based methods)、基于網(wǎng)格的方法(grid-based methods)、基于模型的方法(Model-Based Methods)。
       
        聚類要求
       
        1、可伸縮性
       
        許多聚類算法在小于 200 個數(shù)據(jù)對象的小數(shù)據(jù)集合上工作得很好;但是,一個大規(guī)模數(shù)據(jù)庫可能包含幾百萬個對象,在這樣的大數(shù)據(jù)集合樣本上進(jìn)行聚類可能會導(dǎo)致有偏的結(jié)果。
       
        2、不同屬性
       
        許多算法被設(shè)計用來聚類數(shù)值類型的數(shù)據(jù)。但是,應(yīng)用可能要求聚類其他類型的數(shù)據(jù),如二元類型(binary),分類/標(biāo)稱類型(categorical/nominal),序數(shù)型(ordinal)數(shù)據(jù),或者這些數(shù)據(jù)類型的混合。
       
        3、任意形狀
       
        許多聚類算法基于歐幾里得或者曼哈頓距離度量來決定聚類。基于這樣的距離度量的算法趨向于發(fā)現(xiàn)具有相近尺度和密度的球狀簇。但是,一個簇可能是任意形狀的。提出能發(fā)現(xiàn)任意形狀簇的算法是很重要的。
       
        4、領(lǐng)域小化
       
        許多聚類算法在聚類分析中要求用戶輸入一定的參數(shù),例如希望產(chǎn)生的簇的數(shù)目。聚類結(jié)果對于輸入?yún)?shù)十分敏感。參數(shù)通常很難確定,特別是對于包含高維對象的數(shù)據(jù)集來說。這樣不僅加重了用戶的負(fù)擔(dān),也使得聚類的質(zhì)量難以控制。
       
        5、處理“噪聲”
       
        絕大多數(shù)現(xiàn)實(shí)中的數(shù)據(jù)庫都包含了孤立點(diǎn),缺失,或者錯誤的數(shù)據(jù)。一些聚類算法對于這樣的數(shù)據(jù)敏感,可能導(dǎo)致低質(zhì)量的聚類結(jié)果。
       
        6、記錄順序
       
        一些聚類算法對于輸入數(shù)據(jù)的順序是敏感的。例如,同一個數(shù)據(jù)集合,當(dāng)以不同的順序交給同一個算法時,可能生成差別很大的聚類結(jié)果。開發(fā)對數(shù)據(jù)輸入順序不敏感的算法具有重要的意義。
       
        7、高維度(high dimensionality)
       
        一個數(shù)據(jù)庫或者數(shù)據(jù)倉庫可能包含若干維或者屬性。許多聚類算法擅長處理低維的數(shù)據(jù),可能只涉及兩到三維。人類的眼睛在多三維的情況下能夠很好地判斷聚類的質(zhì)量。在高維空間中聚類數(shù)據(jù)對象是非常有挑戰(zhàn)性的,特別是考慮到這樣的數(shù)據(jù)可能分布非常稀疏,而且高度偏斜。
       
        8、基于約束
       
        現(xiàn)實(shí)世界的應(yīng)用可能需要在各種約束條件下進(jìn)行聚類。假設(shè)你的工作是在一個城市中為給定數(shù)目的自動提款機(jī)選擇安放位置,為了作出決定,你可以對住宅區(qū)進(jìn)行聚類,同時考慮如城市的河流和公路網(wǎng),每個地區(qū)的客戶要求等情況。要找到既滿足特定的約束,又具有良好聚類特性的數(shù)據(jù)分組是一項(xiàng)具有挑戰(zhàn)性的任務(wù)。
       
        9、解釋性-可用性
       
        用戶希望聚類結(jié)果是可解釋的,可理解的,和可用的。也就是說,聚類可能需要和特定的語義解釋和應(yīng)用相聯(lián)系。應(yīng)用目標(biāo)如何影響聚類方法的選擇也是一個重要的研究課題。
       
        記住這些約束,我們對聚類分析的學(xué)習(xí)將按如下的步驟進(jìn)行。首先,學(xué)習(xí)不同類型的數(shù)據(jù),以及它們對聚類方法的影響。接著,給出了一個聚類方法的一般分類。然后我們詳細(xì)地討論了各種聚類方法,包括劃分方法,層次方法,基于密度的方法,基于網(wǎng)格的方法,以及基于模型的方法。后我們探討在高維空間中的聚類和孤立點(diǎn)分析(outlier analysis)。
       
        算法分類
       
        很難對聚類方法提出一個簡潔的分類,因?yàn)檫@些類別可能重疊,從而使得一種方法具有幾類的特征,盡管如此,對于各種不同的聚類方法提供一個相對有組織的描述依然是有用的,為聚類分析計算方法主要有如下幾種:
       
        1、劃分法
       
        劃分法(partitioning methods),給定一個有N個元組或者紀(jì)錄的數(shù)據(jù)集,分裂法將構(gòu)造K個分組,每一個分組就代表一個聚類,K:(1) 每一個分組至少包含一個數(shù)據(jù)紀(jì)錄;(2)每一個數(shù)據(jù)紀(jì)錄屬于且僅屬于一個分組(注意:這個要求在某些模糊聚類算法中可以放寬);
       
        對于給定的K,算法首先給出一個初始的分組方法,以后通過反復(fù)迭代的方法改變分組,使得每一次改進(jìn)之后的分組方案都較前一次好,而所謂好的標(biāo)準(zhǔn)就是:同一分組中的記錄越近越好,而不同分組中的紀(jì)錄越遠(yuǎn)越好。
       
        大部分劃分方法是基于距離的。給定要構(gòu)建的分區(qū)數(shù)k,劃分方法首先創(chuàng)建一個初始化劃分。然后,它采用一種迭代的重定位技術(shù),通過把對象從一個組移動到另一個組來進(jìn)行劃分。一個好的劃分的一般準(zhǔn)備是:同一個簇中的對象盡可能相互接近或相關(guān),而不同的簇中的對象盡可能遠(yuǎn)離或不同。還有許多評判劃分質(zhì)量的其他準(zhǔn)則。傳統(tǒng)的劃分方法可以擴(kuò)展到子空間聚類,而不是搜索整個數(shù)據(jù)空間。當(dāng)存在很多屬性并且數(shù)據(jù)稀疏時,這是有用的。為了達(dá)到全局較優(yōu),基于劃分的聚類可能需要窮舉所有可能的劃分,計算量極大。實(shí)際上,大多數(shù)應(yīng)用都采用了流行的啟發(fā)式方法,如k-均值和k-中心算法,漸近的提高聚類質(zhì)量,逼近局部優(yōu)解。這些啟發(fā)式聚類方法很適合發(fā)現(xiàn)中小規(guī)模的數(shù)據(jù)庫中小規(guī)模的數(shù)據(jù)庫中的球狀簇。為了發(fā)現(xiàn)具有復(fù)雜形狀的簇和對超大型數(shù)據(jù)集進(jìn)行聚類,需要進(jìn)一步擴(kuò)展基于劃分的方法。
       
        使用這個基本思想的算法有:K-MEANS算法、K-MEDOIDS算法、CLARANS算法;
       
        2、層次法
       
        層次法(hierarchical methods),這種方法對給定的數(shù)據(jù)集進(jìn)行層次似的分解,直到某種條件滿足為止。具體又可分為“自底向上”和“自頂向下”兩種方案。
       
        例如,在“自底向上”方案中,初始時每一個數(shù)據(jù)紀(jì)錄都組成一個單獨(dú)的組,在接下來的迭代中,它把那些相互鄰近的組合并成一個組,直到所有的記錄組成一個分組或者某個條件滿足為止。
       
        層次聚類方法可以是基于距離的或基于密度或連通性的。層次聚類方法的一些擴(kuò)展也考慮了子空間聚類。層次方法的缺陷在于,一旦一個步驟(合并或分裂)完成,它就不能被撤銷。這個嚴(yán)格規(guī)定是有用的,因?yàn)椴挥脫?dān)心不同選擇的組合數(shù)目,它將產(chǎn)生較小的計算開銷。然而這種技術(shù)不能更正錯誤的決定。已經(jīng)提出了一些提高層次聚類質(zhì)量的方法。
       
        代表算法有:BIRCH算法、CURE算法、CHAMELEON算法等;
       
        3、密度算法
       
        基于密度的方法(density-based methods),基于密度的方法與其它方法的一個根本區(qū)別是:它不是基于各種各樣的距離的,而是基于密度的。這樣就能克服基于距離的算法只能發(fā)現(xiàn)“類圓形”的聚類的缺點(diǎn)。
       
        這個方法的指導(dǎo)思想就是,只要一個區(qū)域中的點(diǎn)的密度大過某個閾值,就把它加到與之相近的聚類中去。
       
        代表算法有:DBSCAN算法、OPTICS算法、DENCLUE算法等;
       
        4、圖論聚類法
       
        圖論聚類方法解決的第一步是建立與問題相適應(yīng)的圖,圖的節(jié)點(diǎn)對應(yīng)于被分析數(shù)據(jù)的小單元,圖的邊(或弧)對應(yīng)于小處理單元數(shù)據(jù)之間的相似性度量。因此,每一個小處理單元數(shù)據(jù)之間都會有一個度量表達(dá),這就確保了數(shù)據(jù)的局部特性比較易于處理。圖論聚類法是以樣本數(shù)據(jù)的局域連接特征作為聚類的主要信息源,因而其主要優(yōu)點(diǎn)是易于處理局部數(shù)據(jù)的特性。
       
        5、網(wǎng)格算法
       
        基于網(wǎng)格的方法(grid-based methods),這種方法首先將數(shù)據(jù)空間劃分成為有限個單元(cell)的網(wǎng)格結(jié)構(gòu),所有的處理都是以單個的單元為對象的。這么處理的一個突出的優(yōu)點(diǎn)就是處理速度很快,通常這是與目標(biāo)數(shù)據(jù)庫中記錄的個數(shù)無關(guān)的,它只與把數(shù)據(jù)空間分為多少個單元有關(guān)。
       
        代表算法有:STING算法、CLIQUE算法、WAVE-CLUSTER算法;
       
        6、模型算法
       
        基于模型的方法(model-based methods),基于模型的方法給每一個聚類假定一個模型,然后去尋找能夠很好的滿足這個模型的數(shù)據(jù)集。這樣一個模型可能是數(shù)據(jù)點(diǎn)在空間中的密度分布函數(shù)或者其它。它的一個潛在的假定就是:目標(biāo)數(shù)據(jù)集是由一系列的概率分布所決定的。
       
        通常有兩種嘗試方向:統(tǒng)計的方案和神經(jīng)網(wǎng)絡(luò)的方案。
       
        (原標(biāo)題:什么是聚類算法?)
      我要評論
      文明上網(wǎng),理性發(fā)言。(您還可以輸入200個字符)

      所有評論僅代表網(wǎng)友意見,與本站立場無關(guān)。

      • 一周趣評:中國新車裝載智能化座艙滲透率達(dá)73%;抖音首次公開推薦算法原理

        2025年4月14日-4月20日,智能化座艙、算法、數(shù)據(jù)中心、移動網(wǎng)絡(luò)等領(lǐng)域都呈現(xiàn)出了哪些有趣動態(tài)和精彩故事呢?我們一起來看一看吧!
        智能化座艙算法數(shù)據(jù)中心
        2025-04-22 17:04:31
      • 全國AI企業(yè)超420萬,春招算法崗需求激增

        廣東省、江蘇省、北京市的人工智能相關(guān)企業(yè)數(shù)量位居前列,分別為超過63.4萬余家、33.5萬余家和33萬余家,這無疑對人工智能人才需求旺盛。
        算法具身智能腦機(jī)接口
        2025-04-08 17:10:58
      • 接入DeepSeek 曠視AIS算法生產(chǎn)平臺5.0版全新發(fā)布

        近日,曠視正式發(fā)布自研的算法生產(chǎn)平臺AIS(AI Service)5.0版!此次升級,包括接入DeepSeek等三大核心能力重磅亮相,助力企業(yè)AI生產(chǎn)力再躍升!
        DeepSeek算法
        2025-03-17 09:55:26
      • “人工智能+ ”,河南怎么“ +”?

        10月下旬以來,河南省政府辦公廳先后發(fā)布《河南省推動“人工智能+”行動計劃(2024—2026年)》和《河南省算力基礎(chǔ)設(shè)施發(fā)展規(guī)劃(2024—2026年)》,河南省人工智能產(chǎn)業(yè)創(chuàng)新發(fā)展聯(lián)盟專家委員會也隨即成立,為河南省人工智能產(chǎn)業(yè)高質(zhì)量發(fā)展提供智力支撐。
        人工智能算法
        2024-12-06 08:57:06
      • 算法、自動化和人工智能有哪些差異?

        盡管算法、自動化和人工智能都有關(guān)聯(lián),但它們是截然不同的概念,將它們混為一談是錯誤的。
        算法自動化人工智能
        2024-03-26 13:13:07
      • 開源!星動紀(jì)元聯(lián)合清華大學(xué)、上海期智研究院引爆算法新潮!

        近日,由具身智能與人形機(jī)器人公司星動紀(jì)元聯(lián)合清華大學(xué)、上海期智研究院開發(fā)的開源人形機(jī)器人端到端強(qiáng)化學(xué)習(xí)訓(xùn)練框架Humanoid-Gym正式面世。
        算法人形機(jī)器人
        2024-03-08 10:24:34
      版權(quán)與免責(zé)聲明:

      凡本站注明“來源:智能制造網(wǎng)”的所有作品,均為浙江興旺寶明通網(wǎng)絡(luò)有限公司-智能制造網(wǎng)合法擁有版權(quán)或有權(quán)使用的作品,未經(jīng)本站授權(quán)不得轉(zhuǎn)載、摘編或利用其它方式使用上述作品。已經(jīng)本網(wǎng)授權(quán)使用作品的,應(yīng)在授權(quán)范圍內(nèi)使用,并注明“來源:智能制造網(wǎng)”。違反上述聲明者,本站將追究其相關(guān)法律責(zé)任。

      本站轉(zhuǎn)載并注明自其它來源(非智能制造網(wǎng))的作品,目的在于傳遞更多信息,并不代表本站贊同其觀點(diǎn)或和對其真實(shí)性負(fù)責(zé),不承擔(dān)此類作品侵權(quán)行為的直接責(zé)任及連帶責(zé)任。如其他媒體、平臺或個人從本站轉(zhuǎn)載時,必須保留本站注明的作品第一來源,并自負(fù)版權(quán)等法律責(zé)任。如擅自篡改為“稿件來源:智能制造網(wǎng)”,本站將依法追究責(zé)任。

      鑒于本站稿件來源廣泛、數(shù)量較多,如涉及作品內(nèi)容、版權(quán)等問題,請與本站聯(lián)系并提供相關(guān)證明材料:聯(lián)系電話:0571-89719789;郵箱:1271141964@qq.com。

      不想錯過行業(yè)資訊?

      訂閱 智能制造網(wǎng)APP

      一鍵篩選來訂閱

      信息更豐富

      推薦產(chǎn)品/PRODUCT 更多
      智造商城:

      PLC工控機(jī)嵌入式系統(tǒng)工業(yè)以太網(wǎng)工業(yè)軟件金屬加工機(jī)械包裝機(jī)械工程機(jī)械倉儲物流環(huán)保設(shè)備化工設(shè)備分析儀器工業(yè)機(jī)器人3D打印設(shè)備生物識別傳感器電機(jī)電線電纜輸配電設(shè)備電子元器件更多

      我要投稿
      • 投稿請發(fā)送郵件至:(郵件標(biāo)題請備注“投稿”)1271141964.qq.com
      • 聯(lián)系電話0571-89719789
      工業(yè)4.0時代智能制造領(lǐng)域“互聯(lián)網(wǎng)+”服務(wù)平臺
      智能制造網(wǎng)APP

      功能豐富 實(shí)時交流

      智能制造網(wǎng)小程序

      訂閱獲取更多服務(wù)

      微信公眾號

      關(guān)注我們

      抖音

      智能制造網(wǎng)

      抖音號:gkzhan

      打開抖音 搜索頁掃一掃

      視頻號

      智能制造網(wǎng)

      公眾號:智能制造網(wǎng)

      打開微信掃碼關(guān)注視頻號

      快手

      智能制造網(wǎng)

      快手ID:gkzhan2006

      打開快手 掃一掃關(guān)注
      意見反饋
      我要投稿
      我知道了