मुख्य सामग्री पर जाएं

सिल्हूट स्कोर: क्लस्टरिंग गुणवत्ता का मूल्यांकन कैसे करें

सिल्हूट स्कोर पर एक व्यावहारिक मार्गदर्शिका—सूत्र, व्याख्या सीमाएँ, scikit-learn उदाहरण, क्लस्टरों की सही संख्या चुनने में इसका उपयोग, और अन्य क्लस्टरिंग मीट्रिक से तुलना।
अद्यतन 31 जुल॰ 2026  · 12 मि॰ पढ़ना

AI के साथ खोजें

ChatGPT में खोलेंClaude में खोलेंPerplexity में खोलें

किसी क्लस्टरिंग मॉडल को प्रशिक्षण देने के बाद, आप कैसे जानेंगे कि क्लस्टर अच्छे हैं या नहीं?

इसका कोई सार्वभौमिक उत्तर नहीं है। पारंपरिक सुपरवाइज्ड लर्निंग में आप पूर्वानुमानों की वास्तविक लेबल से तुलना करके एक एक्यूरेसी संख्या पा सकते हैं। क्लस्टरिंग में ऐसा नहीं कर सकते। आपने k=5 चुना, लेकिन क्या कोई अलग k मान बेहतर होगा? लेबल के बिना, आप नहीं बता सकते कि एल्गोरिद्म ने वास्तविक संरचना पकड़ी या बस डेटा को मनमाने हिस्सों में बांट दिया।

सिल्हूट स्कोर वही मीट्रिक है जिसकी आपको तलाश है। यह दिखाता है कि हर बिंदु अपने निर्धारित क्लस्टर में अगले निकटतम क्लस्टर की तुलना में कितना अच्छा फिट बैठता है, और यह सबसे व्यापक रूप से इस्तेमाल होने वाली मीट्रिक में से एक है। यह बिना लेबल के काम करता है और समझने में आसान है।

इस लेख में, मैं आपको सूत्र और उसकी व्याख्या के माध्यम से ले चलूंगा, scikit-learn के साथ एक Python उदाहरण दिखाऊंगा, और वे स्थितियाँ कवर करूंगा जब यह आदर्श समाधान होता है और जब नहीं।

क्या आप क्लस्टरिंग में नए हैं? हमारा scikit-learn के साथ k-Means क्लस्टरिंग का परिचय ट्यूटोरियल पढ़ें ताकि आप एल्गोरिद्म कैसे काम करता है और Python में इसका उपयोग कैसे करें, सीख सकें. 

सिल्हूट स्कोर क्या है?

सिल्हूट स्कोर -1 और 1 के बीच की संख्या है जो बताती है कि हर बिंदु अपने क्लस्टर में कितना अच्छा फिट बैठता है।

यह संख्या आपको दो बातें दिखाती है:

  1. एक बिंदु अपने क्लस्टर के अन्य बिंदुओं के कितना निकट है
  2. वह निकटतम पराये क्लस्टर से कितना दूर है

यदि बिंदु अपने समूह के भीतर अच्छी तरह है और किसी अन्य से दूर है, तो स्कोर उच्च होता है। यदि वह किनारे पर है, अपने क्लस्टर की तुलना में पड़ोसी क्लस्टर के अधिक निकट है, तो स्कोर कम होता है।

संक्षेप में, सिल्हूट स्कोर आपको यही संतुलन दिखाता है। यह बताता है कि क्लस्टर के भीतर बिंदु कितने पास-पास हैं और क्लस्टर आपस में कितने अच्छे से अलग हैं। दोनों समान रूप से महत्वपूर्ण हैं। ऐसा क्लस्टरिंग जो बिंदुओं को तो अच्छी तरह समूहित करे लेकिन क्लस्टरों को एक-दूसरे के ऊपर रख दे, उपयोगी नहीं, और न ही वह क्लस्टरिंग जो क्लस्टरों को अलग तो करे लेकिन उनके भीतर बिंदु बिखरे हुए हों।

अच्छी तरह अलग क्लस्टर बनाम ओवरलैपिंग क्लस्टर

अच्छी तरह अलग क्लस्टर बनाम ओवरलैपिंग क्लस्टर

उच्च स्कोर का मतलब बेहतर परिभाषित क्लस्टर। स्कोर 1 के पास हो तो बिंदु अपने क्लस्टर के भीतर कसे हुए और दूसरों से दूर हैं। 0 के पास स्कोर का मतलब क्लस्टर ओवरलैप कर रहे हैं या सीमाएँ अस्पष्ट हैं। नकारात्मक स्कोर का मतलब बिंदु अपने निर्धारित क्लस्टर की तुलना में किसी दूसरे क्लस्टर के अधिक पास है।

सिल्हूट स्कोर कैसे काम करता है?

हर बिंदु को अपना अलग सिल्हूट स्कोर मिलता है, और यह स्कोर दो दूरियों से आता है।

पहली दूरी यह है कि बिंदु औसतन अपने निर्धारित क्लस्टर के अन्य बिंदुओं से कितना दूर है। यदि यह छोटी है, तो बिंदु क्लस्टर में अन्य बिंदुओं के पास है। यदि यह बड़ी है, तो बिंदु अपने क्लस्टर से ढीला जुड़ा है।

दूसरी दूरी यह है कि बिंदु औसतन निकटतम पड़ोसी क्लस्टर के बिंदुओं से कितना दूर है। यदि यह बड़ी है, तो बिंदु अन्य क्लस्टरों से स्पष्ट रूप से अलग है। यदि यह छोटी है, तो बिंदु सीमा के पास है।

किसी बिंदु की क्लस्टरों से दूरी

किसी बिंदु की क्लस्टरों से दूरी

सिल्हूट मान इन दोनों संख्याओं की तुलना करता है। जो बिंदु अपने क्लस्टर के भीतर और दूसरों से दूर है, उसका स्कोर ऊँचा होता है। सीमा पर (किसी दूसरे क्लस्टर के पास) बिंदु का स्कोर कम होता है। जो बिंदु अपने क्लस्टर से ज्यादा किसी दूसरे क्लस्टर के करीब है, उसका स्कोर नकारात्मक होता है।

ध्यान रखने की बात यह है कि इनमें से कोई भी दूरी अकेले पर्याप्त नहीं है. 

एक सघन क्लस्टर बिल्कुल पास-पास किसी अन्य क्लस्टर के बगल में हो सकता है। एक अच्छी तरह अलग क्लस्टर के भीतर बिंदु बिखरे हो सकते हैं। असाइनमेंट पर भरोसा करने के लिए दोनों दूरियाँ चाहिए।

सिल्हूट स्कोर का सूत्र

एक बिंदु के लिए सूत्र इस प्रकार है:

सिल्हूट स्कोर का सूत्र

सिल्हूट स्कोर का सूत्र

जहाँ:

  • a वह औसत दूरी है जो बिंदु से उसी क्लस्टर के सभी अन्य बिंदुओं तक है

  • b वह औसत दूरी है जो बिंदु से निकटतम पड़ोसी क्लस्टर के सभी बिंदुओं तक है

सूत्र b और a के बीच के अंतर को दोनों में से जो बड़ा है उससे भाग देता है. 

आम तौर पर, आप स्कोर की व्याख्या के लिए ये दिशा-निर्देश इस्तेमाल कर सकते हैं:

  • जब b a से काफी बड़ा हो: बिंदु किसी अन्य क्लस्टर से दूर और अपने क्लस्टर के पास है। न्यूमेरेटर b के करीब है, डिनोमिनेटर भी b है, और स्कोर 1 के करीब है

  • जब a b से काफी बड़ा हो: बिंदु अपने क्लस्टर की तुलना में किसी दूसरे क्लस्टर के ज्यादा करीब है। न्यूमेरेटर एक बड़ा नकारात्मक मान है जो -a के करीब है, डिनोमिनेटर a है, और स्कोर -1 के करीब है

  • जब a और b लगभग बराबर हों: बिंदु दो क्लस्टरों की सीमा पर है। न्यूमेरेटर 0 के करीब है, और स्कोर भी

अगले भाग में विशिष्टताओं पर और जानकारी।

सिल्हूट स्कोर की व्याख्या कैसे करें

सिल्हूट स्कोर पढ़ने के लिए एक मोटा मार्गदर्शक:

  • 1 के करीब: बिंदु अपने क्लस्टर के भीतर अच्छी तरह हैं और दूसरों से दूर
  • लगभग 0.7: अच्छी क्लस्टरिंग, समूह स्पष्ट हैं और बिंदु अपने क्लस्टर के अन्य बिंदुओं के पास हैं
  • लगभग 0.5: उचित क्लस्टरिंग, क्लस्टरों में कुछ ओवरलैप है, पर वे फिर भी अलग किए जा सकते हैं
  • 0 के पास: क्लस्टर ओवरलैप करते हैं या सीमाएँ अस्पष्ट हैं। संरचना वास्तविक नहीं भी हो सकती है
  • 0 से नीचे: बिंदु गलत क्लस्टर के अधिक करीब हैं। ऐसा तब हो सकता है जब आप क्लस्टरों की गलत संख्या चुनते हैं या डेटा मूल रूप से अच्छी तरह क्लस्टर नहीं होता।

ऊपर दिए गए कटऑफ केवल मोटे मार्गदर्शक हैं। अच्छा सिल्हूट स्कोर किसे माना जाए, यह डेटासेट पर निर्भर करता है।

स्पार्स और उच्च-आयामी डेटा अक्सर कम स्कोर देता है, भले ही क्लस्टर अच्छे हों। घने और अच्छी तरह अलग डेटा 0.7 से ऊपर के स्कोर दे सकता है। आपको स्कोर की तुलना एक ही डेटासेट पर अलग-अलग मॉडलों के बीच करनी चाहिए, किसी सार्वभौमिक थ्रेशहोल्ड से नहीं।

सिल्हूट स्कोर कैसे गणना करें

आप सिल्हूट स्कोर को एक-एक बिंदु के लिए गणना करते हैं। एक बिंदु के लिए यह ऐसे काम करता है:

चरण 1: a की गणना करें, यानी बिंदु से अपने क्लस्टर के हर अन्य बिंदु तक की औसत दूरी। यदि बिंदु ऐसे क्लस्टर में है जिसमें 4 अन्य बिंदु हैं, और उन तक की दूरियाँ 1.2, 1.5, 1.0, और 1.3 हैं:

सिल्हूट स्कोर गणना (1)

सिल्हूट स्कोर गणना (1)

चरण 2: निकटतम पड़ोसी क्लस्टर ढूँढें (वह, जो बिंदु के अपने क्लस्टर के अलावा, बिंदु से औसत दूरी में सबसे कम है)। फिर b की गणना करें, यानी उस क्लस्टर के हर बिंदु तक की औसत दूरी। यदि निकटतम क्लस्टर में 5 बिंदु हैं जिनकी दूरियाँ 2.4, 2.8, 3.0, 2.6, और 2.7 हैं:

सिल्हूट स्कोर गणना (2)

सिल्हूट स्कोर गणना (2)

चरण 3: a और b को सूत्र में रखें:

सिल्हूट स्कोर गणना (3)

सिल्हूट स्कोर गणना (3)

चरण 4: यह प्रक्रिया डेटासेट के प्रत्येक बिंदु के लिए दोहराएँ। क्लस्टरिंग का समग्र सिल्हूट स्कोर सभी बिंदुओं के स्कोर का औसत है।

Python में सिल्हूट स्कोर का उदाहरण

Scikit-learn आपको सिल्हूट स्कोर की गणना के दो फ़ंक्शन देता है, दोनों sklearn.metrics के भीतर:

  • silhouette_score() पूरी क्लस्टरिंग के लिए औसत स्कोर लौटाता है

  • silhouette_samples() प्रत्येक व्यक्तिगत बिंदु के लिए स्कोर लौटाता है

इन्हें एक सिंथेटिक डेटासेट पर KMeans के साथ ऐसे उपयोग करें:

from sklearn.cluster import KMeans
from sklearn.datasets import make_blobs
from sklearn.metrics import silhouette_score, silhouette_samples

# Synthetic data with 4 clusters
X, _ = make_blobs(n_samples=500, centers=4, cluster_std=1.0, random_state=42)

# Clustering model
kmeans = KMeans(n_clusters=4, random_state=42, n_init=10)
labels = kmeans.fit_predict(X)

# Overall silhouette score
score = silhouette_score(X, labels)
print(f"Overall silhouette score: {score:.3f}")

# Per-point silhouette values
sample_scores = silhouette_samples(X, labels)
print(f"First 5 point scores: {sample_scores[:5]}")

उपरोक्त कोड स्निपेट चलाने पर आपको यह आउटपुट मिलेगा:

Python उदाहरण आउटपुट

Python उदाहरण आउटपुट

0.791 का समग्र स्कोर दर्शाता है कि चारों क्लस्टर अच्छी तरह परिभाषित और अलग-अलग हैं।

प्रत्येक बिंदु के स्कोर आपको हर डेटा बिंदु का विश्लेषण करने देते हैं. 

उच्च व्यक्तिगत स्कोर वाले बिंदु अपने क्लस्टर के भीतर अच्छी तरह हैं। कम या नकारात्मक स्कोर वाले बिंदु सीमा पर हैं या ग़लत असाइन हुए हैं—जो आउटलायर पहचानने या सीमा-रेखा बिंदुओं की समीक्षा के लिए उपयोगी है।

क्लस्टरों की इष्टतम संख्या चुनना

सिल्हूट स्कोर का एक आम उपयोग KMeans के लिए सही k चुनना है. 

ऐसा करने में तीन चरण शामिल हैं:

  1. विभिन्न k मानों के लिए KMeans फिट करें
  2. हर फिट के लिए सिल्हूट स्कोर निकालें
  3. वह k चुनें जिसका स्कोर सबसे अधिक हो

इसके लिए कोड यह है:

from sklearn.cluster import KMeans
from sklearn.datasets import make_blobs
from sklearn.metrics import silhouette_score

X, _ = make_blobs(n_samples=500, centers=4, cluster_std=1.0, random_state=42)

# Fit KMeans for k=2 to k=10 and keep track of the silhouette score for each
k_values = range(2, 11)
scores = []
for k in k_values:
    kmeans = KMeans(n_clusters=k, random_state=42, n_init=10)
    labels = kmeans.fit_predict(X)
    scores.append(silhouette_score(X, labels))
    print(f"k={k}: silhouette = {scores[-1]:.3f}")

हर k के लिए आपको ऐसा आउटपुट स्कोर दिखेगा:

विभिन्न k मानों पर सिल्हूट स्कोर

विभिन्न k मानों पर सिल्हूट स्कोर

सबसे उच्च स्कोर k=4 पर है। यही मान आपको चुनना चाहिए।

ध्यान रहे कि सिल्हूट स्कोर डोमेन ज्ञान का विकल्प नहीं है। यदि आपके व्यवसायिक प्रश्न के लिए 5 ग्राहक खंड चाहिए और सिल्हूट 4 पर सबसे अधिक है, तो स्वतः 4 न चुनें। मीट्रिक दिखाती है कि डेटा में सबसे साफ संरचना कहाँ है, पर कभी-कभी सही क्लस्टरों की संख्या वही होती है जो आपके संदर्भ में अर्थपूर्ण हो।

सिल्हूट स्कोर बनाम अन्य क्लस्टरिंग मीट्रिक

सिल्हूट स्कोर शायद क्लस्टरिंग का आकलन करने की सबसे सामान्य मीट्रिक है, लेकिन एकमात्र नहीं। यहाँ इसका विकल्पों से तुलना है।

सिल्हूट स्कोर बनाम एल्बो मेथड

एल्बो मेथड KMeans में k चुनने की दृश्य तकनीक है। आप विभिन्न k मानों के लिए मॉडल फिट करते हैं, इनर्शिया (within-cluster sum of squares) को k के सापेक्ष प्लॉट करते हैं, और उस मान को चुनते हैं जहाँ कर्व में तेज मोड़ दिखता है।

यहाँ एल्बो मेथड का फायदा है क्योंकि इसे चलाना तेज और आसान है। लेकिन "एल्बो" हमेशा स्पष्ट नहीं होता। अव्यवस्थित डेटा पर कर्व कभी-कभी स्मूथ दिखता है और मोड़ कहाँ है, बताना मुश्किल होता है।

सिल्हूट स्कोर आपको हर k के लिए एक वास्तविक संख्या देता है, जिससे आप अधिक सार्थक तुलना कर सकते हैं। इसे गणना करना धीमा है, पर निर्णय को केवल दृश्य व्याख्या पर नहीं छोड़ता।

त्वरित जाँच के लिए एल्बो मेथड का उपयोग करें। ठोस उत्तर चाहिए तो सिल्हूट स्कोर का।

सिल्हूट स्कोर बनाम Davies-Bouldin इंडेक्स

Davies-Bouldin इंडेक्स (DBI) प्रत्येक क्लस्टर और उसके सबसे समान क्लस्टर के बीच औसत समानता मापता है। कम DBI बेहतर क्लस्टरिंग को दर्शाता है, और परफेक्ट स्कोर 0 है।

DBI समानता की गणना के लिए क्लस्टर सेंट्रॉइड का उपयोग करता है, जो बड़े डेटासेट पर इसे सिल्हूट स्कोर से तेज बनाता है। यह सघन और अच्छी तरह अलग क्लस्टरों को पुरस्कृत करने के समान अंतर्ज्ञान का भी उपयोग करता है।

कमी यह है कि DBI आपको केवल पूरी क्लस्टरिंग के बारे में बताता है। सिल्हूट स्कोर प्रति-बिंदु स्कोर भी देता है, जिससे आप सीमा-रेखा बिंदु और आउटलायर ढूँढ सकते हैं।

यदि आप बड़े डेटासेट पर काम कर रहे हैं और गति मायने रखती है तो DBI का उपयोग करें। व्यक्तिगत बिंदुओं को देखना हो तो सिल्हूट स्कोर का।

सिल्हूट स्कोर बनाम Calinski-Harabasz इंडेक्स

Calinski-Harabasz इंडेक्स (CH), जिसे variance ratio criterion भी कहते हैं, क्लस्टर-बीच प्रसरण और क्लस्टर-भीतर प्रसरण का अनुपात है। उच्च स्कोर बेहतर क्लस्टरिंग दर्शाता है, और स्कोर अबाधित है (कोई ऊपरी सीमा नहीं)।

CH तेज है और बड़े डेटासेट पर अच्छा काम करता है क्योंकि यह केवल क्लस्टर-स्तरीय सांख्यिकी पर आधारित है। सिल्हूट और DBI की तरह, यह उत्तल, अच्छी तरह अलग क्लस्टरों पर सबसे अच्छा काम करता है।

CH का कोई प्राकृतिक पैमाना भी नहीं है, इसलिए आप CH स्कोर की तुलना केवल एक ही डेटासेट पर मॉडलों के बीच कर सकते हैं, अलग-अलग डेटासेट के बीच नहीं।

जब आपका डेटासेट बड़ा हो और आपको परिणाम तेज चाहिए हों तो CH का उपयोग करें। व्याख्यात्मकता और व्यक्तिगत बिंदुओं की अंतर्दृष्टि चाहिए हो तो सिल्हूट स्कोर का।

आंतरिक बनाम बाह्य क्लस्टरिंग मीट्रिक

ऊपर की मीट्रिक (सिल्हूट, DBI, CH, एल्बो) सभी आंतरिक मीट्रिक हैं। वे केवल डेटा का उपयोग करके, बिना ग्राउंड-ट्रुथ लेबल के, क्लस्टरिंग का मूल्यांकन करती हैं। यही उन्हें वास्तविक दुनिया की क्लस्टरिंग समस्याओं के लिए मानक विकल्प बनाता है, जहाँ लेबल मौजूद नहीं होते।

बाह्य मीट्रिक ज्ञात लेबल के विरुद्ध क्लस्टर असाइनमेंट की तुलना करती हैं। Adjusted Rand Index (ARI), Normalized Mutual Information (NMI), और होमोजिनीटी आम उदाहरण हैं। इन्हें तब उपयोग किया जाता है जब आपके पास लेबल हों और आप जाँचना चाहें कि क्लस्टरिंग एल्गोरिद्म उन्हें कितना सही पाता है।

लेबल न होने पर, जो कि सामान्य स्थिति है, आंतरिक मीट्रिक का उपयोग करें। लेबल वाले डेटा पर क्लस्टरिंग एल्गोरिद्म की बेंचमार्किंग करते समय बाह्य मीट्रिक का उपयोग करें।

यहाँ मीट्रिक का साथ-साथ पुनरावलोकन है:

विधि सीमा सर्वोत्तम मान गति इस्तेमाल करें
सिल्हूट स्कोर -1 से 1 1 के करीब बड़े डेटासेट पर धीमा व्याख्यात्मकता और प्रति-बिंदु अंतर्दृष्टि
एल्बो मेथड 0 से अनंत एल्बो देखें तेज त्वरित जाँच
Davies-Bouldin इंडेक्स 0 से अनंत 0 के करीब तेज बड़े डेटासेट
Calinski-Harabasz इंडेक्स 0 से अनंत जितना ऊँचा उतना बेहतर तेज बड़े, बिना लेबल वाले डेटासेट

विकल्पों के मुकाबले सिल्हूट स्कोर

सिल्हूट स्कोर की सीमाएँ

सिल्हूट स्कोर की कुछ सीमाएँ हैं जिन्हें जानना ज़रूरी है:

  • दूरी-आधारित क्लस्टरिंग मानता है: डिफ़ॉल्ट रूप से सिल्हूट स्कोर Euclidean दूरी पर आधारित है। यह KMeans और अन्य सेंट्रॉइड-आधारित एल्गोरिद्म पर अच्छा काम करता है, लेकिन DBSCAN जैसे density-based तरीकों पर नहीं, जहाँ क्लस्टरों के आकार मनमाने होते हैं और स्पष्ट सेंट्रॉइड नहीं होता
  • छोटे, अच्छी तरह अलग क्लस्टरों के साथ सबसे अच्छा काम: यह मीट्रिक सघन, गोलाकार और दूर-दूर स्थित क्लस्टरों को पुरस्कृत करता है। यदि आपके डेटा में क्लस्टर पास-पास हैं या ओवरलैप करते हैं, तो स्कोर कम होगा—even यदि क्लस्टरिंग सही हो
  • अनियमित क्लस्टर आकारों के साथ उपयुक्त नहीं: वास्तविक दुनिया में क्लस्टर हमेशा उत्तल नहीं होते। यदि आपके डेटा में ऐसा है, तो असाइनमेंट सही होने पर भी सिल्हूट स्कोर कम आ सकते हैं
  • बड़े डेटासेट पर संगणनात्मक लागत: सिल्हूट स्कोर के लिए जोड़ीदार दूरियाँ चाहिए, जो O(n^2) के रूप में स्केल होती हैं। लाखों बिंदुओं वाले डेटासेट पर यह महँगा पड़ता है
  • चुनी गई दूरी मीट्रिक के प्रति संवेदनशीलता: आप Euclidean, Manhattan, cosine या कोई अन्य दूरी लें—स्कोर बदलता है। यदि आपका डेटा Euclidean मान्यताओं का पालन नहीं करता, तो सिल्हूट स्कोर भटका सकता है

सिल्हूट स्कोर के उपयोग के सर्वोत्तम तरीके

सिल्हूट स्कोर सबसे अच्छा तब काम करता है जब आप कुछ बुनियादी तरीकों का पालन करें:

  • एकाधिक क्लस्टरिंग समाधानों की तुलना करें: केवल एक सिल्हूट स्कोर न निकालें। आपको अलग-अलग k मानों (या अलग एल्गोरिद्म) के साथ क्लस्टरिंग मॉडल फिट करने चाहिए और उनके स्कोर साथ-साथ तुलना करने चाहिए
  • स्कोर के साथ क्लस्टरों का विज़ुअलाइज़ेशन करें: केवल संख्या पूरी कहानी नहीं बताती। अपने क्लस्टर प्लॉट करें और देखें कि उनके आकार अर्थपूर्ण हैं या नहीं
  • केवल सबसे ऊँचे स्कोर के लिए अनुकूलन न करें: k=2 वाली क्लस्टरिंग का स्कोर अक्सर k=5 से ऊँचा आता है—भले ही आपकी समस्या में 5 क्लस्टर अधिक अर्थपूर्ण हों
  • डोमेन ज्ञान के साथ मिलाएँ: स्कोर दिखाता है कि डेटा में सबसे साफ संरचना कहाँ है। डोमेन ज्ञान बताता है कि कौन-सी संरचना सचमुच उपयोगी है। दोनों का उपयोग करें
  • एकाधिक क्लस्टरिंग मीट्रिक से मूल्यांकन करें: सिल्हूट, DBI, CH और अन्य मीट्रिक क्लस्टरिंग गुणवत्ता को अलग ढंग से मापते हैं। जब वे सहमत हों तो आप सही राह पर हैं; जब न हों, तो डेटा को देखें

निष्कर्ष

सिल्हूट स्कोर क्लस्टरिंग का मूल्यांकन करने के सबसे सहज तरीकों में से एक है क्योंकि यह दिखाता है कि बिंदु कितने कसकर समूहित हैं और क्लस्टर कितने अच्छे से अलग हैं. 

आप इसे बिंदु-दर-बिंदु गणना करते हैं, परिणामों का औसत लेते हैं, और -1 से 1 के बीच एक एकल संख्या पाते हैं। 1 के करीब स्कोर का मतलब बेहतर परिभाषित क्लस्टर, और 0 के पास या नीचे स्कोर का मतलब यह है कि संरचना वास्तव में संरचना नहीं है

पर सिल्हूट स्कोर सिर्फ शुरुआत है। आपको इसे क्लस्टर विज़ुअलाइज़ेशन और सबसे बढ़कर, समस्या के अपने डोमेन ज्ञान के साथ जोड़ना चाहिए। जब ये सब एक ही दिशा में इशारा करें, तभी आप परिणाम पर भरोसा कर सकते हैं।

सिल्हूट स्कोर Unsupervised Learning in Python की बड़ी तस्वीर का हिस्सा है। आज ही नामांकन करें और बिना लेबल वाले डेटा से क्लस्टर करना, ट्रांसफॉर्म करना, विज़ुअलाइज़ करना और अंतर्दृष्टि निकालना सीखें।

विषय

DataCamp के साथ सीखें

course

Cluster Analysis in R

4 घंटा
44.1K
Develop a strong intuition for how hierarchical and k-means clustering work and learn how to apply them to extract insights from your data.
विस्तृत जानकारी देखेंRight Arrow
कोर्स शुरू करें
और देखेंRight Arrow