Penulis: Prof. Madya Dr. Nurulkamal Masseran
Pensyarah Kanan
Jabatan Sains Matematik, Universiti Kebangsaan Malaysia
Saban hari kita dibentangkan dengan maklumat-maklumat sama ada dalam dalam bentuk data berangka ataupun bukan angka. Ianya bukanlah perkara asing lagi dalam kehidupan masa kini. Dalam segenap lapisan masyarakat, maklumat-maklumat seperti turun naik harga barang, unjuran KDNK negara, taburan umur dan kaum, turun naik kadar inflasi, rekod suhu harian, rekod kadar tukaran wang asing, dan lain-lain, semuanya dibentangkan sebagai data. Namun, untuk memahami lambakan data ini, adalah sukar untuk kita meneliti setiap angka secara satu demi satu. Di sinilah sukatan memusat memainkan peranan penting. Secara ringkasnya, sukatan memusat memberikan kita satu nilai yang dapat menggambarkan kedudukan titik tengah atau nilai tipikal bagi suatu set data. Bagi kebanyakan orang, sukatan memusat yang seringkali digunakan ialah purata data.
Sebagai contoh, misalkan seorang guru mempunyai data keputusan peperiksaan matematik bagi 300 orang pelajar di sebuah sekolah. Untuk membuat kesimpulan berkaitan prestasi pelajar di sekolah tersebut, adalah tidak praktikal untuk dilaporkan markah pelajar satu per satu. Oleh itu, suatu ukuran yang munasabah perlulah digunakan untuk menggambarkan titik tengah yang boleh menghuraikan secara ringkas pencapaian umum keseluruhan pelajar tersebut. Iaitu, jika purata markah dihitung dan mendapati nilainya ialah 72, maka nilai purata ini meringkaskan data tersebut kepada kesimpulan bahawa secara umum prestasi subjek matematik bagi pelajar sekolah tersebut adalah sederhana baik dengan markah sekitar 72. Inilah salah satu kegunaan utama bidang statistik. Iaitu, untuk meringkaskan dan mengektrak ciri-ciri utama dalam data yang kompleks, dan kemudian mengolahnya menjadi maklumat yang lebih mudah untuk difahami tanpa perlu melihat setiap cerapan data satu per satu.
Walaupun purata data merupakan ukuran statistik yang popular dan paling kerap digunakan oleh masyarakat awam, namun sukatan memusat dalam statistik bukanlah hanya purata biasa. Ukuran purata tidak boleh digunakan secara sewenang-wenangnya terhadap mana-mana data tanpa memahami dengan baik ciri-ciri dan tingkah-laku data tersebut. Ini kerana, data dengan tingkah-laku dan sifat yang berbeza akan memerlukan ukuran yang berbeza bagi mengenalpasti titik tengah yang tepat. Dalam artikel ini, kita akan membincangkan kepelbagaian teknik sukatan memusat data, dan bagaimana untuk memilih teknik yang sesuai terhadap data dengan ciri-ciri yang berbeza.
Min, Median dan Mod
Ukuran purata juga dikenali sebagai min data, atau secara lebih khusus ialah min aritmetik. Min data membolehkan kita mengenalpasti titik tengah bagi taburan kekerapan pemboleh ubah berangka dengan mengambil kira semua cerapan. Iaitu, min data mengandaikan setiap data mempunyai pemberat yang sama. Penghitungan dibuat menerusi penjumlahkan semua nilai-nilai cerapan data dan kemudian membahagikannya dengan bilangan cerapan (lihat Rajah 1). Namun, ukuran min sebenarnya terhad terhadap data berangka yang memiliki ciri-ciri taburan simetri seperti taburan Normal. Malah, ukuran min tidak sesuai digunakan jika data mengandungi nilai-nilai ekstrem ataupun data pencil. Jika dua ciri asas tersebut tidak dipenuhi, maka min bukanlah ukuran yang sesuai untuk menggambarkan titik tengah data. Contoh yang popular ialah berkaitan ukuran titik tengah pendapatan rakyat. Misalkan kebanyakan rakyat memiliki pendapatan yang tertabur sekitar RM2000-RM4000 dengan min ialah RM3500, namun jika terdapat sebilangan kecil individu yang mempunyai pendapatan besar sehingga melebihi RM200 000, maka nilai min pendapatan tersebut akan meningkat kepada RM15,000. Ini sekaligus menyimpang jauh dari realiti sebenar titik tengah pendapatan rakyat.
Oleh itu, dalam senario tersebut, sukatan memusat yang boleh digunakan ialah ukuran median. Median merujuk kepada nilai nombor yang berada di tengah-tengah apabila sesuatu set data disusun mengikut tertib menaik. Ianya ialah titik tengah yang membahagikan data kepada dua bahagian yang sama banyak (lihat Rajah 1). Jadi, dalam kes pendapatan rakyat tersebut, data-data dari golongan kaya yang berpendapatan tinggi tidak akan banyak mempengaruhi nilai titik tengah data. Ini sekaligus akan memberikan ukuran yang lebih teguh berkaitan titik tengah pendapatan rakyat. Namun, ukuran median sebenarnya menggambarkan titik tengah pemisah antara 50% kumpulan berpendapatan tinggi dan 50% berpendapatan rendah. Sebaliknya, jika kita berminat terhadap titik tengah dalam julat gaji yang paling ramai diterima oleh kelompok majoriti rakyat, ukuran mod pula boleh digunakan. Bagi data berangka dengan ciri selanjar, mod boleh ditakrifkan sebagai titik data yang mempunyai kekerapan relatif tertinggi dalam set data tersebut (lihat Rajah 1 & 2). Manakala, bagi data bukan angka yang berkategori, mod merujuk kepada nilai yang paling kerap berulang dalam suatu set data.
Bagi data dengan taburan yang simetri, ketiga-tiga ukuran min, median dan mod akan mengesan titik tengah yang sama nilai. Namun, jika data tertabur secara pincang ke kanan atau ke kiri, setiap ukuran min, median dan mod akan mengesan titik tengah yang berbeza nilai (Dodge, 2008). Di sini, penganalisis data perlu bijak untuk memilih teknik sukatan memusat yang tepat bersesuaian dengan sifat data yang dikaji.

Nota: Imej dihasilkan menggunakan Google Gemini

Nota: Imej dihasilkan menggunakan Google Gemini
Min Berpemberat, Min Geometri dan Min Harmonik
Apabila nilai data yang berbeza mempunyai tahap kepentingan yang berbeza, min aritmetik tidak sesuai digunakan untuk mendapatkan ukuran titik tengah. Sebagai contoh, majikan menilai skor kompentesi bagi calon-calon yang ditemuduga dengan pemberat berikut; pengalaman kerja (40%), kemahiran komunikasi (30%), tahap pendidikan (20%), dan penampilan (10%). Iaitu, nilai pemberat bagi setiap data mewakili tahap kepentingannya. Data sebegini memerlukan ukuran min pemberat untuk mendapatkan titik tengah data (lihat Rajah 2). Malah, ukuran min berpemberat juga sangat penting untuk menghitung titik tengah bagi data berkaitan tinjauan kaji selidik dan banci dengan mengumpukkan purata nilai-nilai sampel terhadap perkadaran sebenar bagi setiap kumpulan dalam populasi.
Selain itu, jika kita berurusan dengan data yang bersifat pekadaran pertumbuhan, indeks, ataupun jujukan geometri, ukuran titik tengah data yang perlu digunakan ialah min geometri. Min geometri ialah purata yang menunjukkan kecenderungan memusat atau nilai tipikal bagi suatu set nombor dengan menggunakan hasil darab nilai-nilainya. Ia sangat berguna bagi data yang mana angka-angkanya mempunyai kesan pengkompaunan dari masa ke semasa seperti data pelaburan, pertumbuhan dinamik biologi, perkadaran penyebaran penyakit berjangkit, perkadaran pertumbuhan indeks ekonomi, dan lain-lain (lihat Rajah 2). Manakala, apabila kita berurusan dengan data kadar ataupun nisbah, min harmonik perlu digunakan sebagai ukuran titik tengah. Min harmonik memberikan penalti yang lebih besar kepada nombor-nombor besar, dan sebaliknya memberikan pemberat yang lebih tinggi kepada nombor-nombor yang lebih kecil dalam sesuatu set data menerusi formula hasil tambah salingan (Dodge, 2008).

Nota: Imej dihasilkan menggunakan Google Gemini
Min Fréchet
Min Fréchet pula merupakan teknik sukatan memusat bagi ruang tak linear atau ruang metrik. Iaitu, ianya berguna untuk mengukur titik tengah pada data jenis lengkung, siri masa, bentuk, trajektori, imej dan objek geometri (Bigot, 2013). Konsep min Fréchet adalah untuk mencari satu titik yang meminimumkan jumlah kuasa dua jarak kepada semua titik-titik data yang lain (lihat Rajah 3). Ukuran min Fréchet digunakan dalam analisis bentuk seperti dalam bidang perubatan untuk menghitung “bentuk purata” bagi anatomi organ seperti otak berdasarkan data ribuan imbasan MRI pesakit yang berbeza (Davis, 2008). Ianya juga merupakan kaedah yang sesuai digunakan untuk data yang bersifat sudut dan berarah yang digunapakai dalam statistik berarah (directional statistic). Malah, ianya juga digunakan untuk menghitung interpolasi bagi putaran dan orientasi objek 3D dalam teknologi robotik.

Nota: Imej dihasilkan menggunakan Google Gemini
Min Dinamik
Apabila kita berurusan dengan data jenis aliran (data streaming), maklumat yang diproses akan sentiasa berubah-ubah dengan sangat cepat terhadap masa nyata. Terutama data seperti pasaran saham, iklim dan cuaca, gelombang seismik, sensor IoT, serta data berkaitan aplikasi dalam pembelajaran mesin dan AI. Bagi data jenis ini, ukuran titik tengahnya adalah bersifat rekursif. Iaitu, ianya memerlukan penghitungan kemaskini yang berterusan bagi menangkap maklumat ataupun perubahan terkini dalam data yang boleh berlaku dengan pantas (lihat Rajah 4). Kaedah-kaedah ukuran seperti purata bergerak (rolling mean), min bergerak eksponen, pelicinan eksponen, penapis Kalman, dan lain-lain, perlu digunakan untuk menangkap maklumat trend, perubahan rejim, tingkah laku turun naik yang ganjil, sifat autokorelasi ataupun struktur yang berubah-ubah dari semasa ke semasa (Hyndman et al. 2008)

Nota: Imej dihasilkan menggunakan Google Gemini
Selain daripada beberapa ukuran-ukuran yang dibincangkan di atas, terdapat banyak lagi teknik sukatan memusat yang boleh digunakan bersesuaian dengan ciri-ciri dan tingkah-laku data yang khusus. Antaranya, seperti min winsor (winsorized mean), min terpangkas (trimmed mean), min reruang (spatial mean), min Tukey, Barycenter, min spektrum (spectral mean), min berarah (directional mean), Midhinge, Trimean, min kuantil, biweight location, min multivariat, purata Bayesan (Bayesian average), dan banyak lagi. Secara kesimpulannya, janganlah kita secara mudah menggunakan purata biasa untuk menghuraikan mana-mana data. Gunakanlah teknik ukuran statistik yang bersesuaian untuk mendapatkan maklumat yang tepat bersesuaian dengan ciri-ciri data tertentu. Ibarat peribahasa, “lain padang lain belalangnya, lain lubuk lain ikannya”.
[ARTIKEL LAIN PENULIS – EVA: Kerangka Statistik untuk Fenomena Luar jangka]
[ARTIKEL LAIN PENULIS – Legasi Rantai Markov: Dari Perbalahan Akademik ke Teknologi AI]
[ARTIKEL LAIN PENULIS – Penaakulan Sebab-Musabab: Enjin Teknologi Pintar Masa Hadapan]
[ARTIKEL LAIN PENULIS – Peranan Jarak Dalam Memahami Tingkahlaku Data]
[ARTIKEL LAIN PENULIS – Dilema Data Pencil]
[ARTIKEL LAIN PENULIS – Mengapa Taburan Normal Begitu Popular?]
[ARTIKEL LAIN PENULIS- Taburan hukum-kuasa: Ketakseimbangan yang Teratur]
[ARTIKEL LAIN PENULIS – Simulasi Monte Carlo: Merungkai Kerumitan menerusi Kerawakan]
[ARTIKEL LAIN PENULIS- Prinsip Parsimoni: Seni “bersederhana” untuk Mencapai Hasil Optimum]
Rujukan:
Bigot, J. (2013). Fréchet means of curves for signal averaging and application to ECG data analysis. The Annals of Applied Statistics, 2384-2401.
Davis, B. C. (2008). Medical image analysis via Fréchet means of diffeomorphisms (Doctoral dissertation, The University of North Carolina at Chapel Hill).
Dodge, Y. (2008). The concise encyclopedia of statistics. Springer Science & Business Media.
Hyndman, R., Koehler, A., Ord, K., & Snyder, R. (2008). Forecasting with exponential smoothing: the state space approach. Berlin, Heidelberg: Springer Berlin Heidelberg.



