Data Toplama və Təmizləmə: Mənbələr, Formatlar və Scrubbing

19 İyul 2026·👁 7 baxış

OSEMN çərçivəsinin ilk iki mərhələsi — toplamaq (obtain) və təmizləmək (scrub) — hər uğurlu data layihəsinin təməlidir. Səhv və ya natamam data ilə başlasan, sonrakı bütün analiz yanlış nəticəyə gətirib çıxarar. Bu yazıda datanı harada tapmaq, hansı formatlarda gəldiyi və necə təmizlənməli olduğunu izah edirik.

Bu yazı data analitikasi nedir bələdçisinin davamıdır.

Datanı harada tapmaq? 4 əsas mənbə

Bir data sualı ilə qarşılaşanda müxtəlif mənbələrə müraciət edə bilərsən. Onları dörd qrupa bölmək olar:

1. Pulsuz, açıq mənbələr

Hökumət saytları və açıq repozitoriyalar sosial-iqtisadi datanı (əhali demoqrafikası, məişət gəliri, təhsil) pulsuz təqdim edir. Nümunələr: Eurostat (Avropa İttifaqının rəsmi statistikası), OECD (İqtisadi Əməkdaşlıq və İnkişaf Təşkilatı), Dünya Bankı, BMT və ABŞ Census Bureau. Bu mənbələr etibarlı və güncəldir.

2. Şirkətə xas data

İşlədiyin şirkətin öz topladığı və ictimai olmayan datası. Məsələn, bütün satışları qeyd edən sistem, ya da saytı izləmək üçün istifadə olunan Google Analytics. Telefon şirkəti müştərilərinin zəng və data istifadəsi haqqında datası da buna aiddir.

3. Abunə olunan bazalar

Şirkətlər öz sahələri üçün datalara abunə olur. Nümunə: Nielsen (insanların media istifadəsi — hansı TV kanalına baxır, hansı saytları ziyarət edir) və Bloomberg terminalı (maliyyə şirkətləri üçün ödənişli maliyyə məlumatı). Nielsen datası, məsələn, TV kanalına idman azarkeşlərinin sayını reklamçılara göstərməyə imkan verir.

4. Özün topladığın data

Lazımi data mövcud deyilsə, onu özün yaratmalısan: sorğu (questionnaire), müsahibə və ya istifadəçi davranışını müşahidə etmək. SurveyMonkey və Google Forms bunun üçün asan, hazır şablonlu alətlərdir.

Data hansı formatlarda gəlir?

Data yalnız rəqəm deyil — mətn, şəkil, video və ya səs də ola bilər. Üç əsas format:

Numeric (rəqəmsal) data

Kəmiyyət datası — rəqəmlərlə ifadə olunur və ölçülə bilir: yaş, gəlir, satış rəqəmləri, səhm qiymətləri. Ən çox cədvəl (tabular) formatında, tez-tez .CSV faylı kimi saxlanır — sətir və sütunlardan ibarət xanalar. Bu struktur böyük həcmli datanı çeşidləmə və filtrləmə ilə tez emal etməyə imkan verir.

Text (mətn) data

Struktursuz data — hərf və sözlər. Mənbələr: sosial media paylaşımları, e-poçtlar, tvitlər, bloq yazıları, müştəri rəyləri. Çox vaxt təbii dil emalı (NLP) ilə təhlil olunur — məsələn, sentiment analizi ilə müştərilərin məhsul haqqında nə hiss etdiyini müəyyən etmək.

Visual (vizual) data

Şəkil və videolar. Nümunələr: istehsalatda keyfiyyət nəzarəti üçün məhsul şəkilləri, öz-özünə sürən avtomobillərin kameralarının çəkdiyi yol görüntüləri (maşın öyrənmə alqoritmlərini öyrətmək üçün) və tibbi görüntüləmə. Məqsədindən asılı olaraq bəzən vizual data rəqəmsaldan daha faydalıdır.

Strukturlaşmış və struktursuz data

Formatlarla bağlı vacib bir ayrım da strukturlaşmış (structured) və struktursuz (unstructured) data arasındadır. Strukturlaşmış data səliqəli sətir və sütunlara — cədvələ — sığır. Rəqəmsal data adətən belədir və onunla işləmək asandır: çeşidləyir, filtrləyir, cəm hesablayırsan. Struktursuz data isə bu qəlibə sığmır: mətn, şəkil, video, səs. Onunla işləmək daha çətindir və çox vaxt xüsusi texnikalar (NLP, şəkil tanıma) tələb edir.

Bir çox real layihədə hər iki növ birlikdə gəlir. Məsələn, e-ticarət mağazasında satış rəqəmləri strukturlaşmış, müştəri rəyləri isə struktursuz datadır. Yaxşı analitik ikisini birləşdirir: rəqəmlər «nə» baş verdiyini, rəylər isə «niyə» baş verdiyini göstərir. Datanın hansı struktura malik olduğunu bilmək onu necə emal edəcəyini müəyyən edir.

Scrubbing: datanı təmizləmək

İkinci mərhələ — scrubbing (təmizləmə) — xam, «çirkli» datanı təmiz dataya çevirir. Çirkli data təkrar qeydlər, uyğunsuz format, çatışmayan dəyərlər və ya yanlış məlumat ehtiva edir. Təmiz data isə yalnız unikal qeydlərdən ibarətdir, ardıcıl struktura malikdir, çatışmayan dəyəri yoxdur və etibarlıdır. Təmizləmə prosesi dörd əsas tapşırığa bölünür:

  1. Təkrarları silmək (remove duplicates) — eyni qeydin təkrarlarını aradan qaldırmaq.
  2. Qeydləri formatlamaq (format records) — ardıcıl struktur yaratmaq (məsələn, bütün ölçüləri eyni sistemə salmaq).
  3. Çatışmayan dəyərləri həll etmək (handle missing values) — boş xanalarla necə davranacağına qərar vermək.
  4. Yanlış dəyərləri yoxlamaq (check for wrong values) — səhv və qeyri-real məlumatı aşkar etmək.

Niyə bu qədər vacibdir? Çünki datadakı səhvlər araşdırma və analizi poza, yanlış nəticələrə gətirə və hətta modelin ümumiyyətlə işləməsinə mane ola bilər. Anna butik nümunəsində ölçülərin bəziləri «small/medium/large», bəziləri Amerika rəqəm ölçüləri, bəziləri İtalyan ölçüləri idi — o, hamısını vahid kateqoriyaya çevirdi. Təmizləməyə vaxt ayırmaq sonrakı problemlərdən qorunmağa dəyər.

Təkrarları silmək

Eyni qeyd datasetdə bir neçə dəfə görünəndə nəticələr təhrif olunur. Məsələn, eyni müştəri iki dəfə sayılırsa, müştəri sayını olduğundan çox göstərir. Təkrarları müəyyən edib silmək təmiz başlanğıc üçün ilk addımdır.

Qeydləri formatlamaq

Data ardıcıl formatda olmalıdır. Tarixlər eyni formata (məsələn, GG/AA/İİİİ), mətnlər eyni böyük/kiçik hərf standartına, ölçülər eyni sistemə salınmalıdır. Formatlaşdırma olmadan proqram eyni məlumatı fərqli kimi qəbul edə bilər — «Bakı» və «baku» iki ayrı dəyər kimi görünə bilər.

Çatışmayan dəyərləri həll etmək

Bəzi xanalar boş qala bilər. Bunlarla necə davranmaq lazımdır? Variantlar: həmin sətri silmək, boşluğu orta və ya median ilə doldurmaq, ya da xüsusi «məlum deyil» dəyəri qoymaq. Seçim datanın növündən və nə qədər boşluq olduğundan asılıdır.

Yanlış dəyərləri yoxlamaq

Bəzi dəyərlər real olmaya bilər: 250 yaş, mənfi qiymət və ya gələcək tarixli satış. Bu anomaliyaları aşkarlayıb düzəltmək lazımdır, əks halda analizi çaşdırırlar.

Sampled və first/third-party data

Data toplayanda iki əlavə anlayışı bilmək lazımdır. Birincisi — sampled (seçmə) data. Bəzən bütün əhalini deyil, təmsil edici bir nümunəni araşdırırsan. Bu, sürəti artırır, amma nümunə kifayət qədər böyük və təmsil edici olmasa, nəticə yanıltıcı ola bilər. İkincisi — datanın mənbəyə görə növü. First-party data birbaşa öz müştərilərindən toplanır (ən dəqiq və sənə məxsus). Third-party data isə kənar tərəf tərəfindən toplanıb satılır — daha geniş, amma az dəqiq və çox vaxt məxfilik baxımından həssasdır. Analiz üçün datanı seçəndə bu fərqləri nəzərə almaq keyfiyyətli nəticə üçün əsasdır.

Praktik olaraq, layihəyə başlayanda datanı necə əldə edəcəyini əvvəlcədən düşün: pulsuz mənbələr mövcuddurmu, şirkətinin hansı datalara çıxışı var, lazımi data yoxdursa onu necə toplayacaqsan? Bu planlaşdırma sonrakı bütün mərhələləri asanlaşdırır.

Data mənbələrinin etibarlılığı

Datanı toplayarkən onun etibarlılığını qiymətləndirmək vacibdir: mənbə güvənilirdirmi, data güncəldirmi, necə toplanıb? Hökumət və beynəlxalq təşkilat mənbələri adətən etibarlıdır. Kənar mənbədən data alanda isə onu əvvəlcədən görə bilmək və necə toplandığını bilmək lazımdır — əks halda keyfiyyəti aşağı və ya məxfilik baxımından riskli ola bilər.

Tez-tez verilən suallar (FAQ)

Ən yaxşı pulsuz data mənbələri hansılardır?

Eurostat, OECD, Dünya Bankı, BMT və ABŞ Census Bureau — sosial-iqtisadi data üçün etibarlı və pulsuz mənbələrdir.

Scrubbing ilə cleaning eyni şeydir?

Bəli. Scrubbing və data cleaning eyni prosesi bildirir — çirkli datanı təmiz dataya çevirmək.

CSV nədir?

Comma-Separated Values — rəqəmsal datanı sətir və sütunlarda saxlayan sadə cədvəl fayl formatıdır.

Niyə data təmizləmə bu qədər vacibdir?

Çünki çirkli data analizi poza, yanlış nəticələrə gətirə və hətta modelin işləməsinə mane ola bilər. Təmizləməyə vaxt ayırmaq sonrakı böyük problemlərin qarşısını alır.

Text data necə təhlil olunur?

Çox vaxt təbii dil emalı (NLP) ilə — məsələn, sentiment analizi ilə müştəri rəylərindəki münasibəti (müsbət/mənfi) müəyyən etmək.

Strukturlaşmış və struktursuz data arasında fərq nədir?

Strukturlaşmış data cədvələ (sətir/sütun) sığır — rəqəmlər kimi. Struktursuz data isə sığmır — mətn, şəkil, video kimi; emalı üçün xüsusi texnikalar lazımdır.

Sampled data nə vaxt istifadə olunur?

Bütün datanı emal etmək çox uzun və ya bahalı olanda təmsil edici bir nümunə götürülür. Nümunə kifayət qədər böyük və təmsil edici olmalıdır, əks halda nəticə yanıltıcı ola bilər.

Çatışmayan dəyərlərlə necə davranmalı?

Variantlar: həmin sətri silmək, boşluğu orta/median ilə doldurmaq və ya «məlum deyil» dəyəri qoymaq. Seçim datanın növündən və boşluğun həcmindən asılıdır.

Data toplamanın 4 əsas mənbəyi hansılardır?

Pulsuz açıq mənbələr (Eurostat, OECD), şirkətə xas data, abunə olunan bazalar (Nielsen, Bloomberg) və özün topladığın data (sorğu, müsahibə).

Nəticə: yaxşı analiz təmiz data ilə başlayır

Toplama və təmizləmə mərhələləri o qədər də cəlbedici görünməyə bilər — nə model qurmaq qədər «ağıllı», nə də vizuallaşdırma qədər «gözəl»dir. Amma bütün etibarlı analizin təməli məhz buradadır. Səhv və ya qərəzli mənbədən data toplasan, ya da onu düzgün təmizləməsən, sonrakı bütün iş — nə qədər mükəmməl olsa da — yanlış nəticəyə gətirər. Buna görə təcrübəli analitiklər bu mərhələlərə çox diqqət yetirir.

Praktik qayda: hər layihədə datanı harada tapacağını planlaşdır, mənbənin etibarlılığını yoxla, formatı anla və təmizləməyə kifayət qədər vaxt ayır. Bu vərdiş sənə uzun müddətdə çoxlu problemdən qurtaracaq və analizlərinin nəticələrinə güvənməyə imkan verəcək. Unutma: təmiz data olmadan ən mükəmməl model belə yanlış nəticə verir.

Çirkli data vs təmiz data: praktik nümunə

Fərqi konkretləşdirək. Çirkli bir müştəri datasetində eyni müştəri iki dəfə qeyd oluna bilər (təkrar), tarixlər müxtəlif formatlarda ola bilər (01/02/2026 və 2026-02-01), bəzi xanalar boş qala bilər (çatışmayan dəyər) və bir müştərinin yaşı «250» kimi qeyri-real ola bilər (yanlış dəyər). Təmiz versiyada hər müştəri bir dəfə, tarixlər eyni formatda, boş xana olmadan və real dəyərlərlə olur. Bu dörd problem məhz scrubbing-in dörd tapşırığına uyğun gəlir.

Data analitikinin işinin böyük hissəsi məhz bu mərhələdə keçir. Bəzi qiymətləndirmələrə görə analitiklər vaxtlarının çox hissəsini datanı təmizləməyə sərf edir — çünki təmiz data olmadan növbəti mərhələlərin heç bir mənası yoxdur. Bu, «darıxdırıcı» görünə bilər, amma bütün etibarlı analizin təməlidir.

Praktik iş axını: toplama və təmizləmə

Bir layihədə bu iki mərhələ necə görünür? Tutaq ki, saytının trafik düşüşünü araşdırırsan. Əvvəlcə datanı toplayırsan: Google Analytics-dən sayt datasını çıxarır, bəlkə də sorğu ilə müştəri rəyi əlavə edirsən. Sonra təmizləyirsən: təkrar sessiyaları silir, tarixləri vahid formata salır, boş xanaları həll edir və qeyri-real dəyərləri (məsələn, saytda 10 saat qalan sessiya) yoxlayırsan. Yalnız bundan sonra datanı araşdırmağa hazırsan.

Bu iki mərhələ darıxdırıcı görünə bilər, amma onlar bütün analizin təməlidir. Təcrübəli analitiklər bilir ki, vaxtlarının böyük hissəsi məhz burada keçir — və bu, boşa gedən vaxt deyil. Təmiz, etibarlı data ilə başlasan, sonrakı araşdırma və modelləşdirmə mərhələləri həm asan, həm də düzgün olacaq.

Növbəti addım: təmiz datanı araşdırıb model qurmağı öyrən.

👉 Növbəti yazı: datanı araşdırma və modelləşdirmə

Tural Rəhimov

Müəllif haqqında

Tural Rəhimov

Digital Marketing Manager — UM Azerbaijan

Universal McCann (UM Azerbaijan)-da rəqəmsal marketinq meneceri. Google Ads, Meta Ads, TikTok Ads və media planlaması üzrə təcrübə. Brendlərin onlayn böyüməsinə kömək edirəm.

Haqqımda ətraflı →

Biznesin üçün rəqəmsal marketinq dəstəyi lazımdır?

Gəl danışaq — strategiyadan reklam idarəçiliyinə qədər kömək edə bilərəm.

Mənə yaz