Od historických metód k dnešnej praxi

data veda historia

V článku História dátovej vedy sme sa pozreli na to, ako sa dátová veda postupne vyvíjala. História však nie je iba pohľadom do minulosti, pretože mnohé metódy a princípy, ktoré vznikali pred desiatkami alebo stovkami rokov, používame pri práci s dátami dodnes.

Moderné technológie výrazne zmenili spôsob, akým s dátami pracujeme. Počítače dnes dokážu spracovať obrovské množstvo údajov za veľmi krátky čas. To však ale neznamená, že samotná práca s dátami je jednoduchšia. Aj dnes sa musíme zamýšľať nad tým, čo nám údaje skutočne hovoria, či sú správne a či z nich môžeme vyvodiť spoľahlivý záver. Práve tieto otázky sprevádzali prácu s údajmi už v minulosti a ich význam sa nestratil ani v modernej dátovej vede.

 

Od prvých štatistických metód k dnešnej analýze

V minulosti ľudia používali štatistické metódy najmä na opis a porovnávanie údajov a ako príklad uvediem evidenciu obyvateľstva, hospodárske údaje alebo tiež vedecký výskum. Postupne vznikali metódy, ktoré umožňovali z veľkého množstva pozorovaní vytvoriť jednoduchší obraz o skúmanom jave.

Jedným z príkladov je aritmetický priemer.

Princíp priemeru sa používa aj v dnešnej dátovej analýze. Kedysi bolo možné podobné výpočty robiť ručne iba pri relatívne malom množstve údajov. Dnes môžeme rovnaký výpočet vykonať už nad miliónmi záznamov pomocou programu Excel, alebo jazyka SQL a Python. Historický štatistický princíp teda zostal zachovaný, ale technológia ho umožnila používať v oveľa väčšom rozsahu.

 

Od pozorovania vzťahov k dnešnej korelácii

Už pri starších štatistických a vedeckých metódach bolo dôležité porovnávať rôzne údaje a sledovať, či sa medzi nimi objavujú nejaké súvislosti. Postupným rozvojom štatistiky vznikli presnejšie metódy na skúmanie vzťahov medzi premennými. Jedným z pojmov, ktoré v podstate používame aj dnes, je korelácia. Jej úlohou je pomôcť opísať, či sa dve premenné určitým spôsobom menia spolu, pričom sama o sebe neznamená príčinu.

Ak napríklad v lete rastie predaj zmrzliny a zároveň počet návštev kúpalísk, neznamená to, že jedno spôsobuje druhé. Obe hodnoty môže ovplyvňovať spoločný faktor a tým je teplé počasie.

Historické štatistické myslenie je dôležité aj v modernej dátovej vede preto, že nás učí byť opatrní pri vysvetľovaní takýchto vzťahov. Tento spôsob uvažovania je dôležitý aj pri dnešných algoritmoch a veľkých dátových sadách. Moderný nástroj dokáže nájsť vzťah medzi premennými, ale človek musí posúdiť, čo tento vzťah skutočne znamená.

 

Od ručných výpočtov k automatizovanému spracovaniu

V minulosti predstavovalo spracovanie veľkého množstva údajov náročnú úlohu. Výpočty bolo potrebné vykonávať ručne alebo s pomocou jednoduchších mechanických a aj neskôr elektronických zariadení a to obmedzovalo množstvo údajov, ktoré bolo možné prakticky analyzovať.

Rozvoj počítačov priniesol zásadnú zmenu.

Výpočty, ktoré by človeku trvali hodiny alebo aj dni, dnes dokáže počítač vykonať v krátkom čase. Tento historický vývoj priamo ovplyvnil dnešnú dátovú prax. Analytik môže napríklad pomocou SQL vyhľadať údaje z databázy a následne pomocou jazyka Python vypočítať štatistiky nad miliónmi záznamov. Počítač pritom vykoná samotné operácie, ktoré by boli pri ručnom spracovaní nepraktické. Zmenil sa teda spôsob vykonávania analýzy, nie základná potreba správne zvoliť údaje a metódu.

 

Od kontroly údajov k dnešnému čisteniu dát

Aj v minulosti bolo pri práci s údajmi potrebné kontrolovať ich správnosť a ak bol údaj zapísaný nesprávne alebo bol výpočet založený na chybných hodnotách, mohol byť nesprávny aj výsledný záver. V dnešnej dátovej vede tento princíp pokračuje v podobe čistenia dát. Moderné dátové sady môžu obsahovať chýbajúce hodnoty, duplicity, nesprávne formáty alebo neobvyklé hodnoty.

Predstavme si databázu zákazníkov, v ktorej je uvedený vek.

Väčšina hodnôt môže byť medzi 18 a 80 rokmi, ale jeden záznam obsahuje hodnotu 250 rokov. Analytik musí zistiť, či ide o chybu alebo o problém pri získavaní resp. zapisovaní údaju.

Historický princíp kontroly údajov je teda v modernej praxi stále aktuálny. Rozdiel je len v tom, že dnes môžeme pomocou programov automaticky kontrolovať veľké množstvo záznamov. Dôležité však je, že automatická kontrola ešte neznamená automatické pochopenie problému. Človek musí rozhodnúť, ako konkrétnu chybu alebo nezvyčajnú hodnotu správne riešiť.

 

Od tradičných tabuliek k dnešnej vizualizácii

Ľudia používali tabuľky a grafické znázornenia údajov už dávno pred dnešnými počítačmi a ich cieľom bolo zjednodušiť veľké množstvo informácií a umožniť človeku ľahšie si všimnúť rozdiely alebo zmeny.

Rovnaký princíp používame aj dnes.

Predstavme si, že firma má údaje o svojich mesačných tržbách za päť rokov. V tabuľke sa nachádza 60 hodnôt, takže môže byť náročné okamžite rozpoznať vývoj. Ak údaje zobrazíme pomocou čiarového grafu, rast alebo pokles tržieb môžeme vidieť oveľa jednoduchšie. Moderné nástroje ako Power BI alebo Tableau umožňujú vytvárať aj interaktívne dashboardy, v ktorých si používateľ môže údaje filtrovať a porovnávať. Myšlienka však zostáva rovnaká ako v minulosti a to vhodne zobraziť údaje tak, aby im človek lepšie porozumel.

 

Od získavania údajov k dnešnej práci s dátovými sadami

Historická práca so štatistickými údajmi zároveň ukázala, že pri analýze nestačí poznať samotné čísla, ale dôležité je vedieť, ako boli údaje získané a koho reprezentujú. Tento princíp je dnes ešte dôležitejší, pretože máme prístup k obrovskému množstvu rôznych dátových sád.

Predstavme si firmu, ktorá predáva produkty online aj v kamenných predajniach a ak máme údaje iba o online zákazníkoch, výsledky analýzy nemusia opisovať správanie všetkých zákazníkov firmy.

Pre začínajúceho analytika je preto dôležité pýtať sa odkiaľ dáta pochádzajú, koho reprezentujú, ako boli získané a kto v nich môže chýbať. Tento historický princíp dnes ovplyvňuje napríklad aj tvorbu dátových sád, ktoré sa používajú pri strojovom učení. Ak údaje dostatočne nereprezentujú situáciu, ktorú chceme modelovať, môže byť problematický aj výsledný model.

 

A čo si z histórie odniesť?

Pri pohľade na dnešnú dátovú vedu môžeme vidieť množstvo moderných nástrojov a technológií. Za nimi však stále nájdeme rôzne princípy, ktoré vznikali postupne počas celého vývoja štatistiky a spracovania údajov. Priemer, skúmanie vzťahov, kontrola kvality dát, správne získavanie údajov alebo vizualizácia nie sú nové koncepty. Moderné technológie ich iba umožnili používať rýchlejšie, v podstatne väčšom rozsahu a s väčším množstvom údajov.