Budúcnosť dátovej vedy

datova veda buducnost

V jednom z predchádajúpcich článkov Dátová veda sme si vysvetlili, čo dátová veda znamená, na čo sa používa a prečo bude jej význam v budúcnosti pravdepodobne ešte väčší. Spomenuli sme si aj to, že rastúce množstvo dát a rozvoj umelej inteligencie a strojového učenia budú vytvárať nové možnosti ich spracovania a využitia. 

Na tieto informácie teraz nadviažeme a pozrieme sa bližšie na to, ako sa môže dátová veda v budúcnosti meniť a aké technológie budú ovplyvňovať spôsob práce s dátami.

 

Strojové učenie bude naďalej dôležité

Jednou z oblastí, ktorá bude aj naďalej patriť medzi dôležité súčasti dátovej vedy, je strojové učenie (angl. machine learning). Jeho základná myšlienka je pomerne jednoduchá. Model strojového učenia sa učí z dostupných dát a snaží sa v nich nájsť určité vzory alebo súvislosti. Keď sa model naučí pracovať s týmito dátami, môžeme ho použiť aj na nové údaje, ktoré ešte nepozná.

Aj pri moderných modeloch však stále platí, že veľmi dôležitú úlohu zohrávajú kvalitné dáta a správne definovaný problém. Nestačí teda iba vytvoriť model, ale je potrebné vedieť, aké dáta používame, čo chceme pomocou modelu zistiť a ako vyhodnotíme jeho výsledok.

Viac o strojovom učení nájdete v článku Čo je to Machine Learning.

 

Generatívna umelá inteligencia

Jednou z technológií, ktorá v posledných rokoch výrazne ovplyvnila prácu s informáciami, je generatívna umelá inteligencia. Ide o systémy, ktoré dokážu na základe zadania vytvárať nový obsah (môže ísť napríklad o text, obrázky, zvuk alebo programový kód). Pre dátového vedca môže byť generatívna AI užitočným pomocníkom. Môže napríklad pomôcť vysvetliť časť kódu, vytvoriť jednoduchý SQL dotaz alebo pomôcť pri prvotnom skúmaní dát.

Dôležité však je uvedomiť si, že výsledok umelej inteligencie nemusí byť vždy správny. Človek preto musí vedieť výsledok skontrolovať a posúdiť, či dáva zmysel. V budúcnosti tak môže byť čoraz dôležitejšia nielen schopnosť AI používať, ale aj schopnosť overovať a správne interpretovať jej výsledky.

 

Automatizácia a AutoML

Pri práci s dátami sa často opakujú podobné úlohy. Dáta treba pripraviť, vytvoriť model, vyskúšať rôzne nastavenia a následne porovnať výsledky. Časť týchto činností je možné automatizovať pomocou nástrojov označovaných ako AutoML (angl. automated machine learning). AutoML môže napríklad automaticky vyskúšať viacero modelov a porovnať ich výsledky. Dátovému vedcovi tak môže ušetriť čas pri opakovaných úlohách.

To však neznamená, že človek už nebude potrebný. Stále musí vedieť, aký problém rieši, aké dáta používa a ako má výsledok vyhodnotiť. Automatizácia preto môže zmeniť spôsob práce dátových vedcov, ale neodstraňuje potrebu ich znalostí.

 

Cloud a práca s dátami

Moderná dátová veda potrebuje okrem samotných modelov aj technické prostredie, v ktorom môžeme dáta ukladať a spracovávať. Jednou z možností je cloud computing, teda využívanie počítačových zdrojov prostredníctvom internetu. Jednoducho si ho môžeme predstaviť tak, že namiesto vlastného výkonného počítača alebo servera využívame výpočtový výkon a úložisko poskytované inou spoločnosťou. Medzi známych poskytovateľov patria napríklad Amazon Web Services, Microsoft Azure alebo Google Cloud.

Výhodou môže byť flexibilita a ak potrebujeme viac výpočtového výkonu, môžeme ho využiť viac. A súčasne, ak ho nepotrebujeme, môžeme využívanie obmedziť.

 

Dátová veda nebude pracovať iba s tabuľkami

Keď sa začínate učiť dátovú vedu, pravdepodobne sa najskôr stretnete s tabuľkami obsahujúcimi riadky a stĺpce. V praxi však môžeme pracovať aj s inými typmi dát, napríklad s textom, obrázkami, videom, zvukom alebo dokumentmi. Pri práci s textom sa používa NLP (angl. Natural Language Processing), teda spracovanie prirodzeného jazyka. Napríklad môžeme pomocou NLP analyzovať veľké množstvo zákazníckych recenzií a hľadať v nich opakujúce sa témy.

Pri obrázkoch a videách sa využíva computer vision, teda počítačové videnie. Počítač sa v tomto prípade učí rozpoznávať a analyzovať objekty alebo iné informácie na obrázkoch. Pre dátového vedca to znamená, že sa môže postupne stretávať s rôznymi typmi dát, nielen s klasickými tabuľkami.

 

Kvalita dát zostane dôležitá

Aj napriek vývoju nových technológií zostáva jedna vec veľmi dôležitá a to kvalita dát. Ak sú údaje nepresné, neúplné alebo nesprávne, ani moderný model nemusí priniesť dobrý výsledok. Predstavme si napríklad, že chceme vytvoriť model na predpovedanie ceny domu. Ak máme pri niektorých domoch nesprávne uvedenú cenu alebo chýbajú dôležité informácie, model sa môže naučiť nesprávne vzory. Preto bude aj naďalej dôležité dáta kontrolovať, čistiť a rozumieť tomu, čo jednotlivé údaje znamenajú.

Nové nástroje môžu túto prácu uľahčiť, ale úplne ju neodstránia.

 

Etika a ochrana údajov

S rozvojom umelej inteligencie a práce s dátami bude dôležitejšie aj to, ako tieto technológie používame. Dáta môžu obsahovať osobné alebo citlivé informácie. Preto je potrebné myslieť na ich ochranu a na to, kto a akým spôsobom ich môže používať. Dôležitým problémom môže byť aj skreslenie dát. Ak sú napríklad dáta nevyvážené alebo obsahujú určité chyby, model môže vytvárať nespravodlivé alebo nepresné výsledky.

 

A čo to znamená pre začínajúceho dátového vedca?

Dátová veda sa bude ďalej vyvíjať spolu s technológiami, ktoré umožňujú dáta spracovávať a využívať. Významnú úlohu v tomto vývoji budú mať napríklad strojové učenie, generatívna umelá inteligencia, automatizácia, alebo nové spôsoby práce s textom, obrázkami a ďalšími typmi dát.


Zaujal Vás článok?  

Zvážte možnosť jeho zdieľania na sociálnych sieťach alebo sa podeľte o svoj názor a pripomienky k článku a to odoslaním správy na e-mailovú adresu info@dataspark.sk.