Kursusel oli kokku 9 moodulit, kus iga juurde anti ka ports kohustuslikku kirjandust lugeda. Loomulikult sel ajal ma seda ei jõudnud lugeda, kuid võtan nüüd eesmärgiks kuu aega järjest lugeda. Vaatame, kuhu jõuame. Lugemine suvalises järjekorras.


Datacamp: ETL vs ELT: Understanding the Differences and Making the Right Choice moodulist 3: andmete integreerimine, vaatab üle ETL ja ELT, aga midagi uut otseselt juurde ei lisa.


Andmete integratsioon ühendab erinevatest allikatest pärit andmed, pakkudes nii terviklikku ülevaadet ja andes teavet võimalustest ettevõtte tegevuste tõhustamiseks. Kaks peamist meetodit selleks on meile juba tuttavad ETL, ja ELT.


ETL (extract, transform, load)

Andmed kogutakse erinevates allikatest. → Seejärel viiakse need vajalikule kujule, kas puhastades, rikastades, agregeerides või mõnel muul viisil, mis aitab kindlat eesmärki täita. → Andmed laaditakse sihtkohta. ETL lähenemine sobib hästi, kui:

Andmete järjepidevuse, turvalisuse ja kvaliteedi üle on suurem kontroll (sh andmelekke vältimine), sest andmed viiakse vastavusse äri ja nõutud standarditega enne andmelattu laadimist.


Tööriistadest võiks kasutada ETLi puhul pythoni teeke. Pandase DataFrame andmestruktuuri andmete paindlikumaks eraldamise ja teisendamise lihtsustamiseks. PySparki hajusandmetöötluseks, st sobib ka suurematele andmemahtudele. Andmetoru orkestreerimiseks Airflow.


ELT (extract, load, transform)

Andmed kogutakse erinevates allikatest. → Toorandmed laaditakse sihtkohta. → Andmete töötlemine toimub andmelaos. ETL esiletõus on toimunud pilveteenuste Snowflake, BigQuery jm kasutusele võtu ja populaarsuse suurenemisega. Lähenemine sobib hästi, sest:

Maskimata andmed on kättesaadavad sihtsüsteemis ja seega ligipääs on neile olemas kuni töötlemisprotessi lõpuni.


ETL ja ELT valikul tuleks kaaluda, kas turvalisus või paindlikkus, kas partii-põhine või reaalajas andmetöötlus, olemasolev võimekus (tööriistad, inimesed).


Allikas: https://www.datacamp.com/blog/etl-vs-elt