Melyik data képzésünk illik hozzád?
Két mentorált adatos képzésünk és egy egynapos tréningünk három különböző tudásszintről indul. Segítünk eldönteni, melyik visz közelebb a céljaidhoz.
Van, aki az adatos irány felé mozdulna a karrierjében, és most keresi azt a pontot, ahol egyáltalán érdemes belépni. Van, aki juniorként dolgozik már adatokkal, de érzi, hogy a mostani tudásával nehezen lép tovább, ezért mélyebb, mérnöki szintű rálátást szeretne. És van, akinél a cégnél éppen most vezetik be a Databricks-et, így néhány héten belül olyan platformon kell dolgoznia, amellyel korábban legfeljebb érintőlegesen találkozott.
Ez a három helyzet teljesen más tudást igényel, ezért írtuk meg ezt az összefoglalót. Adatos képzésből több is fut nálunk, az elemzői és a statisztikai iránytól a gépi tanulásig, ebben a cikkben viszont arra a háromra koncentrálunk, amelyik a leggyakrabban keveredik össze egymással. Végigmegyünk két mentorált adatos képzésünkön és egy egynapos tréningünkön, és megnézzük, melyik milyen tudásszintre épül, milyen technológiákkal dolgozik, és milyen élethelyzetben hozza a legtöbbet. Ha végigolvasod, tisztán fogod látni, melyik való neked, és milyen sorrendben érdemes haladnod, ha többre is gondoltál.
Mindhárom anyagban ugyanaz az oktató, Balogh Balázs vezet végig. Senior Data Engineerként egy nemzetközi vállalat, az ALDI International IT Services adatminőségi csapatában dolgozik, ahol Python, PySpark, SQL és Azure technológiákkal épít adatmegoldásokat: ETL-folyamatokat fejleszt, rendszerek közötti integrációkat biztosít, és Power BI dashboardokat készít, hogy a döntéshozók valós időben lássák az adatokat. A szakmai munkája mellett a hazai Python-közösség életében is aktív, ő szervezi a Budapest.py meetup csoportot.
A Data Engineer képzésünket Jobbágy Szabolccsal közösen tartja. Szabolcs 2001 óta dolgozik munkahelyi környezetben táblázatokkal és adatokkal, 2005 óta pedig tréningeket tart: az elmúlt közel húsz évben több mint 120 céggel dolgozott együtt, és több mint 1000 tréningen több mint 10 000 résztvevőt képzett. Oktatási portfóliója az időhatékonysági tréningektől az adatelemzésen és az automatizáláson át a Python programozásig terjed, és olyan vállalatok bízták rá a munkatársaik képzését, mint a Bosch, a Coca-Cola, a LEGO, a Telekom, az Allianz, a Nestlé, a Vodafone és az Oracle. Képzéseink oktatói közül nála gyűlt össze a legtöbb ötcsillagos hallgatói értékelés.
Data Engineer képzés: az adatmérnöki alapok Python-előismeret nélkül
Erről a 12 hetes mentorált képzésünkről a legfontosabb tudnivaló az, hogy tényleg a nulláról indul, vagyis a Python-tudást is maga a tananyag adja meg, előzetes programozói tapasztalatot nem feltételez.
Az első hetekben Jobbágy Szabolcs vezetésével rakod le a nyelvi alapokat, majd a Pandas könyvtárral ismerkedsz meg, amivel adatot olvasol be különböző forrásokból, tisztítod, összefűzöd és a saját céljaidra alakítod. A képzés második felében Balogh Balázs veszi át a szót, és ugyanezt a tudást viszed át felhős környezetbe: S3-ban tárolod az adatot, Lambda függvényekkel automatizálod az ETL-folyamatot, a Glue és az Athena segítségével pedig lekérdezhetővé és értelmezhetővé teszed az eredményt.
A tizenkét hét végére tehát végigmentél egy teljes úton, attól a ponttól, hogy az adat megérkezik egy külső forrásból, addig, hogy lekérdezhető adatmodell lesz belőle. Balázs egy jó hasonlattal él erre a mentorált képzésre: ez egy sétarepülés az adatos szakma fölött, ahol közelről megnézed, hogyan működik ez a munka a valóságban, és a végén saját tapasztalat alapján tudod megítélni, hogy ez az irány illeszkedik-e a hosszabb távú céljaidhoz.
Az AWS-nek is megvan az oka. Az Amazon felhője a legnagyobb a piacon, egyben az egyik legszigorúbb és legkevésbé kényelmes környezet, ezért aki ezen tanul meg dolgozni, annak a gondolkodásmódja később szinte bármelyik másik felhőplatformon is működni fog. A kezdeti nehézség tehát megtérül, mert egy olyan alapot ad, amit nem kell újratanulni, ha a munkahelyeden más szolgáltatót használtok.
Akkor jó választás ez a mentorált képzésünk, ha most ismerkedsz az adatokkal foglalkozó szakmákkal és szeretnél tiszta képet kapni róluk, ha más IT-területről érkezel és az adatos oldal alapjait raknád le magadnak, vagy ha karrierváltásban gondolkodsz, és először arról szeretnél megbizonyosodni, hogy valóban érdekel-e a technikai adatfeldolgozás. A képzés 12 hét alatt, heti 8-12 óra ráfordítással végezhető el, folyamatos oktatói mentorálással és élő konzultációkkal, tehát munka mellett is beilleszthető a hétköznapjaidba.
A résztvevők így írnak róla:
„Nagyon jól összerakott, jól oktatott és intenzív gyakorlati tanfolyam az alapoktól. A projektek különböző technológiákkal és környezetekben készülnek, emiatt jól elsajátítható a szakma szemlélete, mert láthatóvá válnak a közös pontok, amik megadják a gondolkodásmód alapjait. A live alkalmak közvetlen hangulatuk, az oktatók szakmai tapasztalatával feldúsítva. Már előzetes tudással érkeztem adatos környezetből, de még így is teljesen megérte, sok puzzle darab a helyére került, köszönöm! :)” (Hederics László)
„Teljesen a nulláról, munka mellett is elvégezhető. Az oktatók szimpatikusak, és a tanfolyam is könnyen követhető. Bátran ajánlom mindenkinek, aki karrier váltásban gondolkodik. Különösebb előképzettség nélkül is menni fog.” (Harmati Levente)
„Nagyon elégedett voltam a tanfolyammal minden téren. Az oktatók kiválóan végzik a munkájukat, bármilyen kérésre vagy segítségre volt szükségem, azt nagyon gyorsan megkaptam. Az oktatási anyag tartalma átgondolt és érthető volt, a haladási tempó pedig tökéletesen igazodott a tanulási folyamathoz.” (Tóth József)
Ha szeretnél többet megtudni, nézd meg a Data Engineer képzésünk teljes tematikáját és a következő indulási időpontokat.
És nézd meg korábbi webinárunkat az oktatókkal:
Big Data technológiák Databricks használatával: mentorált képzés mérnöki mélységgel
Ez a 12 hetes mentorált képzésünk ott folytatja, ahol a Data Engineer képzés abbahagyja, ezért az SQL-lekérdezések és a Python nyelv ismerete a belépő hozzá. Cserébe viszont olyan mérnöki mélységig visz el, amilyennel a hazai álláshirdetések többsége is dolgozik.
Megtanulod az Apache Spark és a PySpark működését, vagyis azt, hogyan oszlik szét a feldolgozás több gép között, és mit tudsz kezdeni az olyan optimalizálási technikákkal, mint a shuffling, a bucketing vagy a partitioning. Haladó SQL-lekérdezéseket írsz az ablakozó függvényektől a nézetekig, elmélyedsz az adatmodellezésben a csillag- és hópehelysémától a lassan változó dimenziókig, és megismered a Kimball és az Inmon megközelítés közötti különbséget, ami a legtöbb adattárház-projektben visszatérő kérdés.
A mentorált képzés gyakorlati gerincét egy capstone projekt adja, amelyben Azure környezetben építesz fel egy teljes adatfeldolgozó folyamatot Bronze, Silver és Gold rétegekkel, unit tesztekkel és Great Expectations alapú adatminőség-ellenőrzéssel, a végén pedig egy CI/CD-kitekintéssel. Ez a projekt a képzés után is a tiéd marad, tehát a portfóliódban és egy állásinterjún is meg tudod mutatni, hogy önállóan végigvittél egy ilyen folyamatot.
Balázs a mentorált képzés célját úgy fogalmazza meg, hogy tizenkét hét alatt erős junior, kezdő medior szintre lehet vele eljutni, feltéve, hogy tényleg beleteszed a munkát. Ez reális vállalás, ha a heti 8-12 órát végig tartod, és a gyakorlófeladatokat is megcsinálod, a mentorálás pedig pontosan azért van, hogy a menet közben felmerülő elakadásoknál ne maradj magadra.
A Data Engineer képzés AWS-ben dolgozik, itt viszont Microsoft Azure a környezet, aminek szintén oka van: Magyarországon a vállalati adatprojektekben az Azure a legelterjedtebb felhőplatform, tehát ezzel találkozol a legtöbb hazai álláshirdetésben és a legtöbb belső fejlesztésben. A Databricks a tizenkét hétből nagyjából hét héten át kíséri a munkát, végig adatmérnöki nézőpontból, vagyis mint az az eszköz, amin a pipeline felépül.
Akkor jó választás ez a mentorált képzésünk, ha Data Analystként vagy Business Analystként dolgozol, és kíváncsi vagy rá, hogyan állnak elő a háttérben azok az adatkészletek, amikkel nap mint nap dolgozol. Ugyanígy jó választás akkor is, ha már Data Engineerként vagy ETL-fejlesztőként dolgozol, de az Azure és a PySpark vonalon még nincs rutinod, és ezt szeretnéd behozni. És akkor is ide érdemes jelentkezned, ha ma még nem adatokkal foglalkozol, a Python alapjai viszont megvannak, és rögtön a szakma közepébe vágnál: ilyenkor a belépő szintű anyagot át tudod ugrani, és a tizenkét hét alatt azonnal használható adatmérnöki tudást és egy kész projektet viszel el, feltéve, hogy a heti 8-12 órát végig tartod. A mentorált képzést limitált létszámmal indítjuk, hogy a mentorálásra és az élő konzultációkra mindenkinél maradjon idő.
A résztvevők így írnak róla:
„Nagyon jól felépített képzés, csak ajánlani tudom Balázs kurzusait annak aki data engineer szeretne lenni. Külön kiemelném hogy Balázs a kurzus közben is vett fel új videókat és mellékelte a kurzushoz, csak hogy naprakész maradjon a tananyag és többféle technológiával dolgozhassunk.” (Szalók Márton)
„A Data Engineer kurzus során gyakorlati tapasztalatokat szereztem az Azure Synapse és Databricks használatában. A feladatok valós problémákra épültek, így hatékonyan fejlesztettem adatfeldolgozási és elemzési készségeimet modern eszközökkel. A mentorálás kiváló, bármikor, bármilyen kérdésemre rövid időn belül megkaptam a megfelelő választ.” (Hrubos Péter)
„Jól felépített kurzus, a legfrissebb változásokat is követő tananyaggal, segítőkész és felkészült oktatóval. A különböző lokális és felhőalapú technológiák integrálása mellett sok általánosabb gyakorlati ismeretet is el lehetett sajátítani. Külön pozitívum, hogy minden megírt kód és a kurzus második felében felépített projekt is szabadon elérhető marad Githubon és Databricksen keresztül.” (Adorján Balázs)
Ha ez az irány áll közel a céljaidhoz, nézd meg a Big Data technológiák Databricks használatával mentorált képzésünk heti bontású tematikáját.
És nézd meg korábbi webinárunkat a témában:
Databricks és PySpark tréning: egy nap, hogy átlásd a platformot
A Databricks és PySpark tréning, teljes nevén Databricks és PySpark training: Építsd meg első modern adatmérnöki folyamataidat, formátumában és céljában is elkülönül a két mentorált képzésünktől, mert ez egy egynapos, élő online tréning, aminek a középpontjában maga a Databricks platform áll.
Ez a hangsúly a lényeg, és érdemes egy pillanatra megállni nála. Sokan adatmérnöki eszközként gondolnak a Databricks-re, holott a működésének pont az a lényege, hogy egy cégen belül mindenki ugyanazon a felületen dolgozik: az elemzők, a data scientistek és az adatmérnökök közösen használják, a rendszert eleve erre a közös munkára tervezték. Amikor tehát egy cég bevezeti, az az egész adatos csapatot érinti, függetlenül attól, hogy kinek mi áll a névjegykártyáján.
A tréning ezt a valóságot követi, ezért munkakörtől független, és ebből következik a legfontosabb tulajdonsága is: ez a leggyorsabb út ahhoz, hogy egy csapat közösen, egyetlen nap alatt átlássa, mit tud a rendszer, hogyan épül fel, és milyen logika mentén érdemes benne dolgozni. Ha nálatok most zajlik vagy éppen most készül a bevezetés, ez a nap megadja azt a közös alapot, amire utána a napi munka és a további tanulás is épülhet, anélkül hogy hetekre ki kellene esni a projektekből.
A tréningen megismered a Databricks workspace-t, a notebookokat, a táblákat és a compute erőforrásokat, méghozzá saját környezetben dolgozva, tehát végig a kezedben van a felület. Tisztázzuk a data lake, a data warehouse és a lakehouse közötti különbséget, ami azért fontos, mert ezek a fogalmak a mindennapi munkában is folyamatosan keverednek. Gyakorlati példákon keresztül használod a Spark DataFrame-eket a select, filter, withColumn, groupBy és join műveletekkel, és megtanulod felismerni azokat az adatminőségi problémákat, amelyek a legtöbb adatfolyamban előbb-utóbb megjelennek. Végigviszünk emellett egy összefüggő mini projektet is, a nyers adatbetöltéstől a tisztításon és a transzformáción át egy üzletileg értelmezhető kimenetig, hogy a medallion architektúra ne elméletben maradjon meg.
A nap végén saját Databricks notebookkal és egy működő folyamattal távozol, és azzal a tisztább képpel, hogy hol tart ma a modern adatfeldolgozás, illetve hogy a saját munkádban mit tudsz vele kezdeni.
Az előfeltétel magabiztos alapszintű SQL-tudás, tehát a SELECT, a WHERE, a GROUP BY és a JOIN használata, valamint némi rutin táblázatos vagy adatbázisban tárolt adatok értelmezésében. A Python-ismeret előny, mert az alapszintaxis ismerete megkönnyíti a PySpark-példák követését, a részvételnek viszont ez nem feltétele.
Akkor jó választás ez a tréning, ha a cégeteknél most vezetik be a Databricks-et, és a csapatnak gyorsan használható, közös tudásra van szüksége. Ugyanígy jó választás akkor is, ha egyénileg szeretnéd megérteni a jelenleg legelterjedtebb adatplatformot, mert a saját szakterületeden előbb-utóbb ezzel fogsz dolgozni. Sokan pedig azért jelentkeznek, mert egy hosszabb, mentorált képzés előtt kisebb elköteleződéssel szeretnék megismerni a területet.
Ha ez a helyzet ismerős, nézd meg a Databricks és PySpark tréning tematikáját és a következő időpontokat.
Nézd meg a témáról szóló webinárunkat
Balogh Balázs egy egyórás online előadáson mutatta be, miért került a Databricks a vállalati adatplatformok középpontjába, és élőben végig is vezetett a felületen, hogy lásd, mit jelent ez a gyakorlatban. Ha a tréning témája érdekel, itt jóval részletesebb képet kapsz róla, mint amennyi ebbe a cikkbe belefér.
Milyen sorrendben érdemes haladni?
A két mentorált képzésünk egymásra épül, tehát ha ma még nincs Python- és SQL-tudásod, akkor a Data Engineer képzéssel érdemes kezdeni, mert az lerakja a Python- és Pandas-alapokat, és felhős környezetben végigvezet a teljes ETL-folyamaton. A Big Data technológiák Databricks használatával képzés innen indul tovább az elosztott feldolgozással, a Sparkkal és a mérnöki szintű adatmodellezéssel, tehát a kettő együtt egy összefüggő tanulási ívet ad ki.
A Databricks és PySpark tréning ehhez az ívhez bárhol hozzáilleszthető, mert egyetlen napban ad kézzelfogható tapasztalatot a Databricks-ről. A mentorált képzések előtt azért érdemes, hogy kisebb ráfordítással megismerd a területet és a platformot, közben vagy utána pedig azért, mert a munkahelyi bevezetéshez ez adja a leggyorsabban használható tudást.
Ha több képzésünk is érdekel, kérhetsz belőlük csomagot, amit a külön megvásárolt képzéseknél kedvezőbb áron adunk, és összeállítunk hozzá egy ütemezési javaslatot is, amiből látod, hogyan férnek egymás mellé az indulások. Írj az info@cubixedu.com címre, és összeállítjuk.
Érdemes tudni azt is, hogy az adatmérnöki vonal csak egy szelete az adatos kínálatunknak. Ha inkább az elemzői irány vonz, arra a Python alapú Data Analyst képzésünk és az SQL, valamint Power BI alapú Data Analyst képzésünk való, a modellezés felé a Machine Learning Engineer képzésünk visz tovább, az alapokhoz pedig SQL-, Python- és alkalmazott statisztika képzéseink is elérhetők. Az összes adatos képzésünket itt találod egy oldalon.
Mi marad ebből az AI mellett?
Jogos kérdés, és rendszeresen fel is teszik. A generatív eszközök valóban gyorsan írnak kódot, és a napi munkát érdemben gyorsítják, a kimenetük megítéléséhez viszont továbbra is kell egy alap, amit meg kell szerezni valahonnan.
Amikor egy modell kiad egy transzformációt, valakinek el kell tudnia dönteni, hogy az helyes-e, jól skálázódik-e nagyobb adatmennyiségen, és mi történik vele éles rendszerben, valós forrásadatokkal. Ehhez érteni kell, hogyan épül fel egy adatfolyam, mitől romlik el, és hol vannak benne azok a pontok, ahol a hiba csendben tovagyűrűzik. Amíg ember nyúl bele a folyamatokba, ez az alaptudás adja a munka értékét, és a két mentorált képzésünk, valamint a tréningünk is pontosan erre épül, végig gyakorlati feladatokon keresztül.
A lényeg röviden
- A Data Engineer képzésünk a nulláról indul, a Pythont is megtanulod benne, és AWS-környezetben viszel végig egy teljes adatfeldolgozó folyamatot 12 hét alatt.
- A Big Data technológiák Databricks használatával mentorált képzésünk meglévő SQL- és Python-tudásra épül, Azure-ban dolgozik, és mérnöki mélységig visz a Sparktól az adatmodellezésen át egy teljes capstone projektig.
- A Databricks és PySpark tréning egyetlen nap alatt ad használható tudást magáról a platformról, munkakörtől függetlenül, ezért céges bevezetéshez ez a leggyorsabb közös alap.
- Ha most kezded, a Data Engineer képzés és a Big Data technológiák Databricks használatával képzés sorrendje a természetes út, a tréning pedig bárhol beilleszthető mellé.
Gyakori kérdések
Kell-e programozni tudnom a Data Engineer képzéshez?
Nem, ez a mentorált képzésünk kezdő szintről indul, és a Python-alapokat is megtanulod benne. Ha van már valamennyi IT-alapod, gyorsabban fogsz haladni, ez azonban csak előny, nem belépési feltétel.
Mi a különbség a két mentorált képzésünk között?
A Data Engineer képzés a Python- és Pandas-alapokat rakja le, és AWS-ben mutatja meg a teljes adatfeldolgozó folyamatot, tehát belépőnek szól. A Big Data technológiák Databricks használatával képzés meglévő SQL- és Python-tudásra épül, Azure-ban és Sparkkal dolgozik, és mérnöki szintű adatmodellezésig, valamint egy teljes capstone projektig visz el.
Csak adatmérnököknek szól a Databricks és PySpark tréning?
Nem, a tréning munkakörtől független. A Databricks-et egy cégen belül az elemzők, a data scientistek és az adatmérnökök közösen használják, ezért a tréning is arra készült, hogy bármelyik adatközeli szerepkörben hasznos legyen.
Munka mellett is elvégezhetők?
Igen. A két mentorált képzés heti átlag 8-12 óra ráfordítást igényel, a tananyagot saját időbeosztásod szerint dolgozod fel, az élő konzultációk pedig visszanézhetők. A tréning egyetlen napot vesz igénybe, élő online formában.
Fizetheti a munkáltatóm, vagy beírathatom a munkatársaimat?
Igen, mindkettő megoldható, és több fő esetén céges ajánlatot is összeállítunk. Írj az info@cubixedu.com címre, és segítünk a részletekben.
Ha még mindig bizonytalan vagy
Kompetenciafejlesztő intézményként az a dolgunk, hogy olyan tudást adjunk, ami a mai munkaerőpiacon ténylegesen használható, és hogy segítsünk megtalálni hozzá a te helyzetedben működő utat. Írj nekünk az info@cubixedu.com címre, vagy kérj személyre szabott ajánlatot bármelyik adatlapon: mondd el, hol tartasz most és hová szeretnél eljutni, mi pedig javaslatot teszünk arra, melyik képzésünkkel érdemes kezdened.
Ha menet közben az derül ki, hogy egy másik adatos irány áll közelebb a céljaidhoz, nézd végig az összes data képzésünket, az elemzői és statisztikai alapoktól a gépi tanulásig. Ha pedig egy másik szakterület felé mozdulnál, a mesterséges intelligencia, a programozási nyelvek, a felhőtechnológiák, az IT-biztonság és az IT-menedzsment területén is indítunk mentorált képzéseket, hasonló felépítéssel és oktatói háttérrel: nézd meg a teljes képzési kínálatunkat.
Iratkozz fel a hírlevelünkre!
Heti tippek, képzési hírek, kedvezmények — spam nélkül.
Tetszett? Oszd meg!
Segíts másoknak is megtalálni ezt a cikket.