Big Data Engineer mit Machine und Deep Learning

Big Data Engineers werden zur interdisziplinären Analyse und Konzeption von IT- und Datenbanklösungen eingesetzt. Daher führt der Lehrgang zunächst in die Grundlagen von Business Intelligence ein, beschreibt die Anforderung des Data Engineerings und erläutert Data Warehouse Modellierung und ETL. Im Anschluss wird dir Big Data anhand branchenspezifischer Software, die zum Speichern, Verarbeiten und Berechnen von großen Datenmengen dient, nähergebracht. Abschließend führt dich der Kurs von den Grundlagen des Machine Learning über die beiden Kategorien überwachtes und unüberwachtes Lernen zum Thema Evaluierung und Verbesserung und zeigt die Methoden des Deep Learning auf Basis von neuronalen Netzen mit dazugehörigen Tools auf.
  • Abschlussart: Zertifikat „Big Data Engineer“
    Zertifikat „Machine und Deep Learning“
  • Zusatzqualifikationen: Zertifikat „Data Engineer“
    Zertifikat „Big Data Specialist“
    Zertifikat „Machine Learning“
    Zertifikat „Deep Learning“
  • Abschlussprüfung: Praxisbezogene Projektarbeiten mit Abschlusspräsentationen
  • Unterrichtszeiten: Vollzeit
    Montag bis Freitag von 8:30 bis 15:35 Uhr (in Wochen mit Feiertagen von 8:30 bis 17:10 Uhr)
  • Dauer: 16 Wochen

Data Engineer

Grundlagen Data Engineering und Datenarchitekturen (ca. 2 Tage)

Aufgaben und Anwendungsfelder im Data Engineering 

Grundlagen moderner Datenarchitekturen und Datenplattformen 

Grundlagen und Vergleich cloudbasierter Datenarchitekturen
OLTP und OLAP 

Verarbeitung strukturierter, semistrukturierter und unstrukturierter Daten


Anforderungsmanagement und Datenmodellierung (ca. 1 Tag)

Anforderungen an Daten und Datenquellen 

Konzeptionelle Datenmodellierung 

Modellierung von Datenstrukturen und Datenflüssen

Data Contracts, Data Governance und Data Lineage


Datenbanken und Datenverarbeitung (ca. 1 Tag)

Architektur von Datenbanksystemen 

SQL vs. NoSQL vs. NewSQL im Vergleich
Relationale Datenmodellierung 

SQL zur Abfrage und Verarbeitung von Daten


Data Warehousing und moderne Datenarchitekturen (ca. 2 Tage)

Grundlagen und Architektur von Data-Warehouse-Systemen 

Dimensionale Datenmodellierung und Schema-Design 

Fakten, Dimensionen und historische Datenhaltung 

Data Warehouse, Data Lake und Lakehouse im Vergleich 

Einführung in dbt
Praxisorientierte Umsetzung von Datenmodellen


Datenintegration und Data Pipelines (ca. 5 Tage)

Datenintegration und Datenbereitstellung 

ETL- und ELT-Prozesse 

Aufbau und Orchestrierung von Data Pipelines 

Datenbereinigung, -validierung und Datenqualität 

Batch- und Streaming-Verarbeitung 
Praxisorientierter Einsatz von Airflow und Spark


Programmierung und automatisierte Datenverarbeitung (ca. 4 Tage)

Python-Umgebungen und Paketverwaltung
Verarbeitung und Transformation von Daten mit Python 

Automatisierung von Datenverarbeitungsprozessen 

Anbindung unterschiedlicher Datenquellen und Schnittstellen
Entwicklung von Data-Engineering-Workflows 

Containerisierung mit Docker
KI-gestützte Unterstützung im Entwicklungs- und Datenverarbeitungsprozess


Projektarbeit (ca. 5 Tage)

Zur Vertiefung der gelernten Inhalte

Präsentation der Projektergebnisse

Big Data Specialist

Was ist Big Data? (ca. 1 Tag) 

Volume, Velocity, Variety, Value, Veracity

Chancen und Risiken großer Datenmengen

Abgrenzung: Business Intelligence, Data Analytics, Data Science

Einführung in Data Mining

Rolle von KI und datengetriebenen Systemen im Big-Data-Umfeld


Einführung in Big-Data-Frameworks (ca. 2 Tage)

Big-Data-Lösungen in der Cloud (Überblick AWS, Azure, GCP)

Datenzugriffsmuster

Datenspeicherung

Einführung in Data Lakes und Data Warehouses

Überblick Apache Hadoop und Spark


Verteilte Datenverarbeitung mit Spark (ca. 3 Tage)

Grundlagen verteilter Systeme

Apache Spark (Core und SQL)

Vergleich verschiedener Ansätze der Datenverarbeitung

Verarbeitung großer Datenmengen

Einführung in einfache ML-Workflows mit Spark


Datenpipelines und Datenintegration (ca. 2 Tage)

ETL- und ELT-Prozesse

Batch- vs. Streaming-Verarbeitung

Grundlagen von Datenpipelines

Einführung in Orchestrierung (z. B. Airflow Überblick)

Datenqualität und -aufbereitung


Komponenten (ca. 2 Tage)

Kurzvorstellung von verschiedenen Tools

Datenübertragung

Überblick Ressourcenverwaltung in Big-Data-Systemen

Hadoop-Ökosystem

Apache Spark Vertiefung

Einführung in Streaming-Technologien


NoSQL und Datenspeicher (ca. 2 Tage)

CAP-Theorem

ACID und BASE

Typen von Datenbanken

HBase

Einführung dokumentenorientierter Datenbanken

Einführung in Speicherformate

Überblick Data Lakehouse-Ansätze


Big Data Visualisierung (ca. 2 Tage)

Theorien der Visualisierung

Diagrammauswahl

Neue Diagrammarten

Werkzeuge zur Datenvisualisierung

Einführung in BI-Tools (z. B. Power BI, Tableau)

Grundlagen datengetriebener Entscheidungsfindung


Data Governance und Datenschutz (ca. 1 Tag)

Grundlagen der DSGVO im Datenkontext

Datenethik und verantwortungsvoller Umgang mit Daten

Datenqualität und Governance-Konzepte

Zugriffskontrollen und Sicherheit

Grundlagen verantwortungsvoller KI-Nutzung


Projektarbeit (ca. 5 Tage)

Zur Vertiefung der gelernten Inhalte

Präsentation der Projektergebnisse

Machine Learning

Einführung in Machine Learning (ca. 5 Tage)

Warum Machine Learning?

Anwendungsbeispiele

Überwachtes Lernen, Unüberwachtes Lernen, Teilüberwachtes Lernen, Reinforcement Lernen

Beispiele für Datenbestände

Daten kennenlernen

Trainings-, Validierungs- und Testdaten

Daten sichten

Vorhersagen treffen


Überwachtes Lernen (ca. 5 Tage)

Klassifikation und Regression

Verallgemeinerung, Overfitting und Underfitting

Größe des Datensatzes

Algorithmen zum überwachten Lernen

Lineare Modelle

Bayes-Klassifikatoren

Entscheidungsbäume

Random Forest

Gradient Boosting

k-nächste-Nachbarn

Support Vector Machines

Conditional Random Field

Neuronale Netze und Deep Learning

Wahrscheinlichkeiten


Unüberwachtes Lernen (ca. 5 Tage)

Arten unüberwachten Lernens

Vorverarbeiten und Skalieren

Datentransformationen

Trainings- und Testdaten skalieren

Dimensionsreduktion

Feature Engineering

Manifold Learning

Hauptkomponentenzerlegung (PCA)

Nicht-negative-Matrix-Faktorisierung (NMF)

Manifold Learning mit t-SNE

Clusteranalyse

k-Means-Clustering

Agglomeratives Clustering

Hierarchische Clusteranalyse

DBSCAN

Clusteralgorithmen


Evaluierung und Verbesserung (ca. 2 Tage)

Modellauswahl und Modellevaluation

Abstimmung der Hyperparameter eines Schätzers

Kreuzvalidierung

Gittersuche

Evaluationsmetriken

Klassifikation


Projektarbeit (ca. 3 Tage)

Zur Vertiefung der gelernten Inhalte

Präsentation der Projektergebnisse

Deep Learning

Einführung Deep Learning (ca. 1 Tag)

Deep Learning als eine Art von Machine Learning


Grundlagen in neuronalen Netzen (ca. 4 Tage)

Multilayer-Perzeptronen

Berechnung neuronaler Netze

Optimierung der Modellparameter, Backpropagation

Deep-Learning-Bibliotheken

Regression vs. Klassifikation

Typische Loss- und Aktivierungsfunktionen

Mit Metriken die Modellprognose bewerten

Regressions- und Klassifikationsmetriken

Lernkurven, Überanpassung und Regularisierung

Hyperparameteroptimierung

L1/12-Regularisierung

Dropout

Early-Stopping

Stochastischer Gradientenabstieg (SGD)

Momentum, Adam Optimizer

Optimierung der Lernrate

Dynamische Lernraten-Anpassung

Reduce Learningrate on Plateau

Lernraten-Optimierung mit dem TensorBoard

Mit Callbacks den Fitprozess steuern

Modelle speichern und laden


Convolutional Neural Network (CNN) (ca. 2 Tage)

Bildklassifizierung

Convolutional‐Schichten, Pooling‐Schichten

Reshaping‐Schichten, Flatten, Global‐Average‐Pooling

CNN‐Architekturen ImageNet‐Competition

Tiefe neuronale Netze, Vanishing Gradients, Skip‐Verbindungen, Batch‐Normalization


Transfer Learning (ca. 1 Tag)

Anpassen und Kombinieren von Modellen

Unüberwachtes Vortrainieren

Image‐Data‐Augmentation, Explainable AI

Dataloader


Regional CNN (ca. 1 Tag)

Objektlokalisierung

Semantische Segmentierung

Regressionsprobleme

Verzweigte neuronale Netze

YOLO-Architektur

U-Net-Modelle


Methoden der kreativen Bilderzeugung (ca. 1 Tag)

Generative Adversarial Networks (GAN) 

Deepfakes

Diffusionsmodelle

Superresolution

Bildbereiche ergänzen

Foundations Models von Hugging Face anwenden

Multimodale Modelle

LoRA-Fine-Tuning

Anwendungsgebiete generativer Modelle

Rechtliche Einschränkungen


Recurrente neurale Netze (ca. 2 Tage)

Sequenzanalyse

Rekurrente Schichten

Backpropagation through time (BPTT)

Analyse von Zeitreihen

Exploding und Vanishing Gradient Probleme

LSTM (Long Short‐Term Memory)

GRU (Gated Recurrent Unit)

Deep RNN

Deep LSTM


Textverarbeitung durch neuronale Netze (ca. 2 Tage)

Text-Preprocessing

Embedding-Schichten

Text-Klassifizierung

Sentimentanalyse

Natural Language Processing (NLP)

Übersetzungen

Textgeneration

Seqence-to-Sequence-Verfahren, Encoder-Decoder-Architektur

Encoder-Only- und Decoder-Only-Modelle

Lokale Anwendung von Large Language Models


Sprachmodelle (ca. 1 Tag)

Transfomer Architektur

Attention und Multihead-Attention

Positional Encodings

Fine-Tuning großer Sprachmodelle

Prompting

Textgeneration-Pipelines 

Summarization 

Chatbots

Retrieval Augmented Generation

KI-Agenten


Deep Reinforcement Learning (ca. 1 Tag)

Steuerung dynamischer Systeme

Agentensysteme

Training durch Belohnungen

Policy Gradients

Deep‐Q‐Learning


Bayes'sche neuronale Netze (ca. 1 Tag)

Unsicherheiten in neuronalen Netzen

Statistische Bewertung von Prognosen

Konfidenz, Standardabweichung

Unbalancierte Daten

Sampling‐Methoden


Projektarbeit (ca. 3 Tage)

Zur Vertiefung der gelernten Inhalte

Präsentation der Projektergebnisse



Änderungen möglich, die Lehrgangsinhalte werden regelmäßig aktualisiert.

Programmierkenntnisse in Python sowie Kenntnisse in relationalen Datenbanken und SQL werden vorausgesetzt., Vorkenntnisse im Bereich Data Analytics werden empfohlen.

Du beherrschst die Prozesse rund um die Zusammenführung, Aufbereitung, Anreicherung und Weitergabe von Daten. Außerdem kannst du große, unstrukturierte Datenmengen mit Hilfe von branchenspezifischer Software verarbeiten. Du verfügst über Kenntnisse im Framework Apache und weißt, wie Daten ansprechend visualisiert werden.

Auch besitzt du relevante Kenntnisse zu den Themen Machine Learning und Deep Learning. Du kennst die wichtigsten Gründe für die Verwendung des Machine Learning, Anwendungsgebiete sowie die verschiedenen Kategorien und Konzepte des Maschinellen Lernens. Auch verstehst du die Einsatzbereiche von Deep Learning und die Funktionsweisen neuronaler Netzwerke. Du bist in der Lage, maschinelles Lernen bereitzustellen und Prozesse zu dokumentieren.

Der Lehrgang richtet sich an Personen mit abgeschlossenem Studium in der Informatik, Wirtschaftsinformatik, BWL, Mathematik oder vergleichbarer Qualifikation.

Big Data wird in Unternehmen zur interdisziplinären Analyse und Konzeption von IT-Lösungen in Zusammenarbeit mit Entwicklungs- und Betriebsteams eingesetzt. Big Data Engineers sind sowohl bei großen als auch mittelständischen Unternehmen in Industrie, Handel, Dienstleistungs- und Finanzwesen nachgefragt.

Zudem bist du in den Fachbereichen Machine Learning und Deep Learning hochqualifiziert, kannst branchenübergreifend eingesetzt werden und bist am Arbeitsmarkt entsprechend vielfach nachgefragt. Du kannst große Datenmengen nach Mustern und Modellen untersuchen. Deep Learning kommt dabei häufig im Rahmen Künstlicher Intelligenz für die Gesichts-, Objekt- oder Spracherkennung zum Einsatz.

Dein aussagekräftiges Zertifikat gibt detaillierten Einblick in deine erworbenen Qualifikationen und verbessert deine beruflichen Chancen.

Didaktisches Konzept

Deine Dozierenden sind sowohl fachlich als auch didaktisch hoch qualifiziert und werden dich vom ersten bis zum letzten Tag unterrichten (kein Selbstlernsystem).

Du lernst in effektiven Kleingruppen. Die Kurse bestehen in der Regel aus 6 bis 25 Teilnehmenden. Der allgemeine Unterricht wird in allen Kursmodulen durch zahlreiche praxisbezogene Übungen ergänzt. Die Übungsphase ist ein wichtiger Bestandteil des Unterrichts, denn in dieser Zeit verarbeitest du das neu Erlernte und erlangst Sicherheit und Routine in der Anwendung. Im letzten Abschnitt des Lehrgangs findet eine Projektarbeit, eine Fallstudie oder eine Abschlussprüfung statt.

 

Virtueller Klassenraum alfaview®

Der Unterricht findet über die moderne Videotechnik alfaview® statt  - entweder bequem von zu Hause oder bei uns im Bildungszentrum. Über alfaview® kann sich der gesamte Kurs face-to-face sehen, in lippensynchroner Sprachqualität miteinander kommunizieren und an gemeinsamen Projekten arbeiten. Du kannst selbstverständlich auch deine zugeschalteten Trainer:innen jederzeit live sehen, mit diesen sprechen und du wirst während der gesamten Kursdauer von deinen Dozierenden in Echtzeit unterrichtet. Der Unterricht ist kein E-Learning, sondern echter Live-Präsenzunterricht über Videotechnik.

 

Die Lehrgänge bei alfatraining werden von der Agentur für Arbeit gefördert und sind nach der Zulassungsverordnung AZAV zertifiziert. Bei der Einreichung eines Bildungsgutscheines oder eines  Aktivierungs- und Vermittlungsgutscheines werden in der Regel die gesamten Lehrgangskosten von deiner Förderstelle übernommen.
Eine Förderung ist auch über den Europäischen Sozialfonds (ESF), die Deutsche Rentenversicherung (DRV) oder über regionale Förderprogramme möglich. Als Zeitsoldat:in besteht die Möglichkeit, Weiterbildungen über den Berufsförderungsdienst (BFD) zu besuchen. Auch Firmen können ihre Mitarbeiter:innen über eine Förderung der Agentur für Arbeit (Qualifizierungschancengesetz) qualifizieren lassen.

Gerne beraten wir dich kostenfrei.

0800 3456-500 Mo. - Fr. von 8 bis 17 Uhr
kostenfrei aus allen deutschen Netzen.

Kontakt

Gerne beraten wir dich kostenfrei. 0800 3456-500 Mo. - Fr. von 8 bis 17 Uhr kostenfrei aus allen deutschen Netzen.