Kafka-Spark-DeltaLake-ML Architecture Update - #105
Open
Elasfer-Abdellah wants to merge 14 commits into
Open
Conversation
Co-authored-by: Copilot <175728472+Copilot@users.noreply.github.com>
Co-authored-by: Copilot <175728472+Copilot@users.noreply.github.com>
Contributor
|
Thanks for the contribution! Looking through this, it seems some of the Figma requirements weren't fully met. Let’s sync up to make sure we’re on the same page, or feel free to take another pass at it. |
This file contains hidden or bidirectional Unicode text that may be interpreted or compiled differently than what appears below. To review, open the file in an editor that reveals hidden Unicode characters.
Learn more about bidirectional Unicode characters
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Add this suggestion to a batch that can be applied as a single commit.This suggestion is invalid because no changes were made to the code.Suggestions cannot be applied while the pull request is closed.Suggestions cannot be applied while viewing a subset of changes.Only one suggestion per line can be applied in a batch.Add this suggestion to a batch that can be applied as a single commit.Applying suggestions on deleted lines is not supported.You must change the existing code in this line in order to create a valid suggestion.Outdated suggestions cannot be applied.This suggestion has been applied or marked resolved.Suggestions cannot be applied from pending reviews.Suggestions cannot be applied on multi-line comments.Suggestions cannot be applied while the pull request is queued to merge.Suggestion cannot be applied right now. Please check back later.
Pull Request — Kafka-Spark-DeltaLake-ML Architecture Update
Résumé
Cette PR rassemble les fichiers ajoutés pour le projet FinanceLake : code d'orchestration, producteur Kafka, consommateurs Spark/Delta et la documentation d'architecture. Elle facilite la revue des composants principaux mis en place pour le pipeline Kafka → Spark → Delta Lake → ML.
Fichiers ajoutés / modifiés
Motivation
Changements clés
producer.py: producteur Kafka utilisé pour simuler les flux de données.spark_delta_consumer.py: consommateur Spark qui lit depuis Kafka et écrit vers Delta Lake.SparkMLlib_trainer_and_predicter.py: script d'entrainement/prédiction ML basé sur Spark MLlib.app.pyetapp_control_v0.py: scripts d'orchestration/contrôle pour exécuter et superviser les composants locaux.FinanceLake_Architecture.mdet l'image associée : documentation et diagramme d'architecture.Comment tester
requirements.txt.producer.pypour injecter des messages.spark_delta_consumer.pypour consommer et persister les données dans Delta.SparkMLlib_trainer_and_predicter.pypour valider l'entraînement/prédiction sur les données persistées.Exemples de commandes rapides (en local/dev) :
Impact / Risques
resources/— vérifier la taille du dépôt si nécessaire.Checklist pour la revue
FinanceLake_Architecture.md.producer.pyet le consumer Spark.Réalisation par