Pipeline ML Temps Réel pour l’Analyse Boursière - #98
Open
Abdou-25-art wants to merge 9 commits into
Open
Conversation
…creenshots, maj scripts et config.py
This file contains hidden or bidirectional Unicode text that may be interpreted or compiled differently than what appears below. To review, open the file in an editor that reveals hidden Unicode characters.
Learn more about bidirectional Unicode characters
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Add this suggestion to a batch that can be applied as a single commit.This suggestion is invalid because no changes were made to the code.Suggestions cannot be applied while the pull request is closed.Suggestions cannot be applied while viewing a subset of changes.Only one suggestion per line can be applied in a batch.Add this suggestion to a batch that can be applied as a single commit.Applying suggestions on deleted lines is not supported.You must change the existing code in this line in order to create a valid suggestion.Outdated suggestions cannot be applied.This suggestion has been applied or marked resolved.Suggestions cannot be applied from pending reviews.Suggestions cannot be applied on multi-line comments.Suggestions cannot be applied while the pull request is queued to merge.Suggestion cannot be applied right now. Please check back later.
📌 Pipeline de Machine Learning Temps Réel pour l’Analyse Boursière
👨💻 Équipe du projet
Abdourahim Ali Mohamed
Youssef Laaroussi
🎓 Encadrement
Pr. El HAJJI Mohamed
Pr. Tarek AIT BAHA
🚀 Contexte & Objectifs
Ce projet vise à concevoir et déployer un pipeline complet de Machine Learning en temps réel dédié à l’analyse des marchés boursiers.
Il repose sur une architecture Medallion (Delta Lake) et permet de prédire les tendances du marché à partir de flux de données financiers continus, avec une restitution en temps réel via un dashboard interactif.
🛠️ Architecture Technique
🔄 Ingestion & Traitement Streaming
Capture de flux JSON en temps réel via Apache Kafka
Traitement des données avec Spark Structured Streaming
Gestion des événements tardifs grâce au Watermarking
🏗️ Stockage – Architecture Medallion (Delta Lake)
Bronze : données brutes issues des flux Kafka
Silver : données enrichies (feature engineering : moyennes mobiles, volatilité, etc.)
Gold : résultats finaux incluant prédictions et probabilités
🤖 Machine Learning (Spark MLlib)
Normalisation des données avec StandardScaler
Modèle de Régression Logistique pour la prédiction de tendance (Hausse / Baisse)
Persistance du modèle permettant le rechargement ou le ré-entraînement à chaud
📊 Visualisation & Monitoring
Dashboard temps réel développé avec Streamlit et Plotly
Visualisation des tendances et indicateurs clés
Alertes automatiques déclenchées en cas de forte volatilité
✨ Fonctionnalités Clés
🔁 Prédictions en temps réel (micro-batchs de 5 secondes)
📉 Suivi continu de la volatilité du marché
⚙️ Architecture scalable et distribuée
📊 Interface utilisateur dynamique et interactive
🚀 Installation & Lancement
Démarrer Kafka
kafka-server-start.sh config/server.properties
Lancer le pipeline Spark Streaming
spark-submit streaming_pipeline.py
Démarrer le dashboard
streamlit run dashboard.py
🎥 Démonstration Vidéo
👉 Lien vers la vidéo
🏁 Conclusion
Cette Pull Request, réalisée par Abdourahim Ali Mohamed et Youssef Laaroussi sous l’encadrement de Pr. El HAJJI Mohamed et Pr. Tarek AIT BAHA, propose une solution robuste, moderne et scalable pour l’analyse boursière en temps réel.
Elle combine efficacement ingestion de données streaming, Machine Learning, persistance des modèles et visualisation interactive.