Disponible pour des opportunités

Corentin
Perinet

Data Scientist & Développeur — spécialisé en Machine Learning, Big Data, NLP et développement d'applications web orientées données.

10+
Projets réalisés
15+
Technologies maîtrisées
M2
Data Science & IA
3+
Années d'études

Data Scientist
& Développeur

Étudiant en Master 2 Data Science & Intelligence Artificielle, je combine des compétences solides en analyse de données, machine learning, traitement du langage naturel et développement web.

Mes projets couvrent l'ensemble de la chaîne de valeur data : de la collecte (scraping, APIs) au déploiement d'applications web en passant par la modélisation statistique et l'infrastructure Big Data.

Passionné par les problèmes complexes, je conçois des solutions end-to-end qui combinent rigueur mathématique et pragmatisme ingénieur.

Master 2 — Data Science & Intelligence Artificielle
Big Data · ML · Cloud · NLP · IA Générative
2024 – 2025
Master 1 — Data Science
Python avancé · Séries temporelles · NoSQL · Web
2023 – 2024
Bachelor 3 — Informatique & Data
Python · R · SQL · Analyse de données
2022 – 2023
Projets

Ce que j'ai réalisé

Une sélection de mes projets les plus significatifs, du Big Data à l'IA générative en passant par le développement d'applications.

Big Data PySpark · Kafka · Docker
Moteur de recommandation Big Data
Stack complète dockerisée (Hadoop + Spark + Kafka + Jupyter) — moteur ALS sur 100 836 ratings MovieLens, RMSE=0.8118
Docker PySpark Hadoop Kafka
0.8118RMSE ALS
100K+ratings
Voir le projet
Web App React 19 · Tailwind · Recharts
Dashboard React interactif
SPA React 19 avec graphiques temps réel, carte mondiale, admin panel et animations — Tailwind CSS
React 19 Recharts Tailwind Motion
5routes
30+composants
Voir le projet
Data Pipeline BeautifulSoup · Pandas · Leaflet
HappyHour Toulouse — Scraping & Analyse
69 bars scrapés sur SchloukMap — meilleure remise −50% (1862 Artybar), rapport SMTP automatisé + carte Leaflet
Python BeautifulSoup Pandas Leaflet
69bars scrapés
−50%remise max
Voir le projet
NLP · IA Word2Vec · spaCy · Streamlit
Chatbot sémantique Word2Vec
Comprend le sens des questions — 52 000 paires Q/R indexées par similarité cosinus, entraîné sur Alpaca-GPT4
Python Word2Vec spaCy Streamlit
52KQ/R
0.89sim. cosinus
Voir le projet
NLP · MongoDB spaCy FR · RapidFuzz · MongoDB
Assistant produits NLP Français
Interroge une base MongoDB en français naturel — tolère les fautes de frappe grâce à la correspondance floue RapidFuzz
Python spaCy RapidFuzz MongoDB
≥80%fuzzy
3intentions
Voir le projet
Séries Temporelles SARIMA · statsmodels · pmdarima
Prévision ARIMA/SARIMA
SARIMA(1,1,1)×(0,1,1,12) sur AirPassengers — AIC=−481.9, RMSE=0.038 (−80% vs ARIMA simple), IC 95%
Python SARIMA statsmodels Pandas
0.038RMSE SARIMA
−481.9AIC
Voir le projet
Machine Learning Scikit-learn · XGBoost · SMOTE
ML — Dépression étudiante & Météo
8 modèles comparés par CV 5-fold — Gradient Boosting F1=0.825, AUC=0.856, Recall=84.2% sur 27 901 étudiants
Scikit-learn XGBoost SMOTE Python
78.6%accuracy
0.856AUC-ROC
Voir le projet
Cloud Azure C# .NET 8 · Blob Storage · RBAC
Infrastructure Azure — .NET 8
Blob Storage, VMs, VNET et IAM déployés en C# .NET 8 — préparation certification AZ-204
C# .NET 8 Azure SDK Blob RBAC
AZ-204certif. visée
RBAC+ VNET
Voir le projet
Cloud AWS S3 · Redshift · Spectrum
Infrastructure Data AWS — Redshift & Spectrum
MovieLens dans S3, requêtes SQL via Spectrum sans ETL — Film-Noir 4.08/5, 100K+ ratings analysés avec Redshift
Redshift S3 Spectrum IAM psycopg2
4.08Film-Noir /5
100K+ratings SQL
Voir le projet
API · Analytics Twitter API v2 · Flask · Pandas
Twitter Analytics — API & Flask
4 endpoints Flask : recherche de tweets, métriques d'engagement, timelines utilisateurs, téléchargement de médias
Python Tweepy Flask Pandas
v2API
4endpoints
Voir le projet
Data Analysis Pandas · Seaborn · Scikit-learn
Football Analytics — FIFA 17 700+ joueurs
EDA complète sur 17 700 joueurs FIFA 24 — analyse M/F, top joueurs par poste, prédiction de la valeur marchande (R²=0.71)
Python Pandas Seaborn Scikit-learn
17.7Kjoueurs
R²=0.71valeur marchande
Voir le projet
IA Générative GMM · HMM · hmmlearn
IA Générative — GMM & Markov Cachés
Clustering non supervisé par Gaussian Mixture Models (EM) + séquences par HMM avec décodage Viterbi
Python scikit-learn hmmlearn NumPy
K=3GMM optimal
4 étatsHMM Viterbi
Voir le projet
Data Analysis Power BI · DAX · API INSEE
Dashboard Power BI — Audit Qualité C4C
Dashboard interactif de récap compte : sélection depuis la BDD, comparaison automatique avec la base INSEE et détection des données obsolètes
Power BI DAX API INSEE SQL
3onglets
INSEEcross-check auto
Voir le projet

Stack Technologique

L'ensemble des technologies que j'ai utilisées et maîtrisées à travers mes projets.

🐍 Python & Data
Python
Pandas / NumPy
Matplotlib / Seaborn
Scikit-learn
Flask / Streamlit
📊 Machine Learning
Régression / Classification
Séries temporelles (ARIMA)
Clustering (GMM, K-Means)
Feature Engineering
Modèles génératifs (HMM)
🗣 NLP & IA
spaCy (FR + EN)
Word2Vec / Embeddings
NLTK / Tokenisation
Hugging Face
Fuzzy Matching
🔥 Big Data
Apache Spark / PySpark
Hadoop HDFS
Apache Kafka
Docker / Docker Compose
Google BigQuery
☁️ Cloud
Microsoft Azure
AWS (RDS, Glue, S3)
Azure Blob Storage
C# / .NET 8
IAM / Sécurité
🌐 Web & Bases de données
React / Vite / Tailwind
MongoDB / NoSQL
PostgreSQL / SQL
Web Scraping (BS4)
R (Stats)