Progetti e case study
Una raccolta di lavori su pipeline dati, piattaforme cloud, ETL, backend API, automazioni e workflow AI.
AWS Crypto ETL Pipeline
Pipeline ETL end-to-end su AWS per analizzare prezzi crypto e interesse Google Trends, con layer raw/silver/gold su S3, trasformazioni PySpark in AWS Glue, orchestrazione Step Functions, caricamento su Redshift Serverless e dashboard QuickSight.
Snowflake Hospital Data Platform
Data platform ospedaliera su Snowflake con modello multi-schema, pipeline IoT staging-to-clean, controlli di qualità , RBAC, masking GDPR, Time Travel, Zero-Copy Cloning e query analitiche per il monitoraggio clinico.
CineData ETL Azure
Pipeline ETL parametrica su Azure Data Factory che trasforma un catalogo di 9.125 film in un dataset Parquet di 2.726 titoli selezionati, combinando preprocessing Pandas, Blob Storage e Mapping Data Flow.
Breast Cancer Preprocessing Pipeline
Sistema di preprocessing multi-pipeline con scikit-learn che tratta valori mancanti, distribuzioni asimmetriche, variabili categoriche, selezione delle feature e riduzione dimensionale, producendo una matrice finale di 569 righe e 43 feature.
SQL Banking Customer Analytics
Progetto SQL analytics su un database bancario relazionale che consolida 359 transazioni di 15 clienti, calcola metriche di bilancio per tipologia di conto e segmenta il portafoglio con CTE e window function.
Wikipedia Article Classifier
Pipeline NLP end-to-end in PySpark per classificare articoli Wikipedia in 15 categorie tematiche, con pulizia di 153.232 record grezzi, persistenza Parquet, feature engineering TF-IDF a 20.000 dimensioni, Naive Bayes e analisi qualitativa tramite word cloud.