BIG DATA MANAGEMENT

Insegnamento
BIG DATA MANAGEMENT
Insegnamento in inglese
BIG DATA MANAGEMENT
Settore disciplinare
IINF-05/A
Corso di studi di riferimento
INGEGNERIA INFORMATICA
Tipo corso di studio
Laurea Magistrale
Crediti
6.0
Ripartizione oraria
Ore Attività Frontale: 54.0
Anno accademico
2026/2027
Anno di erogazione
2026/2027
Anno di corso
1
Lingua
ITALIANO
Percorso
PERCORSO COMUNE
Docente responsabile dell'erogazione
ZAPPATORE MARCO SALVATORE
Sede
Lecce

Descrizione dell'insegnamento

Buona conoscenza dei linguaggi orientati agli oggetti (almeno 1) e delle relative tecniche e strumenti/IDE di programmazione. Elementi di base delle reti di calcolatori e delle tecnologie per il Web. È richiesta una conoscenza tecnica dettagliata dei database relazionali e del linguaggio SQL.

Il corso ha lo scopo di:

  • introdurre i concetti, le metodologie e gli strumenti del data warehouse per lo sviluppo di sistemi di analisi dei dati e OLAP;
  • definire il concetto di big data e il ciclo di vita dei big data;
  • introdurre metodi e tecnologie per progettare e sviluppare applicazioni basate sui big data.

Obiettivi formativi

In coerenza con i Descrittori di Dublino, lo studente acquisirà:

Conoscenza e comprensione

Gli studenti devono avere una solida preparazione relativa alle basi della gestione dei big data e dei sistemi informativi. Gli studenti devono inoltre avere:

  • le basi per pensare in modo analitico, creativo e critico ed essere in grado di sviluppare capacità di astrazione e di risoluzione dei problemi per affrontare sistemi complessi
  • una conoscenza di base della progettazione e dell'implementazione dei sistemi di gestione dei big data
  • gli strumenti teorici e conoscitivi per progettare database transazionali e analitici applicati a contesti diversi.
  • le competenze per argomentare i dati in scenari diversi, gli strumenti per gestirli e comprenderne l'impatto.

Applicazione di conoscenze e comprensione

Al termine del corso lo studente sarà in grado di:

  • Descrivere il modello e le strutture di un sistema informativo; illustrare i componenti principali di un sistema informativo dal punto di vista tecnico e applicativo.
  • Distinguere i modelli concettuali, logici e fisici nella gestione dei big data.
  • Modellare i sistemi di elaborazione delle transazioni online dal punto di vista dei big data, distinguendo tra modelli concettuali, modelli relazionali e modelli fisici.
  • Modellare i sistemi di elaborazione analitica online dal punto di vista dei dati, distinguendo tra modelli concettuali, logici e fisici, ed essere in grado di descrivere le relazioni tra loro e i processi.

Autonomia di giudizio

Gli studenti vengono guidati ad affrontare in modo critico gli argomenti trattati durante la lezione, a confrontare diverse soluzioni per un dato problema, a identificare e proporre la soluzione più efficace o efficiente in modo autonomo.

Abilità comunicative

Gli studenti devono imparare a comunicare con un pubblico eterogeneo, spiegando la loro posizione in modo logico, coerente ed efficace. Durante il corso agli studenti verranno forniti il vocabolario specifico del settore e le conoscenze scientifiche e i metodi adeguati per esporre e argomentare in modo preciso e formale i principali argomenti relativi alla gestione dei big data e ai sistemi informativi.

Capacità di apprendimento

Gli studenti devono acquisire la capacità critica di rapportarsi in modo autonomo ai problemi tipici della gestione dei dati e delle informazioni e, in generale, alle questioni culturali relative ai sistemi informativi e alla loro gestione. Dovrebbero essere in grado di sviluppare un approccio per strutturare in modo indipendente le conoscenze e i metodi appresi in vista di un possibile proseguimento degli studi a livello superiore (dottorato) o nella prospettiva più ampia dell'auto-miglioramento culturale e professionale dell'apprendimento permanente. Pertanto, gli studenti dovrebbero essere in grado di modificare il loro approccio all'apprendimento in base alle diverse fonti di apprendimento e agli obiettivi che devono raggiungere in termini di risultati e pubblico.

Il corso mira a fornire agli studenti gli strumenti e le conoscenze necessarie per la gestione dei big data nelle organizzazioni aziendali. Il corso consiste in lezioni frontali ed esercitazioni pratiche in aula. Le lezioni frontali hanno lo scopo di migliorare le conoscenze e la comprensione degli studenti attraverso la presentazione di teorie, modelli e metodi; gli studenti sono invitati a partecipare alla lezione con autonomia di giudizio, ponendo domande e presentando esempi. Le esercitazioni hanno lo scopo di utilizzare strumenti che supportano i modelli e gli approcci presentati.

Prova orale in cui lo studente sviluppa un elaborato progettuale che prevede la progettazione e implementazione di una pipeline dati, applicando le metodologie e gli strumenti esaminati durante il corso a un caso di studio concreto. In sede di discussione, oltre alla presentazione del progetto, sono previste domande di teoria su tutti gli argomenti del corso, al fine di verificare la preparazione complessiva dello studente sull'intero programma.

Criteri di valutazione

La valutazione sarà basata sui seguenti criteri

Qualità e correttezza del project work: valutata attraverso la coerenza delle scelte progettuali e implementative rispetto al problema affrontato, la corretta applicazione delle metodologie di modellizzazione e delle tecnologie esaminate nel corso (data warehouse, data lake/lakehouse, strumenti di elaborazione big data, database NoSQL, ecc.), e la funzionalità complessiva della pipeline dati realizzata.
Padronanza dei contenuti teorici: valutata attraverso le risposte alle domande di teoria poste in sede di discussione, distribuite su tutti gli argomenti del corso (per verificare che la preparazione dello studente non sia limitata al solo ambito del progetto svolto, ma copra in modo completo e adeguato l'intero programma).
Capacità di argomentazione critica: valutata attraverso la capacità dello studente di motivare le scelte architetturali e tecnologiche adottate nel project work, di discuterne i limiti e le alternative possibili, e di collegare in modo coerente gli aspetti pratici del progetto ai concetti teorici affrontati a lezione.

Come indicato sulla piattaforma studenti.unisalento.it

Orario di ricevimento: per appuntamento (contattare il docente tramite e-mail) o direttamente al termine delle lezioni in aula.

  • Argomenti principali dei sistemi informativi: piramide di Anthony, applicazioni aziendali, OLTP e OLAP, paradigma ETL [4h]
  • Definizione e ciclo di vita del data warehouse [3h]
  • Modellizzazione dimensionale: DFM, snowflake / star schema [5h]
  • Data Lake e architetture Data Lakehouse (ad es., Apache Iceberg, Delta Lake) [4h]
  • Paradigma ELT e cloud data warehousing su piattaforme cloud (cenni) [2h]
  • Strumenti per la visualizzazione e il data storytelling in contesti di Big Data [4h]
  • Big data da Hadoop ad Apache Spark [5h]
  • Elaborazione dati in streaming e near real-time (Apache Kafka) [4h]
  • Database NoSQL e teorema CAP [4h]
  • Tipologie di database NoSQL: documentali, key-value, colonnari, a grafo [7h]
  • Data governance e (big) data quality [3h]
  • Laboratorio: progettazione end-to-end di una big data pipeline [5h]
  • Riferimenti principali: 
    • R. Elmasri, S. Navathe, Fundamental of Database Systems, 7th Ed., Pearson
    • M. Golfarelli, S. Rizzi, Data Warehouse Design, Mc Graw Hill, 2021
    • Thomas Erl and Wajid Khattak and and Paul Buhler. Big Data Fundamentals. Prentice Hall. 2016. ISBN 978-0-134-29107-9 
  • Ulteriori riferimenti: 
    • Joe Reis, Matt Housley, Fundamentals of Data Engineering, 2022, O’Relly
    • Balamurugan Balusamy, Nandhini Abirami R, Amir H. Gandomi, Big Data: Concepts, Technology, and Architecture, John Wiley & Sons Inc.; 1st Ed.
    • Мartin Kleppmann. Designing Data-Intensive Applications. O’Reilly. 2017. ISBN 978-1-449-37332-0
    • Rajkumar Buyya and Rodrigo N. Calheiros and Amir Vahid Dastjerdi. Big Data: Principles and Paradigms. Morgan Kaufmann. 2016. 978-0-128-05394-2 
    • Ihab F. Ilyas and Xu Chu. 2019. Data Cleaning. Association for Computing Machinery, New York, NY, USA. 

 

Materiale aggiuntivo sarà fornito durante le lezioni e reso disponibile tramite la piattaforma elearning-unisalento.it

NOTA: gli studenti che non hanno frequentato il corso di Database, possono fare riferimento anche al seguente corso online: "Database Modeling and Design" by  Prof. C. Batini on EDUOPEN: https://www.eduopen.org 

Semestre
Secondo Semestre (dal 01/03/2027 al 11/06/2027)

Tipo esame
Non obbligatorio - Caratterizzante

Valutazione
Orale - Voto Finale

Orario dell'insegnamento (Apre una nuova finestra)(Apre una nuova finestra)

Scarica scheda insegnamento (Apre una nuova finestra)(Apre una nuova finestra)