Metodologia

Open Civic Intelligence: simulazione elettorale, ottimizzazione del messaggio e analisi della propensione — con limitazioni dichiarate.

PoliSim documenta pubblicamente la propria metodologia completa. Il white paper tecnico copre l'intera architettura: lo swing model sui 221 collegi uninominali del Rosatellum, il modello MRP bayesiano con verosimiglianza Dirichlet-Multinomial, il Message Optimizer fondato sulla teoria del framing, il Cognitive Science Layer e il Modulo Propensione RFML. Ogni limitazione nota è dichiarata con la stessa prominenza dei risultati.

White Paper Tecnico v1.2 🇮🇹 Italiano

Metodologia e validazione completa — 9 sezioni, 22 riferimenti con DOI verificati — Giugno 2026

Scarica il PDF

Technical White Paper v1.2 🇬🇧 English

Full methodology and validation — 9 sections, 22 DOI-verified references — June 2026

Download PDF

Il contributo: MRP bayesiano su dati censuari italiani

Il cuore metodologico di PoliSim è un modello Multilevel Regression and Poststratification (Gelman & Little 1997; Park, Gelman & Bafumi 2004) implementato in PyMC con verosimiglianza Dirichlet-Multinomial, calibrato su 71 milioni di osservazioni del Censimento ISTAT 2021 aggregate a livello di collegio uninominale, con addestramento su 252 osservazioni collegio-elezione in 13 regioni.

A nostra conoscenza, non esiste letteratura pubblicata che applichi MRP con verosimiglianza Dirichlet-Multinomial a dati censuari italiani a livello di collegio uninominale con backtesting out-of-sample su elezioni reali. Le applicazioni MRP documentate riguardano prevalentemente il contesto statunitense e britannico, tipicamente con input sondaggistici individuali. L'applicazione ecologica su dati censuari aggregati italiani costituisce, ad oggi, un caso non documentato.

Metriche di validazione

Backtest sui 14 collegi Camera del Lazio, elezioni politiche 2022 (riferimento held-out):

4,01 pp
MAE quota CDX
4,64 pp
RMSE quota CDX
14/14
Winner accuracy
39,2%
CI90 — limite aperto

Confronto out-of-sample con baseline OLS (stessa matrice di progetto, stessi dati di addestramento):

DatasetN collegiRMSE OLSRMSE MRPVantaggio MRP
Lombardia 2023234,65 pp4,28 pp+0,37 pp
Lazio 2023145,36 pp5,08 pp+0,28 pp
Emilia-Romagna 2024 ⚠1112,09 pp10,36 pp+1,73 pp
Liguria 2024 †49,75 pp8,45 pp+1,30 pp
Media (4 dataset)—7,96 pp7,04 pp+0,92 pp

⚠ Emilia-Romagna outlier: RMSE CSX 15,7 pp — struttura competitiva locale divergente dal training set. † Liguria N=4: risultato indicativo, non statisticamente robusto. Il modello MRP supera la baseline OLS su tutti i dataset disponibili.

Architettura

Stage 1 — Swing Model

Eligendo 2022, 221 collegi uninominali, d'Hondt con soglia 3%, verifica doppia maggioranza

Stage 2 — MRP Bayesiano

PyMC, Dirichlet-Multinomial, 8 feature ISTAT, 252 osservazioni, effetti casuali regionali

Stage 3 — Message Optimizer

Framing Entman ×4, corpus valoriale dell'organizzazione, verificatore di ancoraggio fattuale

Cognitive Layer

5 framework cognitivi, core deterministico <50ms, evaluator AI separato opt-in

Modulo Propensione

RFML a 5 obiettivi, calibrazione territoriale ISTAT, elaborazione client-side GDPR

Il Message Optimizer: come restringe il campo prima di scrivere

Il sistema non genera un messaggio da un foglio bianco. Lo fa dentro un imbuto di quattro vincoli progressivi — ognuno raccoglie un'informazione diversa, e solo alla fine l'AI scrive.

1 — Organizzazione

Nome, verticale (lasciti, raccolta fondi, advocacy, corporate, fidelizzazione, volontariato) e — opzionale ma raccomandato — il corpus valoriale: statuto, carta dei valori, mission statement. Senza corpus, la coerenza si valuta solo sul tipo di organizzazione dichiarato.

2 — Segmento target

Tre livelli indipendenti e sovrapponibili: dati ISTAT 2021 (geografia o collegio specifico), profili valoriali (ITANES + European Social Survey), e un indice di polarizzazione che calibra il rischio di rigetto sui temi divisivi.

3 — Storia con l'organizzazione

Il profilo relazionale del destinatario — prospect, sostenitore, donatore ricorrente, ex sostenitore, a rischio — che insieme alla verticale del passo 1 determina la funzione comunicativa raccomandata: educazione alla causa, conversione, gratitudine, riattivazione.

4 — Testo e canale

Il messaggio da valutare o riscrivere, più il canale di destinazione — email, social, volantino, discorso, video, comunicato. Ogni canale impone un formato diverso alle varianti generate.

Cosa produce l'analisi

L'output combina un nucleo deterministico con un livello generato dall'AI — la distinzione è dichiarata esplicitamente, non lasciata implicita:

ComponenteCosa misuraNatura
Score coerenza valorialeConfronto tra il messaggio e il corpus del passo 1Deterministico
Rischio di rigettoCalibrato sull'indice di polarizzazione del segmentoDeterministico
Analisi Entman (1993)Quattro dimensioni: problema, cause, giudizio morale, soluzioneGenerata dall'AI
Layer cognitivoLeggibilità, carico, elaborazione, fluenza, framing — v. sottoDeterministico
Varianti nel formato del canaleRiscritture calibrate sul canale scelto al passo 4Generata dall'AI

Un limite dichiarato sull'analisi Entman. Le quattro dimensioni di framing sono prodotte dallo stesso modello che genera le varianti, nella stessa chiamata: è un'autovalutazione, non una misura indipendente. La letteratura sui limiti dell'auto-annotazione nei modelli linguistici documenta un bias di conferma sistematico in questo tipo di compito — il modello tende a valutare positivamente ciò che ha appena generato. È per questo che i punteggi vanno letti come un ordinamento relativo tra varianti, non come una misura assoluta di qualità.

Il layer cognitivo: la metà deterministica

A differenza dell'analisi Entman, cinque framework applicano una misura calcolata — non generata dall'AI — su basi teoriche citabili singolarmente:

FrameworkBase teoricaCosa misura
Carico cognitivoSweller (1988)Indice Gulpease (Lucisano & Piemontese, 1988) e lunghezza delle frasi
Processo dualeKahneman (2011)Rapporto tra linguaggio intuitivo e analitico
Via di elaborazionePetty & Cacioppo (1986)Segnali di via centrale vs periferica — solo segnali, la decisione finale resta assistita dall'AI
Fluenza cognitivaReber et al. (1998)Quanto il testo scorre senza attrito percepito
Effetti di framingTversky & Kahneman (1981)Guadagno/perdita, episodico/tematico

Cosa manca, dichiarato

Il modulo RFML: priorità donatori

Il modulo ordina, per ciascun donatore in un database caricato, la priorità relativa verso cinque obiettivi diversi — lascito, upgrade, sostegno continuativo, riattivazione, richiesta d'emergenza one-off. È un prototipo sperimentale, non ancora un modello di propensione validato: una buona base per dare priorità ai contatti, non uno strumento su cui basare decisioni automatiche. Si fonda su RFM, il metodo di segmentazione donatori più consolidato in letteratura (Olson & Chae, 2012; Durango-Cohen et al., 2013), esteso con una quinta dimensione.

Un punteggio, non una probabilità. Un valore 80 su un obiettivo non significa "80% di probabilità" — è una somma pesata di indicatori più correzioni dichiarate. Va letto come un indice di priorità che ordina i donatori tra loro, non come una stima probabilistica del comportamento futuro. Un'interpretazione probabilistica richiederebbe una calibrazione su esiti reali che oggi non esiste.

Le cinque dimensioni

R — Recency

Quanto è recente l'ultima donazione. Il predittore più diretto di attività del donatore: chi ha donato ieri è, in media, più raggiungibile di chi ha donato tre anni fa.

F — Frequency

Regolarità del pagamento, con un bonus per chi ha un metodo di donazione ricorrente attivo (addebito automatico). Misura costanza, non solo conteggio.

M — Monetary (livello + tendenza)

Non un unico numero: l'importo medio normalizzato sul database (livello) e la sua tendenza nel tempo — in crescita, stabile, in calo. Un donatore che aumenta gradualmente l'importo racconta una storia diversa da uno che dona sempre la stessa cifra da anni.

L — Longevity

Anzianità del rapporto con l'organizzazione, con un effetto di saturazione: oltre una certa soglia di anni, ulteriore anzianità non aggiunge peso. Pesa più per il lascito che per gli altri obiettivi.

Un'assunzione dichiarata, non un difetto nascosto. La dimensione Longevity assegna un punteggio più alto a chi ha un rapporto più lungo con l'organizzazione. La letteratura sul commitment del donatore documenta il legame personale con la causa e la fiducia come fattori che guidano la fedeltà nel tempo (Sargeant & Woodliffe, 2007) — una base concettuale per includere l'anzianità della relazione come segnale. Ma è un salto dalla teoria alla pratica: quella letteratura descrive perché la relazione conta, non quanto debba pesare nel punteggio. I coefficienti numerici usati oggi restano ipotesi di lavoro, non una derivazione documentata da quella ricerca. Un donatore di lunga data non è automaticamente il miglior prospect per ogni obiettivo: per la riattivazione, ad esempio, conta meno.

Per il solo obiettivo lascito, un secondo fattore — distinto da Longevity — entra in gioco: non l'anzianità del rapporto, ma la fascia d'età del donatore. È un correttivo dichiarato e isolato, non nascosto dentro i segnali RFML: nella logica attuale, le fasce d'età più giovani con pochi casi in banca dati vengono trattate come neutre — né premiate né penalizzate — proprio per evitare di premiare un segnale statisticamente troppo debole per essere affidabile.

Layer territoriale (dati ISTAT)

Dove il database include il CAP del donatore, il punteggio viene corretto con un moltiplicatore calcolato su dati ISTAT 2021 a livello regionale (incidenza over-65, reddito medio familiare, indice di disuguaglianza Gini) — diverso per ciascuno dei cinque obiettivi. I pesi esatti di questa correzione non sono pubblicati: fanno parte della configurazione interna del modello.

Come sono calibrati i pesi

I pesi che combinano le cinque dimensioni in un punteggio finale sono calibrati per giudizio esperto — non stimati con un fit statistico su esiti reali, perché quegli esiti, oggi, non esistono in quantità sufficiente. È una scelta dichiarata, non un limite nascosto: un fit statistico su poche centinaia di casi imparerebbe correlazioni spurie invece di un segnale reale.

1.65×
Lift lasciti, top 20% vs resto — dataset sintetico, non su campagne reali

Questo numero va letto con una cautela in più: è calcolato sullo stesso insieme di dati usato per calibrare il fattore età descritto sopra. Una misura costruita e verificata sugli stessi dati tende a essere ottimistica — la verifica onesta richiede di calibrare su una parte dei dati e misurare il risultato su un'altra, tenuta separata. È il prossimo passo dichiarato, non ancora fatto.

Perché non machine learning avanzato — ora

Tecniche più sofisticate (reti neurali ricorrenti, gradient boosting su storici lunghi) esistono e in alcuni contesti raggiungono accuratezze elevate. Non sono nella roadmap del modulo, per una ragione di dati prima ancora che di scelta tecnica: quelle tecniche sono supervisionate — imparano da migliaia di casi con esito noto. Un'organizzazione che parte da zero, o quasi, non li ha. Addestrare un modello complesso su poche centinaia di record significa imparare il rumore, non il segnale: più opacità, senza guadagno reale di accuratezza.

Il confronto con gli strumenti enterprise

Una recensione indipendente universitaria (Carnegie Mellon University, corso 62-830, primavera 2022) di uno dei prodotti di scoring predittivo più diffusi nel settore no-profit riporta due dati utili a inquadrare il problema: il fornitore richiede tipicamente almeno cinque anni di storico e diecimila record attivi per attivare lo scoring, e il suo modello per il direct mail era addestrato su circa 8,7 milioni di record. La stessa recensione osserva che questo tipo di requisito tende strutturalmente a favorire le organizzazioni già meglio dotate di dati e infrastruttura CRM — un problema di equità nell'accesso agli strumenti predittivi, non solo un dettaglio tecnico.

È esattamente lo spazio in cui il modulo RFML si colloca: organizzazioni che lavorano con un CSV esportato dal proprio CRM, non con un data warehouse enterprise. Non è un tentativo di competere sullo stesso terreno degli strumenti con centinaia di migliaia di record storici — è uno strumento pensato per chi quei dati non li ha.

Cosa manca, dichiarato

Limitazioni dichiarate

La credibilità scientifica richiede che i limiti siano dichiarati con la stessa prominenza dei risultati. Le limitazioni complete sono nella Sezione 6 del white paper. Le principali:

CI90 al 39,2% invece del 90% nominale. Gli intervalli credibili sono sotto-calibrati. Causa confermata: dataset di addestramento limitato (252 osservazioni), non specificazione dei prior — test con prior alternativi (HalfStudentT) non hanno prodotto miglioramenti. Le stime puntuali (MAP) sono gli output operativamente validi; gli intervalli non vanno usati per inferenza probabilistica.

Bias sistematico CDX di −3,33 pp. Concentrato nei collegi provinciali; causa identificata in feature occupazionali non ancora nel modello (dataset DCSC_CONDPROFOCCUP pianificato per la v5).

Modello ecologico. PoliSim stima da dati demografici e storici aggregati, non da sondaggi individuali geo-localizzati. È un calcolatore di scenari, non uno strumento predittivo autonomo.

Pesi Stage 3 e RFML expert-calibrated. Non ancora validati su A/B test reali. Un protocollo di validazione con 20 campagne partner e misurazione standardizzata degli esiti è in fase di reclutamento attivo.

Dati: esclusivamente fonti pubbliche istituzionali

FonteContenutoRuolo
ISTAT Censimento 202171M osservazioni, 493k sezioniFeature demografiche MRP
Eligendo OpenData (Min. Interno)Risultati ufficiali, tutti i cicliBaseline e validazione
ESS Round 11 (2023–24)N=2.865 Italia, face-to-faceProfili psicografici Stage 3
TRIPOL IT (2021–22)N=1.231, polarizzazione affettivaCalibrazione valenza emotiva

Nessun dato proprietario. Nessun dato personale raccolto o processato. Il codice è pubblico su GitHub con licenza AGPL v3; il layer AI è sostituibile by design con qualsiasi LLM instruction-following.