Metodologia
Open Civic Intelligence: simulazione elettorale, ottimizzazione del messaggio e analisi della propensione — con limitazioni dichiarate.
PoliSim documenta pubblicamente la propria metodologia completa. Il white paper tecnico copre l'intera architettura: lo swing model sui 221 collegi uninominali del Rosatellum, il modello MRP bayesiano con verosimiglianza Dirichlet-Multinomial, il Message Optimizer fondato sulla teoria del framing, il Cognitive Science Layer e il Modulo Propensione RFML. Ogni limitazione nota è dichiarata con la stessa prominenza dei risultati.
White Paper Tecnico v1.2 🇮🇹 Italiano
Metodologia e validazione completa — 9 sezioni, 22 riferimenti con DOI verificati — Giugno 2026
Technical White Paper v1.2 🇬🇧 English
Full methodology and validation — 9 sections, 22 DOI-verified references — June 2026
Il contributo: MRP bayesiano su dati censuari italiani
Il cuore metodologico di PoliSim è un modello Multilevel Regression and Poststratification (Gelman & Little 1997; Park, Gelman & Bafumi 2004) implementato in PyMC con verosimiglianza Dirichlet-Multinomial, calibrato su 71 milioni di osservazioni del Censimento ISTAT 2021 aggregate a livello di collegio uninominale, con addestramento su 252 osservazioni collegio-elezione in 13 regioni.
A nostra conoscenza, non esiste letteratura pubblicata che applichi MRP con verosimiglianza Dirichlet-Multinomial a dati censuari italiani a livello di collegio uninominale con backtesting out-of-sample su elezioni reali. Le applicazioni MRP documentate riguardano prevalentemente il contesto statunitense e britannico, tipicamente con input sondaggistici individuali. L'applicazione ecologica su dati censuari aggregati italiani costituisce, ad oggi, un caso non documentato.
Metriche di validazione
Backtest sui 14 collegi Camera del Lazio, elezioni politiche 2022 (riferimento held-out):
Confronto out-of-sample con baseline OLS (stessa matrice di progetto, stessi dati di addestramento):
| Dataset | N collegi | RMSE OLS | RMSE MRP | Vantaggio MRP |
|---|---|---|---|---|
| Lombardia 2023 | 23 | 4,65 pp | 4,28 pp | +0,37 pp |
| Lazio 2023 | 14 | 5,36 pp | 5,08 pp | +0,28 pp |
| Emilia-Romagna 2024 ⚠ | 11 | 12,09 pp | 10,36 pp | +1,73 pp |
| Liguria 2024 † | 4 | 9,75 pp | 8,45 pp | +1,30 pp |
| Media (4 dataset) | — | 7,96 pp | 7,04 pp | +0,92 pp |
⚠ Emilia-Romagna outlier: RMSE CSX 15,7 pp — struttura competitiva locale divergente dal training set. † Liguria N=4: risultato indicativo, non statisticamente robusto. Il modello MRP supera la baseline OLS su tutti i dataset disponibili.
Architettura
Stage 1 — Swing Model
Eligendo 2022, 221 collegi uninominali, d'Hondt con soglia 3%, verifica doppia maggioranza
Stage 2 — MRP Bayesiano
PyMC, Dirichlet-Multinomial, 8 feature ISTAT, 252 osservazioni, effetti casuali regionali
Stage 3 — Message Optimizer
Framing Entman ×4, corpus valoriale dell'organizzazione, verificatore di ancoraggio fattuale
Cognitive Layer
5 framework cognitivi, core deterministico <50ms, evaluator AI separato opt-in
Modulo Propensione
RFML a 5 obiettivi, calibrazione territoriale ISTAT, elaborazione client-side GDPR
Il Message Optimizer: come restringe il campo prima di scrivere
Il sistema non genera un messaggio da un foglio bianco. Lo fa dentro un imbuto di quattro vincoli progressivi — ognuno raccoglie un'informazione diversa, e solo alla fine l'AI scrive.
1 — Organizzazione
Nome, verticale (lasciti, raccolta fondi, advocacy, corporate, fidelizzazione, volontariato) e — opzionale ma raccomandato — il corpus valoriale: statuto, carta dei valori, mission statement. Senza corpus, la coerenza si valuta solo sul tipo di organizzazione dichiarato.
2 — Segmento target
Tre livelli indipendenti e sovrapponibili: dati ISTAT 2021 (geografia o collegio specifico), profili valoriali (ITANES + European Social Survey), e un indice di polarizzazione che calibra il rischio di rigetto sui temi divisivi.
3 — Storia con l'organizzazione
Il profilo relazionale del destinatario — prospect, sostenitore, donatore ricorrente, ex sostenitore, a rischio — che insieme alla verticale del passo 1 determina la funzione comunicativa raccomandata: educazione alla causa, conversione, gratitudine, riattivazione.
4 — Testo e canale
Il messaggio da valutare o riscrivere, più il canale di destinazione — email, social, volantino, discorso, video, comunicato. Ogni canale impone un formato diverso alle varianti generate.
Cosa produce l'analisi
L'output combina un nucleo deterministico con un livello generato dall'AI — la distinzione è dichiarata esplicitamente, non lasciata implicita:
| Componente | Cosa misura | Natura |
|---|---|---|
| Score coerenza valoriale | Confronto tra il messaggio e il corpus del passo 1 | Deterministico |
| Rischio di rigetto | Calibrato sull'indice di polarizzazione del segmento | Deterministico |
| Analisi Entman (1993) | Quattro dimensioni: problema, cause, giudizio morale, soluzione | Generata dall'AI |
| Layer cognitivo | Leggibilità, carico, elaborazione, fluenza, framing — v. sotto | Deterministico |
| Varianti nel formato del canale | Riscritture calibrate sul canale scelto al passo 4 | Generata dall'AI |
Un limite dichiarato sull'analisi Entman. Le quattro dimensioni di framing sono prodotte dallo stesso modello che genera le varianti, nella stessa chiamata: è un'autovalutazione, non una misura indipendente. La letteratura sui limiti dell'auto-annotazione nei modelli linguistici documenta un bias di conferma sistematico in questo tipo di compito — il modello tende a valutare positivamente ciò che ha appena generato. È per questo che i punteggi vanno letti come un ordinamento relativo tra varianti, non come una misura assoluta di qualità.
Il layer cognitivo: la metà deterministica
A differenza dell'analisi Entman, cinque framework applicano una misura calcolata — non generata dall'AI — su basi teoriche citabili singolarmente:
| Framework | Base teorica | Cosa misura |
|---|---|---|
| Carico cognitivo | Sweller (1988) | Indice Gulpease (Lucisano & Piemontese, 1988) e lunghezza delle frasi |
| Processo duale | Kahneman (2011) | Rapporto tra linguaggio intuitivo e analitico |
| Via di elaborazione | Petty & Cacioppo (1986) | Segnali di via centrale vs periferica — solo segnali, la decisione finale resta assistita dall'AI |
| Fluenza cognitiva | Reber et al. (1998) | Quanto il testo scorre senza attrito percepito |
| Effetti di framing | Tversky & Kahneman (1981) | Guadagno/perdita, episodico/tematico |
Cosa manca, dichiarato
- L'analisi Entman è un'autovalutazione dell'AI, non una misura indipendente — bias di conferma noto in letteratura, non ancora corretto strutturalmente
- Il layer cognitivo è deterministico e non generato dall'AI, ma i suoi cinque punteggi non sono ancora combinati con una calibrazione validata su esiti reali di campagna
- Il canale video ha vincoli di formato più stretti degli altri (durata, struttura in quattro tempi) ed è il più recente: verifica di conformità ancora in corso
Il modulo RFML: priorità donatori
Il modulo ordina, per ciascun donatore in un database caricato, la priorità relativa verso cinque obiettivi diversi — lascito, upgrade, sostegno continuativo, riattivazione, richiesta d'emergenza one-off. È un prototipo sperimentale, non ancora un modello di propensione validato: una buona base per dare priorità ai contatti, non uno strumento su cui basare decisioni automatiche. Si fonda su RFM, il metodo di segmentazione donatori più consolidato in letteratura (Olson & Chae, 2012; Durango-Cohen et al., 2013), esteso con una quinta dimensione.
Un punteggio, non una probabilità. Un valore 80 su un obiettivo non significa "80% di probabilità" — è una somma pesata di indicatori più correzioni dichiarate. Va letto come un indice di priorità che ordina i donatori tra loro, non come una stima probabilistica del comportamento futuro. Un'interpretazione probabilistica richiederebbe una calibrazione su esiti reali che oggi non esiste.
Le cinque dimensioni
R — Recency
Quanto è recente l'ultima donazione. Il predittore più diretto di attività del donatore: chi ha donato ieri è, in media, più raggiungibile di chi ha donato tre anni fa.
F — Frequency
Regolarità del pagamento, con un bonus per chi ha un metodo di donazione ricorrente attivo (addebito automatico). Misura costanza, non solo conteggio.
M — Monetary (livello + tendenza)
Non un unico numero: l'importo medio normalizzato sul database (livello) e la sua tendenza nel tempo — in crescita, stabile, in calo. Un donatore che aumenta gradualmente l'importo racconta una storia diversa da uno che dona sempre la stessa cifra da anni.
L — Longevity
Anzianità del rapporto con l'organizzazione, con un effetto di saturazione: oltre una certa soglia di anni, ulteriore anzianità non aggiunge peso. Pesa più per il lascito che per gli altri obiettivi.
Un'assunzione dichiarata, non un difetto nascosto. La dimensione Longevity assegna un punteggio più alto a chi ha un rapporto più lungo con l'organizzazione. La letteratura sul commitment del donatore documenta il legame personale con la causa e la fiducia come fattori che guidano la fedeltà nel tempo (Sargeant & Woodliffe, 2007) — una base concettuale per includere l'anzianità della relazione come segnale. Ma è un salto dalla teoria alla pratica: quella letteratura descrive perché la relazione conta, non quanto debba pesare nel punteggio. I coefficienti numerici usati oggi restano ipotesi di lavoro, non una derivazione documentata da quella ricerca. Un donatore di lunga data non è automaticamente il miglior prospect per ogni obiettivo: per la riattivazione, ad esempio, conta meno.
Per il solo obiettivo lascito, un secondo fattore — distinto da Longevity — entra in gioco: non l'anzianità del rapporto, ma la fascia d'età del donatore. È un correttivo dichiarato e isolato, non nascosto dentro i segnali RFML: nella logica attuale, le fasce d'età più giovani con pochi casi in banca dati vengono trattate come neutre — né premiate né penalizzate — proprio per evitare di premiare un segnale statisticamente troppo debole per essere affidabile.
Layer territoriale (dati ISTAT)
Dove il database include il CAP del donatore, il punteggio viene corretto con un moltiplicatore calcolato su dati ISTAT 2021 a livello regionale (incidenza over-65, reddito medio familiare, indice di disuguaglianza Gini) — diverso per ciascuno dei cinque obiettivi. I pesi esatti di questa correzione non sono pubblicati: fanno parte della configurazione interna del modello.
Come sono calibrati i pesi
I pesi che combinano le cinque dimensioni in un punteggio finale sono calibrati per giudizio esperto — non stimati con un fit statistico su esiti reali, perché quegli esiti, oggi, non esistono in quantità sufficiente. È una scelta dichiarata, non un limite nascosto: un fit statistico su poche centinaia di casi imparerebbe correlazioni spurie invece di un segnale reale.
Questo numero va letto con una cautela in più: è calcolato sullo stesso insieme di dati usato per calibrare il fattore età descritto sopra. Una misura costruita e verificata sugli stessi dati tende a essere ottimistica — la verifica onesta richiede di calibrare su una parte dei dati e misurare il risultato su un'altra, tenuta separata. È il prossimo passo dichiarato, non ancora fatto.
Perché non machine learning avanzato — ora
Tecniche più sofisticate (reti neurali ricorrenti, gradient boosting su storici lunghi) esistono e in alcuni contesti raggiungono accuratezze elevate. Non sono nella roadmap del modulo, per una ragione di dati prima ancora che di scelta tecnica: quelle tecniche sono supervisionate — imparano da migliaia di casi con esito noto. Un'organizzazione che parte da zero, o quasi, non li ha. Addestrare un modello complesso su poche centinaia di record significa imparare il rumore, non il segnale: più opacità, senza guadagno reale di accuratezza.
Il confronto con gli strumenti enterprise
Una recensione indipendente universitaria (Carnegie Mellon University, corso 62-830, primavera 2022) di uno dei prodotti di scoring predittivo più diffusi nel settore no-profit riporta due dati utili a inquadrare il problema: il fornitore richiede tipicamente almeno cinque anni di storico e diecimila record attivi per attivare lo scoring, e il suo modello per il direct mail era addestrato su circa 8,7 milioni di record. La stessa recensione osserva che questo tipo di requisito tende strutturalmente a favorire le organizzazioni già meglio dotate di dati e infrastruttura CRM — un problema di equità nell'accesso agli strumenti predittivi, non solo un dettaglio tecnico.
È esattamente lo spazio in cui il modulo RFML si colloca: organizzazioni che lavorano con un CSV esportato dal proprio CRM, non con un data warehouse enterprise. Non è un tentativo di competere sullo stesso terreno degli strumenti con centinaia di migliaia di record storici — è uno strumento pensato per chi quei dati non li ha.
Cosa manca, dichiarato
- Pesi calibrati per giudizio esperto, non ancora validati su A/B test reali
- Lift misurato sullo stesso dataset sintetico usato per calibrare il fattore età — calibrazione e verifica non sono ancora separate, quindi la misura è probabilmente ottimistica
- Il fattore età sul lascito è coerente con la pratica di settore, ma non ancora verificato su dati italiani reali
- Moltiplicatori territoriali ISTAT: ipotesi ragionate, non ancora validate su dati di fundraising italiani reali
- Calibrato solo per il verticale non-profit: sindacati ed enti locali non hanno ancora pesi propri
- Meccanismo di ricalibrazione sugli esiti reali: non ancora attivo — è la milestone critica per passare da "calibrato per giudizio esperto" a "validato sui dati"
Limitazioni dichiarate
La credibilità scientifica richiede che i limiti siano dichiarati con la stessa prominenza dei risultati. Le limitazioni complete sono nella Sezione 6 del white paper. Le principali:
CI90 al 39,2% invece del 90% nominale. Gli intervalli credibili sono sotto-calibrati. Causa confermata: dataset di addestramento limitato (252 osservazioni), non specificazione dei prior — test con prior alternativi (HalfStudentT) non hanno prodotto miglioramenti. Le stime puntuali (MAP) sono gli output operativamente validi; gli intervalli non vanno usati per inferenza probabilistica.
Bias sistematico CDX di −3,33 pp. Concentrato nei collegi provinciali; causa identificata in feature occupazionali non ancora nel modello (dataset DCSC_CONDPROFOCCUP pianificato per la v5).
Modello ecologico. PoliSim stima da dati demografici e storici aggregati, non da sondaggi individuali geo-localizzati. È un calcolatore di scenari, non uno strumento predittivo autonomo.
Pesi Stage 3 e RFML expert-calibrated. Non ancora validati su A/B test reali. Un protocollo di validazione con 20 campagne partner e misurazione standardizzata degli esiti è in fase di reclutamento attivo.
Dati: esclusivamente fonti pubbliche istituzionali
| Fonte | Contenuto | Ruolo |
|---|---|---|
| ISTAT Censimento 2021 | 71M osservazioni, 493k sezioni | Feature demografiche MRP |
| Eligendo OpenData (Min. Interno) | Risultati ufficiali, tutti i cicli | Baseline e validazione |
| ESS Round 11 (2023–24) | N=2.865 Italia, face-to-face | Profili psicografici Stage 3 |
| TRIPOL IT (2021–22) | N=1.231, polarizzazione affettiva | Calibrazione valenza emotiva |
Nessun dato proprietario. Nessun dato personale raccolto o processato. Il codice è pubblico su GitHub con licenza AGPL v3; il layer AI è sostituibile by design con qualsiasi LLM instruction-following.