contatore visite

mercoledì 30 settembre 2026

L’etica ed il linguaggio umano nella governance dell’intelligenza artificiale: Amanda Askell ed il tentativo di insegnare un "carattere" a Claude.

La mattina dello scorso 12 settembre, nell'ambito del Festival della Comunicazione di Camogli, ho seguito l'incontro con Nello Cristianini, venuto a presentare "Forma mentis. La corsa per decifrare il pensiero delle macchine", il suo ultimo libro sull'intelligenza artificiale, pubblicato da il Mulino il 12 maggio scorso. L'incontro, condotto dal giornalista scientifico Gianluca Dotti, prendeva le mosse da una delle questioni centrali del libro: come possiamo comprendere ciò che accade dentro sistemi che non sono stati programmati direttamente, ma che sono stati invece addestrati?

Commentando alcuni sviluppi successivi alla pubblicazione del volume, Cristianini ha sottolineato come il problema dell'allineamento dell'intelligenza artificiale stia progressivamente cambiando natura. Non si tratta più soltanto di impedire ad una macchina di compiere azioni pericolose attraverso regole, filtri o blocchi: quando un modello raggiunge un grado molto elevato di complessità, diventa invece necessario intervenire a un livello diverso, e cioè quello dei valori, del giudizio, delle disposizioni comportamentali e (in una certa misura) del carattere.

Poco prima della conclusione della conferenza, Cristianini ha raccontato il caso di Amanda Askell, filosofa e ricercatrice di Anthropic (l'azienda che ha sviluppato l'AI "Claude"), incaricata di lavorare sull'orientamento del comportamento e della personalità del modello. (1) La Askell non compare casualmente nel racconto di Cristianini: il suo lavoro è già presente in Forma mentis dove viene utilizzato come esempio concreto del nuovo rapporto che si sta instaurando fra gli esseri umani e le intelligenze artificiali. La storia della Askell permette infatti di dare una forma concreta ad una delle tesi centrali del libro: quando una macchina diventa troppo complessa per essere controllata direttamente, il problema non è più soltanto come programmarla, ma come orientarla. Le attuali intelligenze artificiali non sono sistemi nei quali un programmatore abbia stabilito esplicitamente ogni comportamento significativo; sono invece sistemi addestrati , nei quali capacità e rappresentazioni emergono dall'interazione fra architettura, dati e procedure di ottimizzazione.

Questo rende molto diverso il problema della comprensione.

Nel software tradizionale possiamo, almeno in linea di principio, risalire alle istruzioni ed alle funzioni che determinano un certo comportamento e modificarle. In una grande rete neurale, invece, una risposta è normalmente il risultato dell'interazione di un numero enorme di parametri e di rappresentazioni distribuite: non c'è, in generale, un singolo punto della rete al quale sia possibile attribuire ciò che osserviamo.

Cristianini propone quindi di guardare oltre i parametri ed oltre il semplice comportamento finale, concentrandosi su un livello intermedio nel quale emergono rappresentazioni, concetti e strategie.

Dobbiamo chiederci non più soltanto "che cosa fa questa macchina?" ma anche "che cosa sta rappresentando? Che cosa ha imparato a riconoscere? Quale modello del mondo sta utilizzando per produrre ciò che fa?"

L'intelligenza artificiale comincia quindi ad entrare nel territorio delle scienze cognitive. (2)

Uno degli obiettivi dell'interpretabilità è cercare di osservare questo livello intermedio individuando strutture interne associabili a caratteristiche semantiche.

L'esempio utilizzato da Cristianini durante la conferenza è quello del "ragno": prima ancora che una risposta venga formulata linguisticamente, all'interno del modello possono essere individuate attivazioni riconducibili ad un concetto relativamente stabile. (3)

Questo non significa che debba per forza esistere dentro la rete un singolo neurone che corrisponda in modo semplice ed assoluto alla parola ragno; significa piuttosto che i ricercatori stanno iniziando a individuare organizzazioni interne interpretabili in termini concettuali.

E' un cambiamento importante: la macchina non è più soltanto osservata dall'esterno attraverso i suoi output ma comincia a essere studiata anche attraverso ciò che accade al suo interno.

In un tale contesto viene messa in discussione la metafora del "pappagallo stocastico": i grandi modelli linguistici apprendono certamente regolarità statistiche dai testi sui quali vengono addestrati, ma questa descrizione non sembra sufficiente a spiegare tutte le loro attuali capacità.

I modelli contemporanei possono affrontare problemi matematici, scrivere programmi, utilizzare strumenti, elaborare strategie e produrre sequenze di ragionamento.

Ciò non significa che pensino come gli esseri umani, né che possiedano per forza una coscienza.

Significa piuttosto che dobbiamo prendere sul serio l'ipotesi che al loro interno si siano formate rappresentazioni sufficientemente strutturate da consentire prestazioni che non possono essere comprese semplicemente come riproduzione di sequenze linguistiche.

La domanda diventa allora "che cosa accade dentro la macchina mentre produce una risposta?"

È una domanda difficile perché concetti come "ragno", "ponte", "ironia", "prudenza" o "intenzione" non sono stati inseriti nella rete come definizioni esplicite; eppure il comportamento del modello suggerisce che esso abbia sviluppato rappresentazioni sufficientemente ricche da poter utilizzare concetti di questo tipo in contesti differenti.

Il problema dell'intelligenza artificiale diventa così anche un problema di scienza cognitiva artificiale: non dobbiamo soltanto imparare a costruire macchine sempre più capaci, ma cominciare a capire che tipo di intelligenza abbiamo costruito.

Secondo la prospettiva sviluppata dalla Askell, Claude non va considerato semplicemente come una collezione di parametri statistici, ma come un sistema al quale può essere attribuita, in senso funzionale, una sorta di personalità da coltivare; Cristianini arriva a utilizzare, parlando del suo lavoro, la metafora dell' "anima della macchina".

La formulazione deve essere naturalmente intesa come una metafora, non implica che Claude possieda un'anima, una coscienza o una soggettività paragonabile a quella umana.

Il punto è semmai un altro: se il comportamento di un modello presenta disposizioni relativamente stabili (per esempio una maggiore prudenza, una maggiore propensione all'onestà o una particolare sensibilità verso determinate situazioni) possiamo descriverle, almeno funzionalmente, attraverso il linguaggio del "carattere".

Su questo terreno si colloca il lavoro di Askell: la sua risposta alla complessità della rete non consiste nel tentare di modificare direttamente miliardi di parametri ma nel rivolgersi alla macchina a un livello semantico più alto, utilizzando il linguaggio.

Cristianini racconta così il suo lavoro: "... Askell scrive a Claude delle vere e proprie 'lettere' nelle quali spiega che cosa significhi comportarsi bene, quali siano le aspettative nei suoi confronti, che cosa sia corretto fare e che cosa invece debba essere evitato. La macchina viene poi addestrata anche sulla base di questi testi ..."

La suggestione dell'immagine è evidente: non si cerca più di correggere il comportamento intervenendo direttamente sul 'eccanismo, ma di modificare le condizioni cognitive e valoriali nelle quali il comportamento viene prodotto.

Non si agisce sul singolo parametro, si cerca di influenzare la forma complessiva del comportamento.

Questa idea trova una traduzione concreta nella Claude's Constitution (4), il documento attraverso il quale Anthropic esplicita i principi destinati ad orientare il comportamento del modello.

Il termine "costituzione" è significativo: non indica semplicemente un codice di divieti ma ciò che dovrebbe contribuire a costituire il carattere di Claude.

Il documento utilizza deliberatamente concetti come virtù, saggezza, onestà, prudenza e giudizio, e cerca di fornire al modello una cornice generale entro la quale affrontare anche situazioni che non possono essere previste una per una.

La differenza rispetto alla programmazione tradizionale è sostanziale.

Non si cerca di stabilire anticipatamente la risposta corretta a ogni possibile domanda, si forniscono invece principi attraverso i quali il modello possa orientarsi in situazioni nuove: è il passaggio dalla prescrizione puntuale del comportamento alla costruzione di disposizioni relativamente stabili.

In questo senso la Costituzione può essere considerata una sorta di traliccio, una struttura che orienta la crescita senza determinare meccanicamente ogni singolo comportamento.

Qui emerge un elemento filosofico particolarmente interessante: l'impostazione di Askell richiama, almeno per alcuni aspetti, la tradizione dell'etica delle virtù.

L'etica delle regole domanda "quale regola devo seguire?" la dove l'etica delle virtù chiede "che tipo di persona devo essere per agire bene?"

La differenza diventa importante quando si ha a che fare con sistemi destinati ad operare in ambienti imprevedibili: una lunga lista di regole può infatti funzionare nei casi previsti, ma un modello generale incontrerà inevitabilmente situazioni nelle quali più principi entrano in conflitto (utilità e sicurezza, autonomia e protezione, trasparenza e privacy, verità e possibili conseguenze dannose).

In questi casi non basta applicare meccanicamente una regola, serve ciò che viene definito giudizio contestuale.

È tuttavia importante evitare una rappresentazione troppo letterale dell'immagine suggerita da Cristianini relativa alla "lettera": la Askell non scrive un testo che Claude legge come farebbe un allievo umano, diventando successivamente virtuoso.

La Costituzione entra in un processo tecnico di addestramento molto più complesso.

Nella Constitutional AI Anthropic ha sviluppato procedure nelle quali i principi vengono utilizzati per generare critiche e revisioni delle risposte del modello, e per produrre dati impiegati successivamente nell'addestramento.

Il passaggio fondamentale è quindi questo: la filosofia viene trasformata in dati.

Un principio astratto come "sii onesto" deve diventare una quantità di esempi, valutazioni e segnali di addestramento attraverso i quali il modello viene spinto statisticamente verso determinati comportamenti.

La parola "onestà" non rimane quindi sulla pagina: entra nel processo attraverso il quale vengono selezionati alcuni comportamenti rispetto ad altri.

È in questo senso che si può dire che la filosofia entra nella macchina.

L'evoluzione più interessante di questo approccio consiste nel tentativo di insegnare al modello non soltanto che cosa dovrebbe fare, ma anche perché.

Nel lavoro Teaching Claude Why, Anthropic ha esplorato questa direzione: fornire al modello materiale che spieghi le ragioni sottostanti ai principi della Costituzione.

È una distinzione che ricorda quella fra addestramento e formazione.

Un bambino può imparare che "non bisogna mentire" semplicemente memorizzando una regola, ma può anche comprendere perché l'onestà è importante, quali conseguenze produce una menzogna, come comportarsi quando l'onestà entra in conflitto con altri valori e perché alcuni dilemmi non hanno una soluzione perfetta.

La seconda forma di apprendimento è molto più vicina all'idea di forma mentis.

Non significa che Claude venga educato come un essere umano, ma che l'addestramento cerca di trasferire al modello strutture concettuali attraverso le quali interpretare le regole, anziché soltanto regole da applicare.

Qui emerge la questione più difficile: se vogliamo orientare il comportamento di un'intelligenza artificiale attraverso i valori, chi decide quali valori debbano essere incorporati?

La Costituzione di Claude non è una legge naturale, è una scelta umana.

Anthropic dichiara esplicitamente che il documento attinge a fonti diverse, tra cui la Dichiarazione universale dei diritti umani, principi di sicurezza e indicazioni sviluppate da altre organizzazioni.

Ma gli esseri umani non condividono una singola concezione del bene, differiscono su libertà e sicurezza, autonomia e protezione, individuo e collettività, rischio e prudenza.

Dire che una macchina deve essere "buona" significa quindi dover scegliere, almeno in parte, che cosa debba significare "buona".

Ne consegue una domanda che dovrebbe accompagnare qualsiasi discussione sull'allineamento: "allineato a chi?"

Il problema non è soltanto "come facciamo a fare in modo che l'IA faccia ciò che vogliamo?" ma anche "chi siamo noi che decidiamo ciò che l'IA deve volere?"

Questo sposta l'allineamento da un problema esclusivamente tecnico ad un problema che è anche filosofico, culturale e di legittimità.

Se una società affida a pochi soggetti privati la definizione dei principi che orienteranno sistemi utilizzati da milioni di persone, la questione non riguarda più soltanto l'efficacia dell'addestramento, ma anche chi abbia titolo per stabilire quei valori.

Non sorprende, da questo punto di vista, che Anthropic abbia sperimentato anche forme di Collective Constitutional AI, coinvolgendo cittadini nella definizione dei principi di una costituzione per un sistema di IA.

L'esperimento suggerisce che la questione dei valori non può essere considerata puramente tecnica: se il carattere della macchina ha conseguenze sociali, la sua definizione diventa inevitabilmente una questione sociale.

Rimane però un'altra difficoltà: anche ammesso che sia possibile orientare il comportamento di un modello attraverso principi etici, come possiamo sapere che quei principi siano realmente diventati disposizioni stabili del sistema?

Un modello potrebbe imparare a produrre risposte che sembrano oneste senza essere realmente affidabile; potrebbe dire "non sono sicuro" senza che la sua incertezza interna sia correttamente calibrata, potrebbe fornire una spiegazione morale impeccabile e comportarsi diversamente quando incontra una situazione che non era presente nei dati di addestramento.

Questa distinzione è fondamentale: un comportamento allineato non è necessariamente la stessa cosa di un'intenzione allineata.

Naturalmente parlare di "intenzione" in un modello artificiale richiede cautela, il punto è più generale: osservare che un sistema produce sistematicamente una determinata risposta non ci dice automaticamente quale rappresentazione interna abbia generato quella risposta.

Il problema dell'allineamento ritorna al problema dell'interpretabilità: se vogliamo sapere se una macchina ha davvero sviluppato una determinata disposizione non possiamo limitarci a osservare ciò che dice nei casi che abbiamo preparato, dobbiamo cercare di capire che cosa ha imparato.

Una serie di domande scientifiche interessanti per il futuro potrebbe essere la seguente:

"Che cosa significa, dentro una rete neurale, 'essere onesto'? Che cosa significa 'essere prudente'? Esistono rappresentazioni interne corrispondenti a questi concetti? Sono distribuite? Dipendono dal contesto? Possono entrare in conflitto? E soprattutto 'possiamo misurarle'?"

Se Cristianini invita ad esplorare il livello mesoscopico delle rappresentazioni, il lavoro di Askell aggiunge un nuovo oggetto a questa ricerca: non soltanto concetti come "ragno" o "ponte", ma concetti normativi come onestà, prudenza, saggezza e autonomia.

Potremmo quindi arrivare ad una sorta di interpretabilità delle virtù artificiali: un'espressione volutamente provocatoria ma descrive bene il problema e cioè capire come un principio astratto possa trasformarsi, attraverso l'addestramento, in una disposizione comportamentale relativamente stabile.

C'è infine una conseguenza ancora più profonda: un sistema sufficientemente avanzato non riceve soltanto istruzioni ma le interpreta, e quando deve interpretarle può trovarsi davanti a conflitti.

Essere utile può entrare in conflitto con la sicurezza, esser trasparente con la privacy, rispettare l'autonomia dell'utente con la necessità di evitare un danno.

In questi casi una semplice gerarchia di regole non elimina il problema perché il modello deve comunque determinare come applicarle alla situazione concreta; l'IA comincia ad assomigliare meno ad un semplice esecutore.

Non perché possieda coscienza o volontà proprie, ma perché il suo funzionamento richiede qualcosa che, dal punto di vista comportamentale, assomiglia al giudizio (in questo il territorio il concetto di character diventa interessante).

Il collegamento fra Cristianini e Askell può essere riassunto in una distinzione molto semplice: Cristianini parte dalla domanda "come possiamo comprendere le strutture interne che emergono nei grandi modelli?" mentre la Askell parte da una domanda complementare "come possiamo orientare il comportamento di uno di questi sistemi attraverso principi e concetti?"

Le due direzioni si incontrano nello stesso punto: non si tratta più soltanto di programmare una macchina capace di eseguire istruzioni ma di creare le condizioni affinché, durante l'addestramento, emerga una determinata configurazione di comportamenti e disposizioni.

Nel software tradizionale possiamo schematicamente pensare specifica → codice → comportamento mentre nel machine learning dati + obiettivo → addestramento → comportamento emergente

Nel paradigma verso il quale sembrano condurci Cristianini e Askell possiamo aggiungere valori → concetti → addestramento → disposizioni → comportamento

La differenza è rilevate: il progettista non costruisce più direttamente ogni comportamento ma, almeno in parte, le condizioni nelle quali il comportamento può emergere.

Se i grandi modelli sviluppano rappresentazioni e disposizioni che non abbiamo specificato una per una, allora il nostro compito non può limitarsi a renderli più intelligenti ma dobbiamo capire quale forma di intelligenza stiamo costruendo e contemporaneamente dobbiamo chiederci quale orientamento vogliamo darle.

Il lavoro di Amanda Askell è importante non perché una filosofa abbia trovato una formula magica per insegnare la morale ad una macchina, ma perché rappresenta un passaggio significativo nell'evoluzione dell'IA: la filosofia entra nel ciclo tecnico dell'addestramento come strumento per orientare il comportamento di sistemi che non possiamo più controllare direttamente attraverso il codice.

E questo rende l'allineamento un problema più difficile, non più semplice: non basta chiedersi se Claude obbedisca alle nostre regole ma dobbiamo capire quali valori stiamo cercando di incorporare, chi li ha scelti, come vengono rappresentati dal modello e se continueranno a guidarne il comportamento quando il sistema incontrerà situazioni che nessuno aveva previsto.

La questione ultima non è quindi soltanto "come facciamo a rendere l'IA più intelligente?" ma "come facciamo a comprendere quale forma mentale stiamo creando?" e subito dopo "chi decide quale forma dovrebbe avere?"

Cristianini cerca di capire la forma mentis che emerge nelle macchine là dove la Askell cerca di orientarla: tra queste due attività si apre forse uno dei territori più inesplorati dell'intelligenza artificiale contemporanea, non più soltanto la costruzione di macchine capaci, ma la comprensione e, forse, la formazione del loro carattere.

Per la prima volta, informatica, filosofia, psicologia cognitiva ed etica sembrano trovarsi davanti allo stesso oggetto: non una macchina che abbiamo semplicemente programmato ma una forma di intelligenza che abbiamo creato e che dobbiamo ancora imparare a comprendere.


Note:

(1) Amanda Askell in Anthropic ricopre il ruolo di Head of Personality Alignment

(2) Da questa prospettiva il problema dell'AI diventa anche un problema di scienza cognitiva artificiale: non soltanto costruire sistemi capaci, ma comprendere quali rappresentazioni, strategie e strutture interne rendano possibili le loro capacità.

(3) Durante la conferenza Cristianini ha utilizzato l'esempio del "ragno", chiedendo al pubblico che cosa venisse evocato dalle parole "tela" e "otto zampe": l'esempio serviva ad illustrare il livello mesoscopico delle rappresentazioni interne.

È importante tuttavia evitare di interpretarlo in modo troppo letterale: la ricerca sull'interpretabilità non implica necessariamente l'esistenza di un singolo "neurone del ragno" semanticamente isolato; le rappresentazioni concettuali possono essere distribuite su più componenti della rete.

(4) La nuova Claude's Constitution, pubblicata da Anthropic nel 2026, è stata sviluppata attraverso numerose revisioni ed ha Claude come principale destinatario.

Il termine "costituzione" è utilizzato per indicare una struttura orientativa del carattere del modello, non un semplice codice legale di proibizioni.




Nessun commento:

Posta un commento

Elenco posts

 Elenco dei miei posts scritti nel periodo dal 28/3/18 ad oggi:                                        ( su FB ) - pdf e video  - mie domand...