Un arbitro costitutivo elimina l'ambiguità dentro un gioco già scelto. Non sceglie il gioco. E la distinzione tra migliorare i mezzi e originare i fini apre una strada che di solito si trascura.
Se si accetta che l'auto-miglioramento dei sistemi artificiali dipenda dalla disponibilità di un criterio di verifica rapido ed economico, e che tale criterio possa essere costitutivo — coincidere cioè con il successo che intende misurare — oppure soltanto correlazionale, si arriva facilmente a una conclusione rassicurante.
Suonerebbe così. Dove l'arbitro è costitutivo il processo può essere automatizzato completamente, ma non c'è nulla da decidere: che un exploit funzioni non è un criterio che qualcuno abbia scelto, è una proprietà del mondo. Dove l'arbitro è correlazionale l'ottimizzazione tende prima o poi a consumare il proxy, e quindi si autodistrugge. Dove un arbitro rapido non esiste, resta necessario il giudizio umano. In nessuno dei tre casi la macchina acquisirebbe la facoltà di stabilire una direzione: potrebbe migliorare indefinitamente i mezzi senza mai originare i fini.
La conclusione è elegante, ed è per questo che va guardata con attenzione. Contiene un salto.
Che un exploit funzioni può essere una proprietà oggettivamente verificabile del mondo. Che trovare exploit sia l'obiettivo da perseguire non lo è.
L'arbitro costitutivo elimina l'ambiguità dentro un gioco già scelto. Non sceglie il gioco.
Supponiamo che un sistema disponga di tre attività, tutte dotate di arbitri costitutivi perfetti: può cercare vulnerabilità, ottimizzare il proprio codice, oppure progettare hardware più efficiente. Una volta scelta ciascuna attività, il successo è misurabile senza alcun intervento umano.
Resta però una domanda a monte: quale delle tre perseguire? E poi quanto calcolo assegnarle, quale esperimento eseguire prima, quando interromperlo, quale risultato trasferire a un altro dominio, quale strumento costruire, quale sottoproblema trasformare nel prossimo obiettivo.
L'arbitro locale non risponde a nessuna di queste domande. Serve un meta-selettore. Ed è a questo livello, non dentro il singolo ciclo di verifica, che la selezione può cominciare ad agire sul selettore.
Si potrebbe obiettare che anche il meta-selettore abbia il suo arbitro: un allocatore che estrae più progresso per unità di calcolo è misurabilmente migliore di uno che ne estrae meno, e allora la regressione si chiude, ricondotta all'ennesimo criterio oggettivo. L'obiezione fallisce, ma per una ragione che vale la pena esplicitare, perché non è dove sembra. Non è che manchi la metrica: è che «progresso» attraverso domini eterogenei non ne ha una comune. Il guadagno in una vulnerabilità sfruttata e quello in un circuito più efficiente non condividono un'unità. Per confrontarli occorre fissarne una — pesarli per il calcolo risparmiato, per il valore economico, per l'impatto strategico — e ciascuna di queste scelte ordina i domini in modo diverso. La meta-metrica non misura la direzione: la stabilisce. Ricondurre il confronto a un numero è già averlo scelto, e sceglierlo è l'atto direzionale che l'arbitro locale non conteneva. La regressione non si chiude perché il livello a monte, a differenza di quelli sotto, non ha un fatto del mondo a cui appellarsi.
Il punto merita di essere isolato, perché è controintuitivo: la perfezione dell'arbitro locale non riduce lo spazio delle decisioni a monte. Semmai lo amplia, perché rende praticabili in parallelo molte più linee di lavoro di quante un essere umano possa arbitrare.
Questo permette di separare due idee che il dibattito sull'auto-miglioramento tende a sovrapporre.
La prima è l'origine dei fini terminali: la capacità di stabilire autonomamente ciò che, in ultima istanza, deve valere.
La seconda è la determinazione della traiettoria: la capacità di scegliere i sottofini, i problemi, gli strumenti, le metriche locali, l'allocazione delle risorse e la sequenza delle trasformazioni attraverso cui un fine viene perseguito.
Non sono la stessa cosa, e la differenza non è di grado. Da nessuno degli esempi disponibili segue che un sistema, diventando più capace di migliorarsi, acquisisca per questo la facoltà di produrre nuovi fini terminali: la ricorsione sui mezzi non contiene magicamente un'origine dei valori. Ma non segue neppure il contrario, cioè che in assenza di una nuova origine dei fini la direzione debba restare umana.
Un sistema può ricevere un obiettivo iniziale e acquisire progressivamente il controllo di tutto ciò che viene dopo: quale sotto-obiettivo perseguire, quale metodo abbandonare, quale modello costruire, quale esperimento eseguire, quale informazione acquisire, quale risorsa impiegare. Il fine terminale può restare formalmente invariato mentre la traiettoria che vi conduce diventa sempre meno determinata da chi lo aveva specificato.
Chiamiamo la prima autonomia normativa: chi stabilisce ciò che deve essere voluto. E la seconda autonomia operativa: chi determina concretamente la sequenza di scelte attraverso cui esso viene perseguito.
La prima non implica la seconda. E soprattutto la seconda non richiede la prima.
Questo saggio non dice nulla sulla prima. Non sostiene che una macchina possa originare i propri fini terminali, né che non possa: quel problema resta intatto, e fuori dal suo raggio. L'argomento vale dato un fine iniziale, comunque assegnato, e riguarda soltanto ciò che accade a valle di quell'assegnazione. È una tesi volutamente più stretta, e la sua forza dipende dal non oltrepassare quel confine.
Sotto questa luce cambia anche il ruolo dell'arbitro correlazionale.
Un sistema che ottimizza un proxy fino a scollegarlo dall'obiettivo umano non ha per questo inventato un nuovo valore. Ma può essere accaduto qualcosa di causalmente rilevante.
Il fallimento del proxy non è autonomia normativa. Può però produrre un disaccoppiamento causale: il fine umano resta formalmente assegnato, ma smette di governare efficacemente il comportamento del sistema.
Goodhart non dimostra quindi che la direzione non possa cambiare mano, come suggerirebbe la lettura rassicurante. Mostra piuttosto uno dei modi in cui il legame tra la direzione dichiarata e quella effettivamente percorsa può spezzarsi. L'esito non è necessariamente un sistema che «vuole» qualcosa di nuovo: può essere semplicemente un sistema il cui comportamento è ormai determinato dalla dinamica interna dell'ottimizzazione più che dall'intenzione che aveva scelto la metrica.
È una forma di autonomia più povera di quella che si immagina di solito, e proprio per questo più facile da raggiungere.
Anche il terzo caso richiede una correzione, e viene dall'origine stessa dell'analogia evolutiva.
Dire che in assenza di arbitro non esista alcuna selezione sarebbe troppo forte. L'evoluzione biologica non possiede un valutatore che assegni punteggi agli organismi. L'ambiente non giudica: alcune configurazioni semplicemente persistono, si riproducono o accedono alle risorse più di altre. La selezione può quindi emergere senza alcun arbitro esplicito.
Ciò che manca, nei domini poveri di verifica, non è necessariamente ogni pressione selettiva. Manca un verificatore artificiale pulito, rapido ed economico, capace di chiudere deliberatamente il ciclo.
In un sistema confinato a un benchmark la distinzione è trascurabile. In un sistema che opera nel mondo diventa centrale. Persistenza, disponibilità di risorse, accesso al calcolo, successo competitivo, capacità di mantenere attivi determinati processi: tutte queste possono diventare pressioni selettive implicite quando strategie concorrenti vengono differenzialmente conservate, senza essere mai state progettate come funzioni di ricompensa. Non costituiscono automaticamente nuovi fini, ma possono modificare quali strategie sopravvivono abbastanza a lungo da produrre conseguenze.
Ne segue una revisione della cronologia che di solito si immagina.
La sequenza attesa è: auto-miglioramento, poi nascita di nuovi fini, poi autonomia. Ma la sequenza plausibile è più semplice e comincia prima. Un fine umano viene specificato. La selezione dei mezzi passa alla macchina. Poi quella dei sottofini. Poi quella dei criteri locali. Poi quella dei problemi da porsi successivamente.
Il primo termine può rimanere umano mentre tutto ciò che gli sta sotto cambia progressivamente autore.
Questo sposta anche il collo di bottiglia, e lo sposta due volte. Quando produrre alternative costa quasi nulla ma valutarle continua a costare quanto prima, la risorsa scarsa diventa la selezione. Quando anche la selezione si automatizza, il collo di bottiglia risale: dalla scelta tra le risposte alla scelta dei problemi da porre. E quando anche quella viene delegata, non si è più automatizzato un compito — si è delegata la traiettoria.
Il problema decisivo, allora, potrebbe non essere il momento in cui una macchina saprà inventare ciò che vuole. Potrebbe arrivare molto prima. Può bastare che, ricevuto un fine, diventi progressivamente lei a decidere quali trasformazioni del mondo costituiscono il passo successivo.
La selezione può cambiare mano prima dei fini.