Oggi l’unico modo per identificare una molecola che non compare in nessuna libreria di riferimento è isolarla fisicamente e caratterizzarla in laboratorio. Settimane o mesi per composto, con costi proporzionali. È per questo che gli archivi di dati spettrali del mondo sono pieni di segnali mai identificati.
Il problema nasce da come funziona il metodo standard. Quando analizzi un estratto biologico — una pianta, un fungo, il plasma di un paziente — lo spettrometro di massa registra migliaia di segnali, e ognuno corrisponde a una molecola realmente presente in quel campione. Per dare un nome a ciascuna si confronta lo spettro misurato con librerie costruite analizzando composti già noti e purificati. Se la molecola è in libreria la trovi; altrimenti resta un picco anonimo. E nei campioni veri la gran parte lo è.
Da qualche giorno partecipo a una competizione che affronta esattamente questo. Non sono un biologo e di spettrometria di massa non so nulla: la gara è aperta a chiunque, e gli organizzatori scrivono esplicitamente che non serve una formazione in chimica per partecipare. Serve saper lavorare coi dati, e quello è il terreno su cui mi muovo — strumenti web per chi lavora davvero, e qualche esperimento scientifico documentato con le sue barre d’errore. È lì che ho imparato la cosa che poi è servita anche qui: un numero senza la sua incertezza non è un risultato.
La organizza Enveda, un’azienda farmaceutica americana che cerca molecole terapeutiche nei prodotti naturali, e si svolge su Kaggle, la piattaforma dove aziende e centri di ricerca mettono in palio premi per chi risolve meglio un problema di analisi dati. Il compito: ricevi gli spettri di circa quattrocento molecole e devi proporre, per ciascuna, fino a venticinque ipotesi sulla sua struttura chimica, ordinate dalla più probabile. Il punteggio va da 0 a 1 e premia quanto in alto nella lista finisce la risposta giusta — se è prima vale un punto pieno, se è seconda mezzo punto, se non c’è vale zero. Contano solo le strutture esatte: una sbavatura e il punteggio è zero.
Qui emerge il dato che spiega tutta la difficoltà. Gli organizzatori hanno costruito il test in modo che la ricerca in libreria, da sola, valga circa 0,15 su 1. Circa l’84% delle molecole del test è fuori dalla portata del metodo standard. Non è un artificio della gara: rispecchia quello che succede nei campioni reali.
Un sistema che ordina bene le strutture candidate cambia l’economia del problema: da «isola e caratterizza alla cieca» a «hai venticinque ipotesi ordinate, verifica la prima». Il lavoro di laboratorio non sparisce, ma diventa mirato.
A cosa serve
Le applicazioni immediate sono due. La scoperta di farmaci — Enveda non può testare molecole che non sa di avere, e se in un estratto ce ne sono duemila e ne riconosce duecento, le altre milleottocento sono invisibili. E i biomarcatori di malattia: quando si confrontano campioni di pazienti e controlli si trovano metaboliti che cambiano concentrazione in modo sistematico, e spesso restano picchi anonimi. Sai che qualcosa si muove, non sai cosa.
Su quest’ultimo punto conviene non promettere troppo. La ricerca sui biomarcatori metabolici esiste ed è attiva — nel tumore del pancreas sono state descritte combinazioni di metaboliti che superano il CA19-9, oggi l’unico marcatore approvato — ma la letteratura è netta sui limiti: manca standardizzazione e manca validazione su popolazioni ampie. E soprattutto, i biomarcatori trovati finora sono quasi tutti molecole già note. Identificare meglio le sconosciute non produce automaticamente diagnosi migliori: apre uno spazio di ricerca oggi chiuso, senza garanzia che lì dentro ci sia qualcosa di utile. Rimuovere un collo di bottiglia non è una terapia. È la condizione perché qualcuno possa cercarne una.
C’è poi una ragione per cui tutto questo è una gara pubblica e non un progetto interno: chi vince deve rilasciare il codice sotto licenza MIT, cioè liberamente riutilizzabile. Enveda mette cinquantamila dollari per far avanzare un metodo che resterà disponibile a chiunque, concorrenti diretti inclusi.
L’idea che funziona
L’idea su cui si regge la soluzione migliore è chimica, non informatica. Due molecole che condividono lo stesso scheletro e differiscono per un solo pezzo si spezzano negli stessi frammenti, traslati di una massa costante. Una molecola che non ha spettro di riferimento ha quasi sempre parenti strutturali che invece ce l’hanno, e la si può riconoscere attraverso di loro. Misurato su un insieme di controllo: ordinare le ipotesi a caso dà 0,138, ordinarle per differenza di massa — quello che fa la maggior parte degli approcci diffusi — dà 0,164, riconoscerle attraverso i parenti dà 0,521. Da uno a tre.
C’è anche una mossa controintuitiva. Dato che serve la struttura esatta, chiedere a un modello generativo di inventare la formula è la strada sbagliata: la probabilità di azzeccarla è minima. La soluzione è rovesciare il problema — non generare molecole nuove, ma mettere in ordine una lista di molecole che esistono già. Un problema di creazione impossibile diventa un problema di ordinamento affrontabile.
Questa riformulazione cambia la natura del problema: smette di essere una questione di chimica. Mettere in ordine una lista di candidati è lo stesso lavoro che fa un motore di ricerca quando decide quale risultato mostrarti per primo, o Netflix quando sceglie cosa proporti. Cambia l’argomento, non il tipo di problema.
Misurare prima di ottimizzare
Sono partito dal lavoro pubblico di un altro concorrente, prvsiyan, che ha condiviso il suo codice insieme a tutte le misure che lo giustificano, fallimenti inclusi. Tra i suoi avvertimenti ce n’era uno che mi ha fermato prima ancora di cominciare: aveva inviato due volte la stessa identica soluzione ottenendo due punteggi diversi, 0,292 e 0,298, perché una parte del sistema partiva da un numero casuale. La sua conclusione era che chi insegue una differenza di cinque millesimi, in questa gara, probabilmente sta inseguendo il caso.
Così, prima di toccare qualunque cosa, ho speso un’esecuzione intera a rifare esattamente la stessa identica cosa. Due ore di calcolo per non guadagnare nulla. Sono usciti 0,323 e 0,323: identici. Poi ho cambiato due cose, una alla volta, e sono arrivato a 0,328 e quindi a 0,329.
Qui conviene essere onesti, perché è facile raccontarsela. Quel secondo guadagno — un millesimo su quattrocento molecole — significa che una sola molecola si è spostata di qualche posizione. Non è un miglioramento, è un pareggio. Il primo ne vale due o tre. Sono numeri minuscoli. La differenza è che adesso so quanto sono minuscoli: senza quell’esecuzione apparentemente sprecata avrei potuto convincermi di aver trovato qualcosa e costruirci sopra. Sono passato dal 262° al 171° posto su 888 squadre, ma quel salto è quasi tutto affollamento — in quella fascia centinaia di concorrenti usano lo stesso punto di partenza pubblico, separati da pochi millesimi.
Con l’elenco di molecole candidate attuale, un sistema di ordinamento perfetto arriverebbe intorno a 0,43. È un tetto: sopra quel limite non basta ordinare meglio, bisogna aggiungere alla lista molecole che oggi non ci sono. Che poi è il problema di partenza in un’altra forma — non puoi identificare ciò che non hai mai considerato. La gara chiude a dicembre, e il lavoro vero comincia adesso.