{"id":1553,"date":"2026-04-11T11:13:16","date_gmt":"2026-04-11T11:13:16","guid":{"rendered":"https:\/\/www.metapa.it\/?p=1553"},"modified":"2026-04-11T11:14:19","modified_gmt":"2026-04-11T11:14:19","slug":"la-geometria-del-rifiuto-nei-modelli-di-intelligenza-artificiale-come-orientare-le-decisioni-degli-llm","status":"publish","type":"post","link":"https:\/\/www.metapa.it\/?p=1553","title":{"rendered":"La geometria del rifiuto nei modelli di Intelligenza Artificiale: come orientare le decisioni degli LLM"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\"><strong>Il nuovo studio del CERT-AgID illustra come il meccanismo di diniego utilizzato dai modelli dell&#8217;IA possa essere compreso e modificato intervenendo sulle sue rappresentazioni interne.<\/strong><br><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">\u00c8 online il&nbsp;<a href=\"https:\/\/www.agid.gov.it\/sites\/agid\/files\/2026-03\/La%20geometria%20del%20rifiuto%20nei%20modelli%20linguistici.pdf\" target=\"_blank\" rel=\"noreferrer noopener\">nuovo studio del CERT-AgID<\/a>&nbsp;che analizza i meccanismi con cui i sistemi di Intelligenza Artificiale decidono di rifiutare le richieste degli utenti, un comportamento noto come&nbsp;<em>refusal<\/em>.\u200b<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">L\u2019analisi dimostra che questo meccanismo di difesa non \u00e8 solo una rigida regola astratta appresa dal sistema, ma assume una vera e propria &#8220;forma geometrica&#8221; all&#8217;interno del modello, e come tale pu\u00f2 essere studiata, tracciata e modificata, con l&#8217;obiettivo di ridurre i rifiuti su prompt malevoli mantenendo stabilit\u00e0 su quelli benigni.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Come funziona la &#8220;mappa interna&#8221; dell&#8217;IA e la tecnica dello steering<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Quando un utente inserisce una richiesta, il modello linguistico non elabora semplici parole, ma le trasforma in coordinate matematiche, posizionandole su una sorta di mappa interna chiamata &#8220;spazio latente&#8221;. Lo studio del CERT-AgID evidenzia che su questa mappa le richieste tendono a raggrupparsi in zone distinte: le richieste \u201cinnocue\u201d si concentrano in una regione, mentre quelle considerate pericolose o non consentite si raggruppano in un&#8217;area diversa.\u200b<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Poich\u00e9, qualora esistesse una separazione tra queste due zone, sarebbe possibile tracciare una direzione per attraversare questo confine. Utilizzando una tecnica chiamata&nbsp;<em>activation steering<\/em>, infatti, si pu\u00f2 intervenire delicatamente durante l&#8217;elaborazione del testo per &#8220;spostare&#8221; la traiettoria del modello. In questo modo, l&#8217;IA viene guidata verso la zona sicura, riducendo i rifiuti senza per\u00f2 degradare la qualit\u00e0 della lingua o alterare le risposte alle domande normali.\u200b<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">La ricerca della rotta ottimale e i risultati<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Per capire quale fosse il modo migliore per orientare il modello, lo studio ha messo a confronto diversi metodi matematici per calcolare questa rotta. Sono stati testati approcci semplici, che si limitano a calcolare la differenza tra le zone, e approcci molto pi\u00f9 complessi (come le&nbsp;<em>Recursive Feature Machines<\/em>), capaci di adattarsi alla forma esatta del confine.\u200b<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">I test, condotti sul modello aperto Mistral-7B, hanno rivelato un aspetto molto interessante: la separazione tra ci\u00f2 che \u00e8 innocuo e ci\u00f2 che fa scattare il blocco \u00e8 in realt\u00e0 molto lineare. Di conseguenza, le soluzioni pi\u00f9 semplici si sono rivelate altrettanto efficaci di quelle pi\u00f9 complesse, permettendo di orientare il comportamento del sistema in modo stabile ed evitando che l&#8217;IA perda coerenza o generi testi frammentari.\u200b<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Le implicazioni per la Pubblica Amministrazione<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">La ricerca suggerisce che il comportamento dell&#8217;Intelligenza Artificiale pu\u00f2 essere studiato e corretto direttamente alla radice, rendendo i sistemi molto pi\u00f9 trasparenti e verificabili.\u200b<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Questo aspetto assume una rilevanza cruciale per la Pubblica Amministrazione. L\u2019utilizzo di modelli&nbsp;<em>open-weight<\/em>&nbsp;(ovvero modelli aperti e installabili sui propri server) permette alle istituzioni di analizzare i meccanismi decisionali dell&#8217;IA e di applicare queste tecniche di controllo in totale autonomia. Questa architettura garantisce la possibilit\u00e0 di effettuare verifiche tecniche indipendenti e, soprattutto, di proteggere i dati dei cittadini, poich\u00e9 permette di gestire l&#8217;intero processo senza dover trasferire informazioni sensibili verso servizi esterni o proprietari.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Il nuovo studio del CERT-AgID illustra come il meccanismo di diniego utilizzato dai modelli dell&#8217;IA possa essere compreso e modificato intervenendo sulle sue rappresentazioni interne. \u00c8 online il&nbsp;nuovo studio del CERT-AgID&nbsp;che analizza i meccanismi con cui i sistemi di Intelligenza Artificiale decidono di rifiutare le richieste degli utenti, un comportamento noto come&nbsp;refusal.\u200b L\u2019analisi dimostra che &hellip;<\/p>\n","protected":false},"author":2,"featured_media":1506,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":"","jetpack_publicize_message":"","jetpack_publicize_feature_enabled":true,"jetpack_social_post_already_shared":false,"jetpack_social_options":{"image_generator_settings":{"template":"highway","default_image_id":0,"font":"","enabled":false},"version":2}},"categories":[16,20,1,2,25,19,21],"tags":[104,37,39,28],"class_list":["post-1553","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-tie-foods","category-tie-tech","category-uncategorized","category-tie-world","category-digitale","category-tie-business","category-tie-life-style","tag-agid","tag-innovazione","tag-intelligenza-artificiale","tag-pubblica-amministrazione"],"jetpack_publicize_connections":[],"_links":{"self":[{"href":"https:\/\/www.metapa.it\/index.php?rest_route=\/wp\/v2\/posts\/1553","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.metapa.it\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.metapa.it\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.metapa.it\/index.php?rest_route=\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"https:\/\/www.metapa.it\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=1553"}],"version-history":[{"count":1,"href":"https:\/\/www.metapa.it\/index.php?rest_route=\/wp\/v2\/posts\/1553\/revisions"}],"predecessor-version":[{"id":1554,"href":"https:\/\/www.metapa.it\/index.php?rest_route=\/wp\/v2\/posts\/1553\/revisions\/1554"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.metapa.it\/index.php?rest_route=\/wp\/v2\/media\/1506"}],"wp:attachment":[{"href":"https:\/\/www.metapa.it\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=1553"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.metapa.it\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=1553"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.metapa.it\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=1553"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}