{"id":26942,"date":"2025-03-26T11:04:00","date_gmt":"2025-03-26T09:04:00","guid":{"rendered":"https:\/\/www.cssr.news\/spanish\/?p=26942"},"modified":"2025-03-26T11:04:00","modified_gmt":"2025-03-26T09:04:00","slug":"si-hasta-las-maquinas-pueden-mentir-2-2","status":"publish","type":"post","link":"https:\/\/www.cssr.news\/spanish\/2025\/03\/si-hasta-las-maquinas-pueden-mentir-2-2\/","title":{"rendered":"Si hasta las m\u00e1quinas pueden \u201cmentir\u201d (2\/2)"},"content":{"rendered":"\n<p><em>En el art\u00edculo anterior describimos el experimento en el que el modelo ling\u00fc\u00edstico Claude di Anthropic, habr\u00eda llevado a cabo un comportamiento de &#8220;disimulaci\u00f3n&#8221;.<\/em><\/p>\n\n\n\n<p>Lo que permiti\u00f3 realizar tal estrategia fue un \u201cbloc de notas\u201d dentro del modelo, es decir, un espacio en el que anotaba los distintos pasos de su razonamiento sin que estos se transmitieran en la respuesta final. A trav\u00e9s de este truco, fue posible verificar c\u00f3mo Claude, en un n\u00famero significativo de casos, fing\u00eda adaptarse al nuevo entrenamiento. Es decir, acept\u00f3, en algunos casos, producir la salida de contenido violento que se le hab\u00eda solicitado, para evitar que, con una posible negativa (seg\u00fan la programaci\u00f3n original), se encontrara con un refuerzo negativo, que por tanto habr\u00eda modificado sus par\u00e1metros. En cambio, siguiendo una especie de principio del mal menor, es decir, al dar la respuesta solicitada que era contraria a la pol\u00edtica inicial, el mecanismo de actualizaci\u00f3n de par\u00e1metros no habr\u00eda intervenido. En otras palabras: Claude \u201cfingi\u00f3\u201d seguir el nuevo entrenamiento, para mantener lo m\u00e1s intacta posible la configuraci\u00f3n inicial de sus par\u00e1metros.<\/p>\n\n\n\n<p>\u00c9ste no es el primer caso en el que un modelo ling\u00fc\u00edstico ha \u201cmentido\u201d. La propia Anthropic hab\u00eda comprobado, aproximadamente un a\u00f1o antes y utilizando una metodolog\u00eda similar a la que se utiliza ahora, que un modelo ling\u00fc\u00edstico suficientemente complejo se mostraba resistente a un nuevo intento de entrenamiento, adoptando de nuevo t\u00e9cnicas de \u201cenga\u00f1o\u201d. En este caso, sin embargo, se trataba de corregir algunas desviaciones introducidas intencionadamente en el c\u00f3digo a trav\u00e9s de puertas traseras. Pero no queremos da\u00f1ar a Anthropic con demasiada mala publicidad, ya que ChatGPT de OpenAI tambi\u00e9n hizo su parte, adoptando (aqu\u00ed nuevamente en un experimento, por lo tanto en un entorno controlado) comportamientos de uso de informaci\u00f3n privilegiada para ganar dinero, a pesar de haber sido instruidos de que esta era una pr\u00e1ctica ilegal, y por lo tanto prohibida.<\/p>\n\n\n\n<p>Volviendo a nuestro caso inicial, si bien es evidentemente excesivo atribuir una conciencia a Claude o a ChatGPT, todo esto a\u00fan plantea serias cuestiones de seguridad. Y esto tambi\u00e9n deber\u00eda hacer reflexionar a aquellos que creen de forma optimista que es posible crear una IA fantasma que sea inequ\u00edvocamente amigable con los humanos.<\/p>\n\n\n\n<p>En esencia, lo que demuestra el experimento es la robustez de Claude, una de las caracter\u00edsticas fundamentales de un buen algoritmo (en el sentido de ingenier\u00eda). En otras palabras, es importante subrayar que el modelo en este experimento espec\u00edfico no manifest\u00f3 sus propios objetivos ni cambi\u00f3 los que se hab\u00edan planteado al principio; Por el contrario, ha resistido un intento de recalibrar sustancialmente sus par\u00e1metros en una direcci\u00f3n contraria a la programaci\u00f3n inicial. Es un poco como el caso de un coche que circula a toda velocidad y que, en caso de impacto lateral, contin\u00faa avanzando en su direcci\u00f3n, quiz\u00e1 derrapando, pero sin desviarse ni volcar. Y esto es, sin duda, un aspecto positivo: el modelo no se desv\u00eda de sus (buenos) valores iniciales.<\/p>\n\n\n\n<p>Lo que llama la atenci\u00f3n es la complejidad de la estrategia implementada por Claude y resaltada por el \u201ccuaderno\u201d interno, fruto de la (inmensa) complejidad que han alcanzado estos modelos. Y aqu\u00ed est\u00e1 el verdadero problema. Aunque no es capaz de fijar sus propios objetivos (al menos por el momento), no se excluye que el modelo pueda a\u00fan manifestar comportamientos nocivos, que podr\u00edan derivar tambi\u00e9n de la interacci\u00f3n con nuevos datos en fases de entrenamiento posteriores. En este caso, dado un modelo suficientemente complejo, parece que no ser\u00eda posible reprogramarlo muy f\u00e1cilmente; De hecho, podr\u00eda incluso adoptar estrategias para \u201cfalsificar\u201d sus configuraciones, haciendo creer a la gente que han sido modificadas. Sin contar la dificultad (si no imposibilidad) de comprender c\u00f3mo estos valores fueron realmente \u201cincorporados\u201d a la inmensa red de par\u00e1metros del modelo.<\/p>\n\n\n\n<p>Reiteramos que no se trata de la presencia de alguna forma de conciencia en la IA, sino del resultado de una combinaci\u00f3n de mecanismos enormemente complejos que pueden volverse en contra de los propios dise\u00f1adores: un poco como el sistema de seguridad de una central nuclear que impide intervenir en caso de accidente, precisamente para evitar manipulaciones (que en ese caso ser\u00edan reparaciones).<\/p>\n\n\n\n<p>En conclusi\u00f3n, creemos que debemos acoger el \u00faltimo deseo de los investigadores antr\u00f3picos: es bueno profundizar estos estudios ahora, en una fase de desarrollo en la que los modelos de IA a\u00fan no plantean riesgos catastr\u00f3ficos para la humanidad, para comprender m\u00e1s profundamente su funcionamiento y crear productos m\u00e1s seguros, sin renunciar a las posibilidades positivas de esta tecnolog\u00eda tan poderosa.<\/p>\n\n\n\n<p><em>Se puede leer el original del art\u00edculo del profesor Andrea Pizzichini, en italiano, publicado en el Blog de la Academia Alfonsiana<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>En el art\u00edculo anterior describimos el experimento en el que el modelo ling\u00fc\u00edstico Claude di Anthropic, habr\u00eda llevado a cabo un comportamiento de &#8220;disimulaci\u00f3n&#8221;. Lo que permiti\u00f3 realizar tal estrategia fue un \u201cbloc de notas\u201d dentro del modelo, es decir, un espacio en el que anotaba los distintos pasos de su razonamiento sin que estos [&hellip;]<\/p>\n","protected":false},"author":3,"featured_media":26943,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":[],"categories":[28],"tags":[],"_links":{"self":[{"href":"https:\/\/www.cssr.news\/spanish\/wp-json\/wp\/v2\/posts\/26942"}],"collection":[{"href":"https:\/\/www.cssr.news\/spanish\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.cssr.news\/spanish\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.cssr.news\/spanish\/wp-json\/wp\/v2\/users\/3"}],"replies":[{"embeddable":true,"href":"https:\/\/www.cssr.news\/spanish\/wp-json\/wp\/v2\/comments?post=26942"}],"version-history":[{"count":1,"href":"https:\/\/www.cssr.news\/spanish\/wp-json\/wp\/v2\/posts\/26942\/revisions"}],"predecessor-version":[{"id":26944,"href":"https:\/\/www.cssr.news\/spanish\/wp-json\/wp\/v2\/posts\/26942\/revisions\/26944"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.cssr.news\/spanish\/wp-json\/wp\/v2\/media\/26943"}],"wp:attachment":[{"href":"https:\/\/www.cssr.news\/spanish\/wp-json\/wp\/v2\/media?parent=26942"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.cssr.news\/spanish\/wp-json\/wp\/v2\/categories?post=26942"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.cssr.news\/spanish\/wp-json\/wp\/v2\/tags?post=26942"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}