OpenAI continúa su campaña de reconciliación con los ecosistemas de código abierto. Después del lanzamiento este verano de dos modelos LLM de peso abierto, que ya son muy populares, OpenAI anuncia una nueva familia de modelos abiertos dedicados a la seguridad de los modelos: gpt-oss-safeguard.
OpenAI, que desde su creación eligió una estructura dominada por una entidad no comercial para “ Garantizar que la inteligencia artificial beneficie a toda la humanidad. », confirmó esta semana que había finalizado una recapitalización que simplifica su gobernanza: el nuevo Fundación OpenAI ahora en control PBC del grupo OpenAIuna empresa impulsada por una misión (Corporación de Beneficio Público). La Fundación posee el 26% del capital de OpenAI Group. En la práctica, esto encierra legalmente la misión de interés público: una PBC debe perseguir su objeto de “beneficio colectivo” y considerar a las partes interesadas, mientras que la Fundación conserva los derechos de nombramiento/destitución de administradores y supervisa al comité “ Seguridad y protección ». La recapitalización también proporciona a la Fundación recursos filantrópicos sin precedentes (aproximadamente 130 mil millones de dólares en equivalente de acciones en el momento de su creación) y un compromiso inicial de 25 mil millones de dólares para la salud y la “resiliencia de la IA”.
Esta introducción explica en particular por qué, después de varios años de escasez, OpenAI volvió al código abierto y volvió al campo de los modelos “abiertos” en agosto pasado con dos modelos LLM que ya eran muy populares: gpt-oss-120b y gpt-oss-20b. Se trata de modelos de peso abierto con licencia Apache 2.0, 128 k de contexto, diseñados para agentes y anunciados cerca de o4-mini/o3-mini en numerosos puntos de referencia. ¡El editor ya no ofrecía LLM abiertos desde GPT-2!
Con una base con poderes ahora bien definidos y bien financiados, deberíamos esperar que OpenAI fortalezca sus esfuerzos en materia de IA abierta. En cualquier caso, podemos esperar que la Historia reequilibre la transparencia y la seguridad.
Así, la editorial ha desvelado esta semana dos nuevos modelos abiertos que complementan los lanzados el pasado mes de agosto. Los dos nuevos modelos gpt-oss-protección » (disponible en versiones de 120 mil millones de parámetros y 20 mil millones de parámetros), una variación de sus modelos de lenguaje diseñados para la clasificación de seguridad. Estos son modelos de peso abierto, disponibles bajo la licencia Apache 2.0, que los desarrolladores pueden usar, modificar, ajustar e implementar libremente. Ya se pueden descargar y utilizar en la plataforma.abrazando la cara.
Un modelo que apuesta por la seguridad
A diferencia de los clasificadores tradicionales, gpt-oss-safeguard no se basa en un gran corpus de ejemplos anotados sino en la capacidad del modelo para «razonar a partir de una política prevista para la inferencia».
Su principio es simple: en lugar de aplicar una política de moderación fija, estos modelos leen las restricciones de seguridad, las reglas de seguridad, proporcionadas por el desarrollador (según el famoso principio de trae tu propia póliza) y evaluar cada solicitud según estas instrucciones.
La decisión que toma el modelo también está motivada: expone su cadena de razonamiento, que puede consultarse para comprender por qué se autoriza, bloquea o redirige un contenido. Este enfoque es particularmente útil cuando los riesgos evolucionan rápidamente, los casos son sutiles o cuando no hay suficientes datos etiquetados para entrenar un clasificador tradicional.
Entre promesas y límites
Heredado de la herramienta interna de OpenAI “ Razonador de seguridad », Estos modelos están diseñados para encajar en una arquitectura de defensa en profundidad, junto con otras salvaguardas.
Las primeras pruebas muestran que gpt-oss-safeguard supera a los modelos generales para la clasificación de múltiples políticas, particularmente en áreas móviles como la detección de trampas en línea o el filtrado de reseñas falsas.
Pero OpenAI también reconoce sus límites: “ este modelo sigue siendo menos eficiente que los clasificadores entrenados en decenas de miles de ejemplos » y su coste computacional dificulta el despliegue masivo.
Por lo tanto, la empresa apuesta por la comunidad para perfeccionar el uso de estas herramientas, lanzando una Comunidad modelo ROOSTun espacio para compartir prácticas y experiencias.
Por qué son importantes estos modelos de “salvaguardia”
Estos modelos de “salvaguardia” son importantes porque restablecen la flexibilidad cuando las reglas cambian rápidamente. En lugar de recodificar un clasificador para cada nueva restricción, los desarrolladores de aplicaciones de IA pueden simplemente ajustar la política de seguridad. El mismo modelo se cumple de inmediato, país por país o sector por sector, lo que ayuda a cumplir con la AI Act o DSA.
También proporcionan transparencia: cada decisión está motivada por un razonamiento rastreable, útil para la auditoría y el cumplimiento.
Otro beneficio es la agrupación: un único “razonador” puede aplicar varias políticas sin multiplicar modelos especializados. Y como los pesos están abiertos, la integración local o de borde se facilita.
Sigue existiendo el clásico equilibrio entre calidad de la explicación y eficiencia operativa. En un ámbito muy estable y estrecho, un clasificador pequeño y sobreoptimizado a menudo seguirá siendo más rápido y menos costoso. Los modelos de “salvaguardia” brillan especialmente cuando el entorno está cambiando, los casos de uso tienen matices y la trazabilidad de las decisiones es esencial.
Estos nuevos modelos OpenAI compiten con el modelo NeMo Guardrails de Nvidia, el modelo Llama Guard de Meta o el modelo Mistral Moderation de Mistral.
Además, Hugging Face alberga varios modelos especializados en moderación de contenido (por ejemplo, Detoxify, clasificadores de discurso de odio, SafetyKit), que se pueden combinar con LLM abiertos para crear canales de tipo salvaguarda.
Al colocar una base sólida en el centro de su gobernanza y reabrir el juego del código abierto, OpenAI intenta conciliar dos imperativos a menudo antagónicos: acelerar la innovación y al mismo tiempo hacer que la seguridad sea más explicable, portátil y compatible. Los modelos de “salvaguardia” no son una panacea, pero abren un camino donde la seguridad se vuelve configurable, rastreable y basada en la comunidad. También es una forma de recordarnos que el futuro de la IA debería depender menos del tamaño de los modelos que del tamaño de las salvaguardias.
Lea también:
OpenAI y Microsoft llegan a un nuevo acuerdo importante
OpenAI adquiere Software Applications Inc y su herramienta Sky para integrar mejor ChatGPT con macOS
OpenAI lanza Atlas, su navegador web para competir con Chrome, Edge, Safari y Comet
AgentKit: OpenAI relanza la batalla de los SDK agentes
OpenAI acelera al exceso y su proyecto Stargate
OpenAI presenta dos nuevos modelos… Ninguno es GPT-5 pero están abiertos.
Los nuevos modelos “abiertos” de OpenAI llegan a Windows
[

