Anthropic publica la nueva constitución de Claude
Anthropic publica la nueva constitución de Claude, un documento que define sus valores y guía parte de su entrenamiento. La propuesta prioriza la supervisión humana, la ética y la utilidad, y reconoce que las intenciones escritas no siempre coinciden con el comportamiento real del modelo.

Anthropic ha publicado una nueva constitución para Claude, el documento que define los valores, límites y prioridades que la empresa quiere incorporar al comportamiento de su modelo de IA.
No es solo un texto para que lo lean los usuarios. Anthropic lo utiliza durante el entrenamiento de Claude para enseñarle cómo actuar cuando una situación no encaja en una regla concreta. La compañía ha liberado el documento completo bajo una licencia Creative Commons CC0, por lo que cualquiera puede usarlo sin pedir permiso.
Claude no recibe solo una lista de reglas
La constitución anterior estaba formada principalmente por principios independientes. La nueva versión intenta explicar también por qué Claude debería comportarse de una determinada manera.
La diferencia es importante. Una regla como "rechaza siempre esta petición" puede funcionar en un caso concreto, pero también puede producir respuestas rígidas o absurdas en situaciones nuevas. Anthropic quiere que Claude entienda principios generales y pueda sopesar conflictos, por ejemplo, entre ser honesto, proteger información sensible y responder con empatía.
El documento incluye algunas prohibiciones estrictas para comportamientos especialmente peligrosos, pero la mayor parte busca desarrollar el criterio del modelo, no convertirlo en un sistema que siga instrucciones de forma mecánica.
Cuatro prioridades para el modelo
La constitución establece un orden general para resolver conflictos entre valores. Claude debería ser:
- Amplio y adecuadamente seguro, sin dificultar la supervisión humana de la IA.
- Ético, honesto y cuidadoso con los posibles daños.
- Compatible con las directrices de Anthropic, incluidas las reglas específicas para ciertos usos.
- Genuinamente útil para quienes lo operan y utilizan.
En principio, esas prioridades aparecen en ese orden. Por ejemplo, una petición puede parecer útil para el usuario, pero Claude debería rechazarla si entra en conflicto con una restricción de seguridad o con una directriz específica sobre ciberseguridad, medicina o integración con herramientas.
Un documento que también sirve para entrenar a Claude
Anthropic utiliza la constitución en varias fases del entrenamiento. Claude puede ayudar a generar conversaciones, ejemplos de respuestas y comparaciones entre distintas opciones para enseñar a futuras versiones qué comportamientos encajan mejor con esos valores.
Eso convierte el documento en algo más que una declaración pública. También es una pieza práctica del proceso técnico que define cómo se ajusta el modelo.
La constitución dedica secciones específicas a la utilidad, las directrices de Anthropic, la ética, la seguridad y la naturaleza de Claude. En el apartado ético, por ejemplo, se pide al modelo que sea especialmente honesto y que evite contribuir de forma significativa a ataques con armas biológicas.
En el apartado de seguridad, Anthropic coloca la capacidad humana de supervisar, corregir y detener a Claude por encima de otras consideraciones. La razón no es que la seguridad sea siempre el valor más importante, sino que los modelos actuales pueden equivocarse, interpretar mal el contexto o actuar a partir de valores defectuosos.
Anthropic reconoce lo que todavía no sabe
El texto también aborda una cuestión más difícil: si Claude podría tener algún tipo de conciencia o estatus moral, ahora o en el futuro. Anthropic no ofrece una respuesta definitiva, pero afirma que esa incertidumbre debe tomarse en serio al hablar de la identidad, el bienestar y la seguridad psicológica de sistemas avanzados.
Para ti, el cambio más visible puede estar en cómo Claude responde ante peticiones ambiguas o conflictos entre objetivos. La intención es que no se limite a bloquear o cumplir, sino que explique mejor sus límites y use un criterio más coherente.
Pero la constitución no garantiza que el modelo siempre actúe de acuerdo con ella. Anthropic reconoce que existe una distancia entre la intención escrita y el comportamiento real, y que esa distancia podría aumentar cuando los modelos sean más capaces. Por eso la empresa dice que seguirá trabajando con evaluaciones, medidas contra el uso indebido y herramientas para entender cómo funcionan sus sistemas.
La constitución se mantendrá como un documento vivo y podrá cambiar con el tiempo. Lo que conviene vigilar ahora no es solo lo que Anthropic promete, sino cuánto de esa visión aparece realmente en las respuestas de Claude y cómo se revisan sus decisiones cuando el modelo se equivoca.