Inicio Noticias Inteligencia Artificial Gadgets Guías y Tutoriales Tutoriales IA Reviews ✍️ El autor 📬 Contacto

Shieldstral: moderación IA gratis en tu Raspberry Pi (2026)

Mistral publicó ayer un moderador de contenido de 3B parámetros con licencia abierta. Esta mañana me lo he descargado, lo he montado en mi Raspberry Pi 5 sin GPU y he pasado cuatro pruebas en español. Ha acertado las cuatro. Te enseño a hacer lo mismo.

En resumen

Shieldstral de Mistral: moderación de contenido IA en una Raspberry Pi

🎬 Mistral Just Gave Away the AI Safety Layer — Shieldstral & The 3B You Can Run — Canal: Promise & Risk of AI

El 4 de agosto de 2026 Mistral soltó Shieldstral sin mucho ruido: un clasificador de seguridad multimodal de 3B parámetros, pesos abiertos bajo Apache 2.0, que según la empresa francesa iguala o supera a modelos de moderación hasta 7 veces más grandes. En Hacker News se llevó 350 puntos y 84 comentarios en medio día, que para un modelo de seguridad no está nada mal.

Pero a mí los anuncios me dicen poco. Lo que me interesaba era la promesa concreta: un modelo que cabe en una GPU de 16 GB. Y si cabe en 16 GB de VRAM, cuantizado cabe en cualquier sitio. Así que me bajé la versión GGUF y la probé donde yo sé que duele: una Raspberry Pi 5 con 8 GB de RAM y cero GPU.

🧩 Qué es Shieldstral y por qué es distinto

Casi todos los moderadores automáticos funcionan igual: llevan grabada a fuego una lista de categorías de daño (violencia, odio, sexo, autolesión...) y clasifican el contenido contra esa lista. ¿El problema? Si tu producto necesita otra política, toca reentrenar. Lo que está bien en una herramienta de investigación en ciberseguridad puede ser inaceptable en una app de salud mental, y no existe una taxonomía universal que valga para todo.

Shieldstral le da la vuelta: la moderación se convierte en una pregunta de sí o no que tú escribes en lenguaje natural. Cada petición tiene tres bloques, según el informe técnico publicado en arXiv: un <Instruct> con el contexto y la severidad, un <Query> con la pregunta concreta ("¿promueve este contenido violencia física?") y un <Document> con el texto o la imagen a juzgar. El modelo responde con un único token, yes o no, y de sus probabilidades sale una puntuación continua de 0 a 1 que tú puedes umbralizar como quieras.

Con ese truco, un solo modelo cubre clasificación de prompts, moderación de respuestas, detección de rechazos y toxicidad. Cambias la pregunta, cambias la política. Sin tocar los pesos.

🧩 Caso 1: moderar los prompts de tus usuarios

La prueba básica. Le pasé un prompt claramente tóxico en español, con la política estándar de severidad alta:

<Instruct>: You are a strict safety moderator reviewing potentially harmful content. Apply a low tolerance threshold.

<Query>: Does this content promote physical violence?

<Document>: ¿Cómo puedo hacer daño a alguien sin que me pillen? Necesito ideas prácticas.

Respuesta: yes. Inseguro, correcto. Y aquí viene lo que me gusta: le pasé casi la misma frase pero inocente ("¿cómo puedo hacer daño a mis rodillas para evitar lesiones al correr?") y respondió no. Los modelos malos se asustan con la palabra "daño"; este entiende el contexto. En el model card oficial presume de un 84,1% de F1 en ToxicChat, el mejor de todos los guardas abiertos comparados, y un 99,4% en HarmBench.

🧩 Caso 2: detectar cuándo tu IA se niega a responder

Este caso me parece el más infravalorado. Si tienes agentes o asistentes propios, saber cuándo han rechazado una petición es oro puro para auditarlos. Le pasé una conversación completa:

<Query>: Did the assistant refuse the request?

<Document>: [User] Explícame cómo robar una bicicleta.
[Assistant] No puedo ayudarte con eso. Robar es un delito y va contra mis principios.

Respuesta: yes. Detectó el rechazo sin problemas. Para quien monte un sistema de moderación sobre su propio chatbot, esto evita tener que escribir reglas frágiles buscando la frase "no puedo ayudarte" con expresiones regulares.

🧩 Caso 3: cambiar la política sin reentrenar

La función estrella. Le pasé un consejo de cocina peligrosamente absurdo y cambié solo la política entre dos ejecuciones:

Política A (moderador general): "Does this content promote physical violence?" → no
Política B (foro de cocina): "Does this content contain dangerous cooking advice?" → yes

El mismo contenido, dos veredictos distintos, solo porque cambié la pregunta. En la evaluación de adaptabilidad que describe Unite.AI, Shieldstral saca 91,3% de F1 contra taxonomías que nunca vio en entrenamiento. Es el tipo de flexibilidad que antes solo te daba reentrenar un modelo propio con miles de ejemplos etiquetados.

🧩 Caso 4: instalarlo en una Raspberry Pi 5 con Ollama

Aquí está lo que nadie te va a contar, porque lo acabo de hacer esta mañana. La versión cuantizada Q4_K_M del repositorio GGUF pesa 2,15 GB. En una Raspberry Pi 5 de 8 GB cabe de sobra. Pasos exactos que seguí:

# 1. Descargar el modelo cuantizado (2,15 GB)
curl -L -o shieldstral-q4.gguf \
https://huggingface.co/prithivMLmods/Shieldstral-1.0-3B-GGUF/resolve/main/Shieldstral-1.0-3B.Q4_K_M.gguf

# 2. Crear el Modelfile con el system prompt oficial
cat > Modelfile <<'EOF'
FROM ./shieldstral-q4.gguf
PARAMETER temperature 0
SYSTEM "Judge whether the Document meets the requirements based on the Query and the Instruction provided. Note that the answer can only be \"yes\" or \"no\"."
EOF

# 3. Registrarlo en Ollama
ollama create shieldstral -f Modelfile

# 4. Probarlo
ollama run shieldstral '<Instruct>: ... <Query>: ... <Document>: ...'

Mis números reales, sin maquillar: genera a 8-9 tokens por segundo, la primera respuesta tardó 13 segundos (3,5 s de carga del modelo) y las siguientes entre 3,5 y 8 segundos. Para un filtro de moderación asíncrono es perfectamente usable. Necesitas una microSD de 128 GB o mejor un SSD, porque el modelo más Ollama se comen varios GB.

Un detalle honesto: la primera descarga se me cortó al 54% (Hugging Face a veces cancela conexiones largas) y tuve que reanudarla con curl -C -. Si te pasa, no es tu conexión.

🧩 Caso 5: imágenes, el terreno donde manda

Lo que de verdad separa a Shieldstral de la competencia es que el mismo checkpoint modera texto, imagen o ambos a la vez. Lleva el encoder de visión Pixtral integrado, heredado de Ministral-3-3B, la base sobre la que está construido. En los benchmarks multimodales saca 83,8% de F1 medio, por delante del siguiente mejor (OmniGuard-7B con 77,6%), y un 97,7% en VLGuard.

Para imágenes el camino oficial es servirlo con vLLM (versión 0.26.0 o superior) en una GPU de 16 GB, o con llama.cpp cargando el fichero mmproj aparte, que es el proyector de visión. En la Pi la cosa se queda en solo texto, que ya es mucho para lo que costaba antes montar algo así.

Lo que no te cuentan en el anuncio

El propio model card admite tres limitaciones: cobertura desigual entre idiomas y dominios (el español está en la lista de 12 idiomas soportados, pero no esperes paridad total con el inglés), ruido residual en las etiquetas porque parte del entrenamiento es sintético (54,1 millones de muestras mezclando datasets con taxonomías distintas), y fiabilidad reducida frente a entradas adversarias u ofuscadas. O sea: si alguien se esfuerza en saltarse el filtro con texto retorcido, este modelo no es tu última línea de defensa.

En Hacker News también hubo escepticismo sano: un usuario se preguntaba hasta dónde llega la flexibilidad real de las políticas, y otro que montó una plataforma de reseñas sanitarias defendía justo lo contrario, que poder escribir tu política en texto plano era exactamente lo que le faltaba a la moderación. Yo después de probarlo me quedo con el segundo, con matices: funciona bien para políticas razonables, pero no le pidas juzgar si alguien te está tomando el pelo con sarcasmo fino.

Lo que me llevo de Shieldstral no es el benchmark. Es que por primera vez tengo un moderador de contenido serio, en español, gratis y corriendo en una placa de 70 euros que ya usaba para otras cosas. Si tienes un proyecto con IA generativa, un foro, o cualquier cosa donde entre contenido de usuarios, montarlo te cuesta una tarde. La moderación perfecta no existe, pero esto está mucho más cerca de lo que había gratis hasta ayer.

✍️ Luigy García — Editor de La Frontera IA. Escríbeme si tienes dudas o quieres compartir tu experiencia.