Automatización de generación de prompts para SDXL con OpenClaw y Qwen3.5-9B

De la idea a la imagen: un flujo automatizado con IA

En invierno pasado, al ver una serie de imágenes generadas por IA que representaban castillos de hielo, tuve la idea de transformar descripciones textuales en obras visuales automáticamente. Tras varias semanas de pruebas, logré construir un sistema completo: utilizar OpenClaw para orquestar Qwen3.5-9B en la generación de prompts compatibles con SDXL, y luego integrarlo con Stable Diffusion vía API. El resultado fue como tener un asistente artístico digital siempre disponible.

Lo más valioso de esta solución es su naturaleza end-to-end. No necesito copiar y pegar entre herramientas; solo escribo en el chat de Feishu: "Dibuja un telescopio steampunk con engranajes y fondo estelar", y en minutos obtengo la imagen final en una carpeta específica. Esta experiencia fluida es precisamente lo que OpenClaw destaca como marco de automatización.

Configuración del entorno y componentes clave

Componentes esenciales

Mi infraestructura se basa en tres elementos cnetrales:

  • OpenClaw v1.2.3: encargado de gestionar flujos y tareas automáticas
  • Modelo Qwen3.5-9B (ejecutado localmente en GPU)
  • Servicio Stable Diffusion API (implementado en Automatic1111 WebUI)

Un detalle importante: el uso de Qwen3.5-9B requiere suficiente memoria VRAM. En mi RTX 3090 (24 GB), cargarlo con cuantificación 4-bit consume unos 18 GB. Si hay limitaciones, se puede optar por la versión más pequeña Qwen3.5-1.8B, aunque con ligera reducción en calidad de salida.

Configuración inicial de OpenClaw

La instalación es extremadamente sencilla, todo en un comando:

curl -fsSL https://openclaw.ai/install.sh | bash

Durante la configuración, selecciono el modo "Advanced" y especifico la URL del modelo local:

{
  "models": {
    "providers": {
      "local-qwen": {
        "baseUrl": "http://192.168.1.100:8000/v1",
        "apiKey": "null",
        "api": "openai-completions"
      }
    }
  }
}

Advertencia: si el servidor de Stable Diffusion no está en la misma máquina que OpenClaw, asegúrate de activar los flags --api y --listen al iniciar el servicio.

Automatización de ingeniería de prompts

Del lenguaje natural al prompt estructurado

Al principio intenté que Qwen generara directamente prompts listos para SDXL, pero el modelo tendía a añadir detalles innecesarios. Implementé un patrón claro que mejoró significativamente los resultados:

Eres un generador especializado de prompts para arte AI. Genera un prompt en inglés para Stable Diffusion XL siguiendo este formato:
1. Descripción principal
2. Detalles del entorno
3. Estilo artístico
4. Calidad visual
Todos separados por comas.

Entrada: Robot en un jardín clásico chino
Salida: A robotic figure with ceramic texture sitting in a traditional Chinese pavilion, (intricate gears:1.1), surrounded by lotus ponds and stone arrangements, ink wash painting style, ultra-detailed, 4k


Este patrón se implementa como una habilidad predefinida en OpenClaw. Cuando envío "generar prompt: árbol de cerezo en una ciudad futurista" desde Feishu, ocurre lo siguiente:

  1. OpenClaw detecta el mensaje
  2. Inserta el texto del usuario en el template
  3. Llama a Qwen3.5-9B para generar el prompt estructurado
  4. Almacena temporalmente el resultado en el entorno de trabajo

Técnicas de control de calidad

Tras cientos de pruebas, he identificado estrategias efectivas:

  • Parámetro de temperatura: mantener temperature=0.7 equilibra creatividad y consistencia
  • Procesamiento posterior: usar expresiones regulares para eliminar comentarios o instrucciones adicionales
  • Biblioteca de negativos: predefinir frases comunes como "blurry, distorted fingers, extra limbs"

El hallazgo más útil fue pedir a Qwen que genere 3 variaciones por prompt y luego elegir la mejor manualmente. Esto elevó la tasa de prompts útiles del 40% al 85%.

Integración profunda con Stable Diffusion

Diseño del flujo de llamadas API

OpenClaw interactúa con Stable Diffusion mediante REST API. Los parámetros clave son:

{
  "prompt": "{generated_prompt}",
  "negative_prompt": "text, watermark, lowres",
  "width": 1024,
  "height": 1024,
  "steps": 30,
  "sampler": "DPM++ 2M Karras"
}

Desarrollé un script Python que maneja esta secuencia. Función principal:

def generate_image(prompt):
    response = requests.post(
        "http://sd-server:7860/sdapi/v1/txt2img",
        json={
            "prompt": prompt,
            "cfg_scale": 7,
            "seed": -1
        }
    )
    return response.json()["images"][0]

Este script se empaqueta como un módulo de OpenClaw (clawhub install sd-integration) y se integra directamente en el flujo.

Sistema automático de archivado

Cada imagen generada se guarda bajo una estructura organizada:

~/AI_Artworks/
   ├── 2024-07/
   │   ├── landscape/
   │   ├── portrait/
   │   └── abstract/
   └── metadata.csv

El archivo metadata.csv registra el prompt original, parámetros usados y fecha. Este historial es fundamental para ajustes posteriores. La implementación requirió solo 20 líneas de código, aprovechando las funciones de manipulación de archivos de OpenClaw.

Errores comunes y soluciones optimizadas

Problemas con entradas en chino

Inicialmente, cuando introducía texto en chino, Qwen generaba prompts mixtos (inglés-chino), lo que afectaba la interpretación de SDXL. Solución: forzar salida en inglés y añadir traducción automática si el texto contiene caracteres no latinos:

if contains_chinese(user_input):
    user_input = translate_to_english(user_input)

Optimización de prompts largos

Cuando el prompt excede los 200 tokens, la calidad disminuye. Al analizar logs, descubrí que Qwen repetía ciertos adjetivos. Ahora, tras la generación, aplico un proceso de deduplicación y reducción para mantener el tamaño entre 80 y 150 tokens.

Garantía de estabilidad

El mayor desafío fue mantener el flujo funcional sin interrupciones. Implementé estas medidas:

  1. Límites de tiempo para cada paso
  2. Mecanismos de reintento en fallos críticos
  3. Verificación de resultados (por ejemplo, tamaño de imagen)
  4. Guardado de estado intermedio en caso de error

Nuevas posibilidadse en flujos creativos

Este sistema transformó mi forma de crear. Ahora puedo:

  • Generar series temáticas (como "estaciones del año") con solo describir cuatro escenarios
  • Construir una biblioteca personal de prompts exitosos
  • Realizar pruebas AB comparando estilos artísticos distintos

Lo más sorprendente fue el modo "inspiración aleatoria": solicitar a Qwen que genere 10 ideas nuevas, y automáticamente producir una vista previa de cada una. En una sola hora generé más de 200 conceptos, de los cuales tres evolucionaron a proyectos completos de ilustración.

Explora más modelos IA

¿Quieres experimentar con otros modelos preconfigurados? Visita el CSDN Star Image Hub, donde encontrarás múltiples imágenes de IA listas para desplegar, cubriendo inferencia de modelos grandes, generación de imágenes, videos y fine-tuning, todo con una sola acción.

Etiquetas: OpenClaw Qwen3.5-9B Stable Diffusion XL AI art generation prompt engineering

Publicado el 8-20 05:21