0410

Guía práctica de ToshLLM

Imágenes y vídeo

Genera y mejora imágenes, crea vídeo local y gestiona modelos y memoria en GPU AMD.

Modos creativos

Tres formas de crear en el mismo Mac.

El selector superior alterna entre Chat, Imágenes y Vídeo. Cada espacio tiene su propio catálogo de modelos y motor. No necesitas cargar un modelo de lenguaje para generar imágenes o vídeos.

Crear imágenesGeneración de texto a imagen e imagen a imagen con el motor stable-diffusion.cpp incluido.
Escalar imágenesAmplía imágenes existentes con modelos ESRGAN a 2× o 4×.
Cola de tareasPrepara varios prompts y distribúyelos entre las instancias disponibles sin sobrecargar una GPU.
Crear vídeoGenera fotogramas a partir de texto o, si el modelo lo admite, de una imagen inicial.
Modelos de imagen

Deje que VRAM guíe la primera elección.

El catálogo incluye desde modelos compactos Stable Diffusion hasta variantes Z-Image, Flux y Qwen-Image. ToshLLM recomienda según la memoria disponible de la GPU elegida y descarga los componentes necesarios, incluidos los pesos de difusión, VAE y codificadores de texto.

Las licencias varían según el modelo. El catálogo señala los modelos grandes o restringidos; comprueba la licencia concreta antes de usarlos comercialmente o redistribuirlos.

En desarrollo: Qwen-Image 2.1 en cuatro tamaños.

El modelo 7B puede representar texto legible y editar hasta dieciséis imágenes de referencia. La variante Q3 comienza en la clase de 8 GB; Q4 y Q6 apuntan a tarjetas de 12 GB y Q8 apunta a 16 GB o más. Su codificador Qwen3-VL se ejecuta fuera de la tarjeta. En una GPU que controla la pantalla, la aplicación limita el borde largo a 1920 píxeles para mantener el escritorio receptivo. Esta adición se encuentra en la versión de desarrollo actual y es posible que aún no esté en la última descarga pública.

El tamaño de descarga y la VRAM residente son diferentes.

Un modelo puede contener varios componentes que se cargan en diferentes etapas. ToshLLM estima el componente que permanece residente durante el muestreo y tiene en cuenta el trabajo de los codificadores transitorios y VAE por separado.

Controles de imagen

Cambie una variable visual a la vez.

  • Aspecto y tamaño: Las dimensiones disponibles siguen la cuadrícula latente del modelo, los límites de calidad y la VRAM detectada.
  • Pasos: Los modelos destilados y Turbo esperan pocos pasos, mientras que otros modelos necesitan una ejecución de muestreo más larga.
  • CFG: Utilice la guía recomendada del modelo antes de experimentar.
  • Semilla: mantenga un valor fijo para comparar cambios de configuración o avisos; utilizar -1 para un nuevo resultado.
  • Imagen a imagen: una fuerza menor preserva más de la referencia y un valor más alto la reinventa.
  • Ediciones de referencia (compilación de desarrollo): Qwen-Image 2.1 acepta hasta dieciséis imágenes de referencia. Comience con un conjunto pequeño para que la edición solicitada quede clara.
  • Salida: PNG conserva la producción sin pérdidas; JPG es más pequeño para resultados fotográficos.

Una discrepancia entre la imagen de referencia y la relación de aspecto de salida puede recortar o distorsionar la composición. Haga coincidir ambas proporciones antes de juzgar el modelo.

GPU paralelas

Separe el trabajo sin competir por una tarjeta.

Puede agregar instancias de generación de imágenes con su propio modelo, GPU y configuración. La cola de avisos asigna trabajo solo a instancias inactivas y evita iniciar dos trabajos en cola en la misma GPU.

Una instancia también puede colocar el modelo de difusión principal en una GPU y los componentes de soporte en otra. La descarga de la CPU reduce la presión de la VRAM al mover componentes a través de la memoria del sistema, con un costo de velocidad.

Evite dos instancias activas en una GPU AMD.

La aplicación advierte sobre esta configuración porque cargas de trabajo pesadas y simultáneas de Metal pueden agotar la memoria o desestabilizar la tarjeta.

Ampliación

Compare la fuente y el resultado directamente.

La vista Upscale acepta lotes y los procesa uno a la vez. ToshLLM puede descargar el modelo ESRGAN seleccionado o utilizar un modelo personalizado compatible. Un modelo 4x produce una salida nativa 4x; la opción 2x ​​escala con el mismo modelo y vuelve a muestrear a la mitad.

Los resultados se almacenan junto a la fuente de forma predeterminada y la vista de comparación mantiene el original disponible para su inspección. La mejora agrega píxeles y detalles, pero no puede restaurar de manera confiable la información que falta en la fuente.

Generación de vídeo

Calcula la memoria antes de generar.

El catálogo de vídeos incluye modelos de texto a vídeo e imagen a vídeo. Seleccione un tamaño de fotograma, un recuento de fotogramas válido, pasos, semilla y GPU. La estimación de memoria tiene en cuenta la resolución, el número de fotogramas y el tamaño del modelo residente.

Si una ejecución se acerca al límite de memoria, reduzca primero el número de fotogramas y luego la resolución. El estudio mantiene los fotogramas generados como archivos PNG individuales y los previsualiza como una animación.

Texto a vídeoCrea la secuencia solo a partir del mensaje escrito.
Imagen a vídeoUtiliza la imagen seleccionada como primer fotograma cuando el modelo lo admite.
Vista previaReproduzca la secuencia de fotogramas o haga una pausa y borre fotogramas individuales.
ExportarUtiliza ffmpeg para codificar un MP4 H.264 que macOS puede reproducir directamente.

Los archivos de vídeo adjuntos y la exportación MP4 requieren ffmpeg y ffprobe. ToshLLM busca las herramientas incluidas y las rutas de instalación locales más comunes.

Para empresas y particulares

ToshLLM, adaptado a tu equipo.

¿Necesitas una implementación a medida, ayuda para elegir modelos o asesoría para varios Mac Intel? Cuéntanos qué estás desarrollando y te responderemos personalmente.

¿Encontraste un error reproducible? Un reporte público en GitHub permite seguir la solución. Reportar un error ↗
hello@toshllm.com

CONTACT / TOSHLLM

Tu mensaje llega directamente a ToshLLM. No incluyas contraseñas, claves de API ni registros privados.