0810

Guía práctica de ToshLLM

Guía de benchmarks

Interpreta las medidas de procesamiento y generación, compara configuraciones y comparte resultados firmados desde la app.

Dos medidas

Procesamiento y generación miden cosas distintas.

Procesamiento del promptLa velocidad con que el motor lee el contexto proporcionado. Se expresa en tokens por segundo.
Generación de tokensLa velocidad con que el modelo produce tokens nuevos después de procesar el prompt. Se expresa en tokens por segundo.

Repartir el modelo entre varias GPU puede acelerar el procesamiento sin mejorar la generación, o incluso ralentizarla. Interpreta ambas cifras por separado.

Carga comparable

El servidor define la prueba común.

Cuando decides compartir un benchmark, la app solicita a ToshLLM un desafío temporal. La respuesta establece el ejecutor, número de tokens de prompt y de generación, repeticiones y versión del consentimiento. La carga comparable actual usa llama-bench; cada repetición se inicia por separado para conservar todas las mediciones.

El resultado publicado conserva cada medición de procesamiento y generación y muestra la mediana. También registra las huellas de los archivos del modelo y del motor, el hardware, el sistema operativo y los ajustes efectivos del motor.

Detén primero el servidor del modelo.

El servidor y el benchmark comparten VRAM. Si siguen activos a la vez, el resultado puede alterarse o la prueba puede fallar.

Envío firmado

Primero revisa; después firma.

  1. Elige Share benchmark en la aplicación ToshLLM.
  2. Lee el resumen de consentimiento y ejecuta la carga definida por el servidor.
  3. Revisa el modelo, hardware, configuración, medidas y pruebas depuradas.
  4. Firma y envía exactamente los datos mostrados en la revisión.

La clave privada P-256 permanece en el llavero de este Mac. La huella pública agrupa envíos de la misma instalación y permite a la API comprobar que los datos no cambiaron después de la revisión.

Cómo leer el índice

Compara configuraciones equivalentes.

El índice público agrupa pruebas por GPU y modelo para que los envíos repetidos mejoren la comparación en lugar de crear muchas páginas casi iguales. La cuantización, familia del modelo, motor, número de GPU, contexto y opciones de ejecución permanecen visibles porque pueden cambiar mucho el rendimiento.

Abre el índice de benchmarks de la comunidad para consultar resultados actuales y las pruebas que respaldan cada resumen.

Confianza y moderación

La firma acredita el origen, no el rendimiento.

La firma acredita que una instalación registrada de ToshLLM firmó exactamente los datos aceptados por la API. Después, las comprobaciones automáticas comparan el envío con referencias de hardware, modelo y carga compatibles.

Benchmark verificadoResultado reproducido o verificado explícitamente mediante el proceso de revisión de ToshLLM.
Aporte comunitarioResultado firmado por la app que superó la validación, sin afirmar reproducción independiente.
Aprobación automáticaLas medidas se ajustan al rango esperado y las pruebas requeridas están completas.
Revisión manualUn valor inusual queda pendiente para que un administrador revise las pruebas antes de publicarlo.
Variación normal

Una prueba es una observación, no una ley.

La temperatura, actividad de la GPU en segundo plano, presión de memoria y efectos de la primera carga pueden alterar un resultado. El protocolo conserva las repeticiones independientes y muestra su mediana para reducir el impacto de una medición atípica.

Consulta las páginas agrupadas para ver el rango entre colaboradores. Un conjunto de resultados próximos aporta más evidencia que un único récord.

Para empresas y particulares

ToshLLM, adaptado a tu equipo.

¿Necesitas una implementación a medida, ayuda para elegir modelos o asesoría para varios Mac Intel? Cuéntanos qué estás desarrollando y te responderemos personalmente.

¿Encontraste un error reproducible? Un reporte público en GitHub permite seguir la solución. Reportar un error ↗
hello@toshllm.com

CONTACT / TOSHLLM

Tu mensaje llega directamente a ToshLLM. No incluyas contraseñas, claves de API ni registros privados.