Web Development·10 min read

WebGPU para IA en el navegador: cómo ejecutar LLMs de 7B sin backend

Guía técnica sobre ejecutar modelos pequeños directamente en el navegador con WebGPU, eliminando la necesidad de servidores de inferencia.

Sara Köhler
··2,200 vistas

Hace dos años, ejecutar un modelo de lenguaje en el navegador parecía ciencia ficción. Los modelos eran demasiado grandes, la GPU del navegador demasiado limitada, y el ecosistema de herramientas inexistente. Pero 2026 ha traído una convergencia que está cambiando esta realidad: WebGPU ha alcanzado madurez, los modelos cuantizados de 7B son viables, y librerías como web-llm han democratizado el acceso.

El resultado: puedes ejecutar un LLM de 7B parámetros completamente en el navegador, sin backend, sin costes de servidor, con latencia cero y privacidad total.

Qué es WebGPU y por qué importa

WebGPU es la API moderna para acceso a GPU en el navegador, diseñada como sucesora de WebGL. Mientras WebGL fue diseñado para gráficos 3D, WebGPU es una API de propósito general que expone la capacidad de computación de la GPU para cualquier tarea, incluyendo inferencia de redes neuronales.

Las ventajas sobre WebGL son significativas:

Computación general: WebGL puede hacer computación, pero es un hack sobre una API diseñada para gráficos. WebGPU está diseñado desde cero para compute shaders, con un modelo de memoria más flexible y mejor alineado con las necesidades de ML.

Mejor rendimiento: WebGPU reduce el overhead de la CPU y permite un uso más eficiente de la GPU. En benchmarks de inferencia, WebGPU es 2-3x más rápido que WebGL en el mismo hardware.

Soporte amplio: Chrome, Edge, Firefox y Safari ya soportan WebGPU en versiones estables. Ya no es una tecnología experimental.

El estado de los modelos cuantizados

El otro pilar de esta revolución es la cuantización. Un modelo de 7B parámetros en FP16 requiere 14GB de VRAM, lo que lo hace inviable para la mayoría de GPUs de consumo. Pero con cuantización a 4-bit, el mismo modelo requiere solo 3.5GB, perfectamente manejable en GPUs integradas de laptops modernas.

La cuantización no es gratis: introduce pérdida de precisión que puede afectar la calidad del output. Pero las técnicas de cuantización de 2026 —GPTQ, AWQ, y sus variantes— han reducido esta pérdida a niveles imperceptibles para la mayoría de casos de uso. Un Llama-2-7B cuantizado a 4-bit produce outputs casi indistinguibles de la versión FP16 para tareas como chat, resumen y generación de texto.

web-llm: la librería que lo hace posible

web-llm es el proyecto que ha unificado todas estas piezas. Desarrollado por el equipo de ML Kit, proporciona una API simple para cargar y ejecutar modelos cuantizados en el navegador usando WebGPU.

El flujo básico es este:

import { CreateMLCEngine } from "@mlc-ai/web-llm";

const engine = await CreateMLCEngine();
await engine.reload("Llama-2-7b-chat-q4f16");
const response = await engine.chat.completions.create({
  messages: [{ role: "user", content: "Hola, ¿quién eres?" }],
});

Tres líneas de código, y tienes un LLM corriendo en el navegador. web-llm se encarga de descargar el modelo, cargarlo en la GPU, y ejecutar la inferencia. Todo es transparente para el desarrollador.

Casos de uso reales

¿Para qué sirve ejecutar un LLM en el navegador? Los equipos pioneros han encontrado varios casos compelling:

Asistentes de código offline: VS Code ahora tiene una extensión que usa web-llm para proporcionar autocompletado de código completamente offline. Tu código nunca sale de tu máquina, y no hay costes de API.

Chatbots con privacidad total: Para aplicaciones que manejan datos sensibles —médicos, financieros, legales— ejecutar el modelo localmente elimina preocupaciones sobre donde se procesan los datos. El usuario tiene control total.

Aplicaciones educativas: Plataformas de aprendizaje pueden incluir tutores de IA sin preocuparse por el coste de API a escala. Cada estudiante ejecuta su propio modelo en su navegador.

Prototipado rápido: Antes de integrar con una API de IA, puedes prototipar completamente en el navegador. El feedback loop es instantáneo, y no hay costes de desarrollo.

Limitaciones y consideraciones

WebGPU + LLMs en el navegador no es la solución para todo. Hay limitaciones importantes:

Tamaño de modelo: 7B es el límite práctico actual. Modelos más grandes requieren más VRAM de la que tienen la mayoría de GPUs integradas. Si necesitas GPT-4 level capabilities, el navegador no es suficiente.

Hardware dependiente: El rendimiento varía dramáticamente según la GPU. En una MacBook Pro con M2, un Llama-2-7b genera 15-20 tokens/segundo. En una laptop Intel con GPU integrada, puede ser 3-5 tokens/segundo.

Cold start: La primera vez que un usuario carga tu aplicación, el modelo debe descargarse (2-3GB para un 7B cuantizado). Esto puede tardar 30-60 segundos dependiendo de la conexión. web-llm cachea el modelo en IndexedDB, así que las cargas subsiguientes son instantáneas.

Soporte móvil: WebGPU en móviles es aún limitado. iOS Safari soporta WebGPU desde iOS 18, pero el rendimiento en GPUs móviles es significativamente menor que en desktop.

El futuro local

La dirección es clara: los modelos seguirán haciéndose más eficientes, las GPUs más potentes, y las librerías más maduras. Es razonable esperar que para 2027, modelos de 13B sean viables en el navegador, y que el cold start se reduzca a segundos con técnicas de streaming de modelos.

Pero más importante que la tecnología es el cambio de mentalidad que representa. Durante años, asumimos que la IA requería servidores masivos en la nube. WebGPU + LLMs demuestran que la IA puede ser local, privada y gratuita.

No es que la IA en la nube vaya a desaparecer. Para modelos grandes, para entrenamiento, para casos de uso empresarial, la nube seguirá siendo dominante. Pero para un conjunto creciente de casos de uso, el navegador es suficiente. Y eso cambia fundamentalmente el economics de la IA.

Ya no necesitas un presupuesto mensual de API para integrar IA en tu aplicación. Ya no necesitas preocuparte por la privacidad de los datos de tus usuarios. Ya no necesitas depender de un proveedor externo.

La IA se está democratizando, y WebGPU es una de las tecnologías que está haciendo posible esta democratización.

Compartir

Sara Köhler

Análisis de Producto

// Relacionados

WebGPU para IA en el navegador: cómo ejecutar LLMs de 7B sin backend — SYNTHNODE