La memoria manda, la velocidad la marca el bus
Dos números deciden casi todo al ejecutar modelos en casa. La memoria de vídeo dice qué modelos caben. El ancho de banda dice a qué velocidad salen las palabras. Los teraflops, que es lo que se anuncia en la caja, apenas intervienen.
Generar texto obliga a leer los pesos enteros del modelo por cada palabra que sale. Por eso una tarjeta antigua con bus ancho puede escribir más rápido que una moderna con bus estrecho, y por eso la columna que hay que mirar no es la que uno espera.
Qué modelo quieres mover
Ajusta el tamaño y mira abajo qué tarjetas lo aguantan.
0
GB de memoria de vídeo necesarios
| Tarjeta | Memoria | Ancho de banda (GB/s) | Consumo | Precio orientativo | ¿Cabe? | Techo tokens/s |
|---|
Pulsa cualquier cabecera para reordenar. Los precios son de referencia a septiembre de 2026 y envejecen rápido; para la segunda mano, mira el mercado real.
De dónde salen estos números
Memoria necesaria
Pesos del modelo, más la memoria del contexto, más unos 0,8 GB que se lleva el sistema. Los pesos salen de multiplicar los parámetros por los bytes que ocupa cada uno según la cuantización: 0,61 en Q4_K_M, 2 sin cuantizar.
Techo de velocidad
Ancho de banda dividido entre el peso del modelo, con un rendimiento del 65%. Es el límite físico: ninguna tarjeta puede escribir más rápido de lo que lee. Lo que verás en la práctica siempre queda por debajo.
Por qué «justo» no es «entra»
Cuando el modelo ocupa casi toda la memoria, el contexto crece durante la conversación y acaba desbordando. El sistema reparte entonces con el procesador y la velocidad se desploma. Deja siempre un dedo de margen.
Lo que no aparece aquí
Nada de AMD ni de Apple, y no por descuido: la pregunta era por NVIDIA. Pero un equipo Apple con memoria unificada abre tamaños que ninguna tarjeta de consumo alcanza, a cambio de ir bastante más lento.