
Generación de imágenes con IA: 6 modelos de 500 a 15.000 créditos
By Isaac · Writer, DubVoice.ai
En resumen: 6 modelos de imagen sobre un mismo saldo, de 500 a 15.000 créditos. Empieza en Nano Banana 2 Lite para dar con el prompt y remata en Nano Banana Pro (el único con escalado a 4K) o GPT Image 2 (el mejor con texto).
Todos de un vistazo
| Modelo | Créditos | Relaciones de aspecto | Referencias |
|---|---|---|---|
| Nano Banana 2 Lite | **500** | 1:1 · 9:16 · 16:9 · 3:4 · 4:3 | 4 |
| Nano Banana 2 | 1.000 | 1:1 · 9:16 · 16:9 · 3:4 · 4:3 | 4 |
| Grok Image | 1.000 | 1:1 · 9:16 · 16:9 · 2:3 · 3:2 | 4 |
| Meta AI | 1.500 | 1:1 · 9:16 · 16:9 | componentes con nombre |
| Nano Banana Pro | 3.500 | 1:1 · 9:16 · 16:9 · 3:4 · 4:3 | 4 |
| GPT Image 2 | 15.000 | **las 7** | 5 |
El precio es plano por imagen. Los fallos se reembolsan automáticamente.
Nano Banana 2 Lite — 500 créditos
La imagen más barata de la plataforma y la más rápida (15–30 s). Úsala para iterar: cinco intentos aquí cuestan lo mismo que un render de GPT Image 2, y luego repites el ganador en un modelo mejor.
Nano Banana 2 — 1.000 créditos
La opción general por defecto. Salida nativa de ~1K (1376×768), 30–60 s, cuatro imágenes de referencia. Si no tienes claro qué usar, usa esta.
Grok Image — 1.000 créditos
El modelo de xAI, al mismo precio que Nano Banana 2 pero con 2:3 y 3:2 nativas, las dos relaciones que la familia Nano Banana no dibuja. Adjunta una referencia y pasa solo a modo imagen a imagen.
Meta AI — 1.500 créditos
Meta trata las referencias de forma distinta: en lugar de una lista plana, pasas componentes con nombre — character_image, scene_image, style_image — cada uno ligado a un papel concreto en la composición. Es mucho más controlable que "aquí tienes cuatro fotos, suerte". Solo cuadrado, vertical y horizontal.
Nano Banana Pro — 3.500 créditos
La opción de calidad de la familia Nano Banana y el único modelo con escalado a 4K (resolution: "4K"). Más lento, 60–90 s, y más fiel a prompts largos y detallados. Rebajado hace poco desde 5.000 créditos.
GPT Image 2 — 15.000 créditos
La opción premium y a la que acudir cuando la imagen contiene texto: rótulos, packaging, maquetas de interfaz, carteles. Es además el único modelo que acepta las siete relaciones de aspecto.
La salida está limitada a unos 1,57 MP y sigue la relación de aspecto; no hay nivel 2K/4K ni escalado, así que para 4K elige Nano Banana Pro.
Cuatro controles son exclusivos suyos:
quality—low/medium/high(high por defecto). Cambia el resultado, no el precio.prompt_mode—autodeja que el modelo reescriba tu prompt para mejorar el resultado;directlo usa literal. Usadirectcuando ya has afinado la redacción.reasoning— denoneamax. Cuanto más alto, mejor sigue prompts complejos, pero tarda más.web_search— hace una búsqueda web antes de generar; útil si haces referencia a algo real y actual.
Rebajado hace poco de una matriz de 4.500–80.000 a un precio plano de 15.000.
¿Cuál elegir?
- ¿Iterando un prompt? Nano Banana 2 Lite por 500.
- ¿Sin preferencia clara? Nano Banana 2.
- ¿Necesitas 2:3 o 3:2? Grok Image.
- ¿Controlar personaje, escena y estilo por separado? Meta AI.
- ¿Necesitas 4K? Nano Banana Pro: ningún otro escala.
- ¿La imagen lleva texto legible? GPT Image 2.
El flujo de lo barato primero
La diferencia de treinta veces entre el modelo más barato y el más caro de aquí no es una clasificación, es un flujo de trabajo.
Un prompt casi nunca funciona a la primera. La composición falla, el sujeto mira hacia donde no toca, el ambiente no es el que imaginabas. Descubrirlo en un modelo de 15.000 créditos cuesta treinta veces más que descubrirlo en uno de 500, y aprendes exactamente lo mismo.
Así que itera en Nano Banana 2 Lite. Lanza cinco variaciones, decide qué tiene que ser realmente la imagen y luego genera la ganadora una vez en el modelo que le convenga. Cinco borradores más un render premium cuestan menos que dos renders premium, y el resultado es mejor porque ya sabías qué pedías cuando lo pediste.
Las imágenes de referencia hacen más que transferir estilo
Todos los modelos de aquí menos Meta aceptan una lista plana de referencias, y el error habitual es tratarlas como un dial de estilo. Se parecen más a una especificación.
Dale el producto y conserva su forma y su etiqueta reales en lugar de inventarse unas verosímiles. Dale una cara y mantiene a la misma persona en todo el conjunto. Dale una habitación y la siguiente imagen es esa habitación desde otro ángulo. Esto es lo que hace posible un conjunto coherente, y el texto del prompt por sí solo no puede conseguirlo.
Meta es la excepción que conviene conocer: vincula las referencias a papeles con nombre — personaje, escena, estilo — en lugar de a una lista. Cuesta más montarlo y es mucho más controlable cuando recombinas un reparto fijo sobre fondos cambiantes.
La proporción la elige el modelo más de lo que crees
No todos los modelos generan todas las proporciones, y pedir una que un modelo no hace acaba sustituida, no generada.
La familia nano cubre las proporciones del día a día pero no las panorámicas de cine. Grok es al que acudir cuando necesitas 2:3, 3:2 o ultrapanorámico. Meta solo da el cuadrado y los dos panorámicos estándar. GPT Image 2 cubre el conjunto más amplio.
Decide la proporción antes que el modelo, no después: es la restricción que elimina la mayor parte de la lista.
Para el equivalente de esta decisión en imagen en movimiento, mira [la comparativa de modelos de vídeo con IA](/blog/ai-video-generation-veo3-grok-sora2-seedance-complete-guide).
Cómo empezar
Los 6 modelos están en el [panel de imágenes](/dashboard/image) y en la [API pública](/dashboard/api-docs), sobre un mismo saldo y sin suscripción por modelo. Un flujo práctico: borradores en Lite, y el ganador se vuelve a renderizar en Pro o GPT Image 2.
Try DubVoice.ai Today
17,800+ AI voices, 6 video models, 6 image models, AI music, translation & more — all in one platform. Nothing auto-renews.