Tecnología
Nano Banana 2.1 y Gemini 3.8 TTS ya están en Kubeez
Nano Banana 2.1 y Gemini 3.8 Flash TTS ya están en Kubeez: 10 imágenes de referencia, proporciones 1:8 y 8:1 y diálogo a dos voces con 40 etiquetas.
· Kubeez
Nano Banana 2.1 y Gemini 3.8 Flash TTS ya están disponibles en Kubeez. El primero es un modelo de imágenes que admite hasta 10 imágenes de referencia y genera encuadres ultra anchos y ultra altos. El segundo es un modelo de texto a voz que interpreta una conversación entre dos personas en una sola petición, con un estilo de entrega para cada línea y 40 etiquetas en línea como <laugh> y <whispers>.
En este artículo verás qué hace cada modelo, dónde encaja dentro del catálogo de Kubeez y cómo probar ambos hoy mismo en el estudio, por MCP o con la API REST.
Las novedades de un vistazo
| Nano Banana 2.1 | Gemini 3.8 Flash TTS | |
|---|---|---|
| Tipo | Generación y edición de imágenes | Texto a voz y diálogo |
| Novedad principal | Hasta 10 imágenes de referencia | 1 o 2 hablantes, un estilo por línea |
| También incluye | Proporciones 1:4, 4:1, 1:8 y 8:1 | 40 etiquetas de entrega entre corchetes angulares, 70 voces |
| Límites | Prompt de hasta 20.000 caracteres | Hasta 5.000 caracteres, salida WAV |
| Dónde | Estudio de imágenes, MCP, REST | Estudio de audio Diálogo, MCP, REST |
Nano Banana 2.1: el modelo de imágenes
Nano Banana 2.1 es un modelo nuevo de la familia Nano Banana, pensado tanto para generar como para editar. Es un modelo distinto de Nano Banana 2, con sus propios identificadores, nano-banana-2-1, nano-banana-2-1-2K y nano-banana-2-1-4K, así que tus flujos con Nano Banana 2 siguen funcionando igual.
En los rankings públicos de imágenes ocupa un sólido segundo puesto, por detrás de GPT Image 2.5 Sunburst, que sigue siendo nuestro modelo por defecto para la mayoría de las imágenes sueltas. Eso convierte a Nano Banana 2.1 en la siguiente opción que recomendamos, sobre todo cuando importa la relación calidad-precio.
Hasta 10 imágenes de referencia
Las imágenes de referencia son la forma de mantener un producto, un personaje o un estilo visual coherente de una generación a la siguiente. Nano Banana 2.1 acepta hasta 10 a la vez (JPEG, PNG o WebP, de hasta 30 MB cada una), dos más que Nano Banana 2.
Algunas formas de aprovechar ese margen:
- Fotos de producto: pasa varios ángulos del mismo producto para que el modelo deje de inventarse las partes que no ve.
- Imagen de marca: añade un logotipo, una paleta de color y un par de imágenes de campañas anteriores en una sola edición.
- Sets de personajes: aporta un rostro desde distintos ángulos y coloca después al personaje en escenas nuevas.
Si produces contenido de marca por lotes, nuestra guía sobre cómo mantener una marca coherente en 30 generaciones combina muy bien con los huecos de referencia adicionales.
Proporciones extremas: 1:4, 4:1, 1:8 y 8:1
Nano Banana 2.1 suma cuatro proporciones extremas al conjunto habitual (1:1, 16:9, 9:16, 4:3, 3:4, 3:2, 2:3, 21:9, 5:4 y 4:5):
- 4:1 y 8:1 para banners de cabecera web, cabeceras de correo, tiras panorámicas y gráficos de línea de tiempo.
- 1:4 y 1:8 para paneles verticales largos, barras laterales y tiras de historia en vertical.

Un banner 4:1 generado con Nano Banana 2.1. La pared clara de la derecha deja espacio para un titular.
También es el modelo al que nuestro enrutamiento envía primero las publicaciones en vertical 4:5.
Cómo encaja con los demás modelos de imagen
- GPT Image 2.5 Sunburst sigue siendo la opción por defecto para imágenes con mucha tipografía, personas fotorrealistas y la mayoría del trabajo suelto.
- Nano Banana 2.1 es el segundo de la lista. Úsalo para 4:5, proporciones extremas, ediciones con muchas referencias y lotes en los que importa el valor.
- Nano Banana 2 Lite se mantiene como la opción de presupuesto y velocidad para borradores y grandes volúmenes.
Para comparativas anteriores de la familia, consulta Nano Banana 2 vs Pro vs Lite y GPT Image 2.5 vs Nano Banana 2.
Cómo usarlo
En el estudio de imágenes, elige Nano Banana 2.1 en la lista de modelos y define una resolución. Cada nivel (1K, 2K y 4K) tiene su propio precio, así que compáralos en directo en la página de modelos disponibles en lugar de suponerlos.
Por MCP o REST, llama al modelo por su identificador y pasa resolution, o llama directamente a los identificadores de 2K y 4K:
{
"model": "nano-banana-2-1",
"prompt": "Panoramic header banner, long oak shelf of hand-thrown ceramic cups, soft north-window light",
"aspect_ratio": "4:1",
"resolution": "2K"
}
Todas las imágenes de este artículo se hicieron con Nano Banana 2.1.
Gemini 3.8 Flash TTS: el modelo de voz
Gemini 3.8 Flash TTS (gemini-3-8-flash-tts) convierte texto en voz y está pensado para la conversación, no para lecturas aisladas. Donde las opciones anteriores de texto a voz te obligan a generar cada línea por separado y a unir después el audio, este recibe el intercambio completo de una vez.

Una petición, dos voces
Declara uno o dos hablantes y escribe una lista ordenada de líneas. Cada línea indica su hablante, su texto y, de forma opcional, un estilo de entrega de hasta 500 caracteres:
Speaker 1 (curious, upbeat podcast host): So you actually tried it for a week?
Speaker 2 (dry, amused): <laugh> Seven days. My kitchen has never been cleaner.
Un guion puede tener hasta 50 líneas. Si activas las muletillas, el modelo añade dudas naturales como «eh» y «mm» entre los dos hablantes, y eso es lo que hace que un diálogo suene a dos personas y no a dos lectores. Las muletillas solo funcionan en guiones de dos hablantes.
40 etiquetas de entrega
Las etiquetas en línea entre corchetes angulares te dejan colocar un momento justo donde ocurre: <laugh>, <sigh>, <whispers>, <short pause>, <long pause>, <gasp>, <chuckle>, <breath>, <cough>, <yawn> y 30 más.
Dos notas prácticas:
- Usa corchetes angulares. Las etiquetas con corchetes cuadrados no las interpreta este modelo (son de Gemini 3.1 Flash).
- Las etiquetas cuentan en el total de caracteres y en la factura, así que valen más unos pocos momentos bien elegidos que un muro de etiquetas.
70 voces agrupadas por uso
Las 70 voces están agrupadas según el trabajo para el que encajan: Tutor, Locución comercial, Instructivo, Pódcast, Narrador de historias, Asistente digital, Centro de llamadas, Conserjería, Soporte técnico y Profesional. Pulsa cualquier nombre de la tabla para escuchar una muestra real de este modelo.
| Uso | Voces para probar |
|---|---|
| Pódcast | Jori, Veda |
| Locución comercial | Koda, Kore |
| Narrador de historias | Enzo, Zali |
| Tutor | Lumi, Bodi |
La voz por defecto es Fola. Un nombre de voz que no esté en la lista se rechaza antes de gastar ningún crédito.
Idioma, longitud y formato
No hay un ajuste de idioma. El modelo lee el idioma a partir de tu texto, así que escribe cada línea en el idioma en que quieres oírla. Los guiones pueden llegar a 5.000 caracteres en total, etiquetas incluidas, y la salida es un archivo WAV mono de 24 kHz.
Si necesitas fijar una variante regional concreta, como el español de México frente al de España, o quieres indicaciones libres con corchetes cuadrados, Gemini 3.1 Flash encaja mejor. Nuestra comparativa de Gemini TTS explica en qué se diferencian las opciones.
Cómo usarlo
En el estudio, abre Audio, Diálogo, elige la pestaña Google y luego 3.8 Flash. Añade tus hablantes, escribe las líneas y usa el panel de etiquetas para insertar las indicaciones de entrega.
Desde un agente o un script, usa generate_dialogue con provider en gemini-3.8:
{
"provider": "gemini-3.8",
"speakers": [{ "voice": "Jori" }, { "voice": "Veda" }],
"dialogue_turns": [
{ "speaker": "Speaker 1", "text": "So you actually tried it for a week?", "style": "curious, upbeat podcast host" },
{ "speaker": "Speaker 2", "text": "<laugh> Seven days. My kitchen has never been cleaner.", "style": "dry, amused" }
],
"filler_words": true
}
La facturación es por cada 1.000 caracteres de texto, etiquetas incluidas, con un mínimo por generación. Consulta la tarifa actual en la página de modelos disponibles o en el estudio antes de lanzar un guion largo. Configura la conexión MCP en tus ajustes de MCP o consulta la página para desarrolladores y API para REST.
Usar los dos juntos
Los dos modelos cubren mitades distintas de un lanzamiento. Un episodio de pódcast, por ejemplo, necesita una portada y una conversación:
- Genera la portada con Nano Banana 2.1 en 4:5 para redes y en 1:1 para directorios, pasando el logotipo del programa y las fotos de los presentadores como referencias.
- Escribe la intro del episodio como un guion de dos hablantes, añade
<short pause>y<laugh>donde los pondría un presentador de carne y hueso, y renderízalo en una sola petición de diálogo. - Recorta un banner 4:1 a partir de las mismas referencias para la cabecera de la página del episodio.
Ambos funcionan con el mismo saldo de créditos, así que no tienes una segunda suscripción que gestionar.
Preguntas frecuentes
¿Qué es Nano Banana 2.1?
Nano Banana 2.1 es el modelo de imágenes más reciente de la familia Nano Banana en Kubeez. Genera y edita imágenes, admite hasta 10 imágenes de referencia y añade las proporciones 1:4, 4:1, 1:8 y 8:1.
¿Cuántas imágenes de referencia admite Nano Banana 2.1?
Hasta 10 por edición, en archivos JPEG, PNG o WebP de hasta 30 MB cada uno.
¿Uso Nano Banana 2.1 o GPT Image 2.5 Sunburst?
Sunburst es nuestra opción por defecto para la mayoría de las imágenes sueltas, sobre todo con tipografía y personas fotorrealistas. Elige Nano Banana 2.1 para retratos 4:5, proporciones extremas, ediciones con muchas referencias y lotes en los que importa el valor.
¿Cuántos hablantes admite Gemini 3.8 Flash TTS?
Uno o dos, en una sola petición. Para tres o más voces, genera las líneas por separado y une el audio.
¿Funcionan en Gemini 3.8 las etiquetas con corchetes cuadrados, como [laughs]?
No. Gemini 3.8 Flash TTS interpreta etiquetas entre corchetes angulares, como <laugh>. Las indicaciones con corchetes cuadrados son para Gemini 3.1 Flash.
¿Cuáles son los límites de longitud y el formato de salida?
Un guion admite hasta 5.000 caracteres en total, etiquetas incluidas, repartidos en un máximo de 50 líneas. La salida es WAV.
¿Puedo usar los dos modelos por API?
Sí. Los dos están disponibles en el estudio, por MCP y con la API REST. Para voz, llama a generate_dialogue con provider en gemini-3.8. Para imágenes, llama a generate_media con el identificador de modelo nano-banana-2-1.