Tecnología

Nano Banana 2.1 y Gemini 3.8 TTS ya están en Kubeez

Nano Banana 2.1 y Gemini 3.8 Flash TTS ya están en Kubeez: 10 imágenes de referencia, proporciones 1:8 y 8:1 y diálogo a dos voces con 40 etiquetas.

· Kubeez

Nano Banana 2.1 y Gemini 3.8 TTS ya están en Kubeez

Nano Banana 2.1 y Gemini 3.8 Flash TTS ya están disponibles en Kubeez. El primero es un modelo de imágenes que admite hasta 10 imágenes de referencia y genera encuadres ultra anchos y ultra altos. El segundo es un modelo de texto a voz que interpreta una conversación entre dos personas en una sola petición, con un estilo de entrega para cada línea y 40 etiquetas en línea como <laugh> y <whispers>.

En este artículo verás qué hace cada modelo, dónde encaja dentro del catálogo de Kubeez y cómo probar ambos hoy mismo en el estudio, por MCP o con la API REST.

Las novedades de un vistazo

Nano Banana 2.1 Gemini 3.8 Flash TTS
Tipo Generación y edición de imágenes Texto a voz y diálogo
Novedad principal Hasta 10 imágenes de referencia 1 o 2 hablantes, un estilo por línea
También incluye Proporciones 1:4, 4:1, 1:8 y 8:1 40 etiquetas de entrega entre corchetes angulares, 70 voces
Límites Prompt de hasta 20.000 caracteres Hasta 5.000 caracteres, salida WAV
Dónde Estudio de imágenes, MCP, REST Estudio de audio Diálogo, MCP, REST

Nano Banana 2.1: el modelo de imágenes

Nano Banana 2.1 es un modelo nuevo de la familia Nano Banana, pensado tanto para generar como para editar. Es un modelo distinto de Nano Banana 2, con sus propios identificadores, nano-banana-2-1, nano-banana-2-1-2K y nano-banana-2-1-4K, así que tus flujos con Nano Banana 2 siguen funcionando igual.

En los rankings públicos de imágenes ocupa un sólido segundo puesto, por detrás de GPT Image 2.5 Sunburst, que sigue siendo nuestro modelo por defecto para la mayoría de las imágenes sueltas. Eso convierte a Nano Banana 2.1 en la siguiente opción que recomendamos, sobre todo cuando importa la relación calidad-precio.

Hasta 10 imágenes de referencia

Las imágenes de referencia son la forma de mantener un producto, un personaje o un estilo visual coherente de una generación a la siguiente. Nano Banana 2.1 acepta hasta 10 a la vez (JPEG, PNG o WebP, de hasta 30 MB cada una), dos más que Nano Banana 2.

Algunas formas de aprovechar ese margen:

Si produces contenido de marca por lotes, nuestra guía sobre cómo mantener una marca coherente en 30 generaciones combina muy bien con los huecos de referencia adicionales.

Proporciones extremas: 1:4, 4:1, 1:8 y 8:1

Nano Banana 2.1 suma cuatro proporciones extremas al conjunto habitual (1:1, 16:9, 9:16, 4:3, 3:4, 3:2, 2:3, 21:9, 5:4 y 4:5):

Banner ultra ancho 4:1 hecho con Nano Banana 2.1, con una larga repisa de roble llena de tazas y teteras de cerámica moteada hechas a mano

Un banner 4:1 generado con Nano Banana 2.1. La pared clara de la derecha deja espacio para un titular.

También es el modelo al que nuestro enrutamiento envía primero las publicaciones en vertical 4:5.

Cómo encaja con los demás modelos de imagen

Para comparativas anteriores de la familia, consulta Nano Banana 2 vs Pro vs Lite y GPT Image 2.5 vs Nano Banana 2.

Cómo usarlo

En el estudio de imágenes, elige Nano Banana 2.1 en la lista de modelos y define una resolución. Cada nivel (1K, 2K y 4K) tiene su propio precio, así que compáralos en directo en la página de modelos disponibles en lugar de suponerlos.

Por MCP o REST, llama al modelo por su identificador y pasa resolution, o llama directamente a los identificadores de 2K y 4K:

{
  "model": "nano-banana-2-1",
  "prompt": "Panoramic header banner, long oak shelf of hand-thrown ceramic cups, soft north-window light",
  "aspect_ratio": "4:1",
  "resolution": "2K"
}

Todas las imágenes de este artículo se hicieron con Nano Banana 2.1.

Gemini 3.8 Flash TTS: el modelo de voz

Gemini 3.8 Flash TTS (gemini-3-8-flash-tts) convierte texto en voz y está pensado para la conversación, no para lecturas aisladas. Donde las opciones anteriores de texto a voz te obligan a generar cada línea por separado y a unir después el audio, este recibe el intercambio completo de una vez.

Dos presentadores de pódcast en una mesa de nogal con micrófonos y auriculares, uno de ellos riendo en mitad de una frase, el tipo de intercambio natural que Gemini 3.8 Flash TTS está hecho para dar voz

Una petición, dos voces

Declara uno o dos hablantes y escribe una lista ordenada de líneas. Cada línea indica su hablante, su texto y, de forma opcional, un estilo de entrega de hasta 500 caracteres:

Speaker 1 (curious, upbeat podcast host): So you actually tried it for a week?
Speaker 2 (dry, amused): <laugh> Seven days. My kitchen has never been cleaner.

Un guion puede tener hasta 50 líneas. Si activas las muletillas, el modelo añade dudas naturales como «eh» y «mm» entre los dos hablantes, y eso es lo que hace que un diálogo suene a dos personas y no a dos lectores. Las muletillas solo funcionan en guiones de dos hablantes.

40 etiquetas de entrega

Las etiquetas en línea entre corchetes angulares te dejan colocar un momento justo donde ocurre: <laugh>, <sigh>, <whispers>, <short pause>, <long pause>, <gasp>, <chuckle>, <breath>, <cough>, <yawn> y 30 más.

Dos notas prácticas:

70 voces agrupadas por uso

Las 70 voces están agrupadas según el trabajo para el que encajan: Tutor, Locución comercial, Instructivo, Pódcast, Narrador de historias, Asistente digital, Centro de llamadas, Conserjería, Soporte técnico y Profesional. Pulsa cualquier nombre de la tabla para escuchar una muestra real de este modelo.

Uso Voces para probar
Pódcast Jori, Veda
Locución comercial Koda, Kore
Narrador de historias Enzo, Zali
Tutor Lumi, Bodi

La voz por defecto es Fola. Un nombre de voz que no esté en la lista se rechaza antes de gastar ningún crédito.

Idioma, longitud y formato

No hay un ajuste de idioma. El modelo lee el idioma a partir de tu texto, así que escribe cada línea en el idioma en que quieres oírla. Los guiones pueden llegar a 5.000 caracteres en total, etiquetas incluidas, y la salida es un archivo WAV mono de 24 kHz.

Si necesitas fijar una variante regional concreta, como el español de México frente al de España, o quieres indicaciones libres con corchetes cuadrados, Gemini 3.1 Flash encaja mejor. Nuestra comparativa de Gemini TTS explica en qué se diferencian las opciones.

Cómo usarlo

En el estudio, abre Audio, Diálogo, elige la pestaña Google y luego 3.8 Flash. Añade tus hablantes, escribe las líneas y usa el panel de etiquetas para insertar las indicaciones de entrega.

Desde un agente o un script, usa generate_dialogue con provider en gemini-3.8:

{
  "provider": "gemini-3.8",
  "speakers": [{ "voice": "Jori" }, { "voice": "Veda" }],
  "dialogue_turns": [
    { "speaker": "Speaker 1", "text": "So you actually tried it for a week?", "style": "curious, upbeat podcast host" },
    { "speaker": "Speaker 2", "text": "<laugh> Seven days. My kitchen has never been cleaner.", "style": "dry, amused" }
  ],
  "filler_words": true
}

La facturación es por cada 1.000 caracteres de texto, etiquetas incluidas, con un mínimo por generación. Consulta la tarifa actual en la página de modelos disponibles o en el estudio antes de lanzar un guion largo. Configura la conexión MCP en tus ajustes de MCP o consulta la página para desarrolladores y API para REST.

Usar los dos juntos

Los dos modelos cubren mitades distintas de un lanzamiento. Un episodio de pódcast, por ejemplo, necesita una portada y una conversación:

  1. Genera la portada con Nano Banana 2.1 en 4:5 para redes y en 1:1 para directorios, pasando el logotipo del programa y las fotos de los presentadores como referencias.
  2. Escribe la intro del episodio como un guion de dos hablantes, añade <short pause> y <laugh> donde los pondría un presentador de carne y hueso, y renderízalo en una sola petición de diálogo.
  3. Recorta un banner 4:1 a partir de las mismas referencias para la cabecera de la página del episodio.

Ambos funcionan con el mismo saldo de créditos, así que no tienes una segunda suscripción que gestionar.

Preguntas frecuentes

¿Qué es Nano Banana 2.1?

Nano Banana 2.1 es el modelo de imágenes más reciente de la familia Nano Banana en Kubeez. Genera y edita imágenes, admite hasta 10 imágenes de referencia y añade las proporciones 1:4, 4:1, 1:8 y 8:1.

¿Cuántas imágenes de referencia admite Nano Banana 2.1?

Hasta 10 por edición, en archivos JPEG, PNG o WebP de hasta 30 MB cada uno.

¿Uso Nano Banana 2.1 o GPT Image 2.5 Sunburst?

Sunburst es nuestra opción por defecto para la mayoría de las imágenes sueltas, sobre todo con tipografía y personas fotorrealistas. Elige Nano Banana 2.1 para retratos 4:5, proporciones extremas, ediciones con muchas referencias y lotes en los que importa el valor.

¿Cuántos hablantes admite Gemini 3.8 Flash TTS?

Uno o dos, en una sola petición. Para tres o más voces, genera las líneas por separado y une el audio.

¿Funcionan en Gemini 3.8 las etiquetas con corchetes cuadrados, como [laughs]?

No. Gemini 3.8 Flash TTS interpreta etiquetas entre corchetes angulares, como <laugh>. Las indicaciones con corchetes cuadrados son para Gemini 3.1 Flash.

¿Cuáles son los límites de longitud y el formato de salida?

Un guion admite hasta 5.000 caracteres en total, etiquetas incluidas, repartidos en un máximo de 50 líneas. La salida es WAV.

¿Puedo usar los dos modelos por API?

Sí. Los dos están disponibles en el estudio, por MCP y con la API REST. Para voz, llama a generate_dialogue con provider en gemini-3.8. Para imágenes, llama a generate_media con el identificador de modelo nano-banana-2-1.

See also