Tehnologie

Nano Banana 2.1 și Gemini 3.8 TTS, acum pe Kubeez

Nano Banana 2.1 și Gemini 3.8 Flash TTS sunt live pe Kubeez: 10 imagini de referință, rapoarte 1:8 și 8:1, dialog cu două voci și 40 de taguri de rostire.

· Kubeez

Nano Banana 2.1 și Gemini 3.8 TTS, acum pe Kubeez

Nano Banana 2.1 și Gemini 3.8 Flash TTS sunt acum disponibile pe Kubeez. Primul este un model de imagini care acceptă până la 10 imagini de referință și generează cadre ultra-late sau ultra-înalte. Al doilea este un model text to speech care dă glas unei conversații între două persoane dintr-o singură cerere, cu un stil de rostire pentru fiecare replică și 40 de taguri inline precum <laugh> și <whispers>.

În articol vezi ce face fiecare model, unde se potrivește în gama Kubeez și cum le încerci chiar azi în studio, prin MCP sau prin API-ul REST.

Pe scurt, ce este nou

Nano Banana 2.1 Gemini 3.8 Flash TTS
Tip Generare și editare de imagini Text to speech și dialog
Noutatea principală Până la 10 imagini de referință 1 sau 2 vorbitori, un stil pe replică
Mai include Rapoartele 1:4, 4:1, 1:8 și 8:1 40 de taguri de rostire în paranteze unghiulare, 70 de voci
Limite Prompt de până la 20.000 de caractere Până la 5.000 de caractere, ieșire WAV
Unde îl găsești Studioul de imagini, MCP, REST Studioul audio Dialog, MCP, REST

Nano Banana 2.1: modelul de imagini

Nano Banana 2.1 este un model nou din familia Nano Banana, creat atât pentru generare, cât și pentru editare. Este un model separat de Nano Banana 2, cu propriile ID-uri, nano-banana-2-1, nano-banana-2-1-2K și nano-banana-2-1-4K, așa că fluxurile tale cu Nano Banana 2 merg mai departe neschimbate.

În clasamentele publice de imagini ocupă un loc doi solid, în spatele lui GPT Image 2.5 Sunburst, care rămâne modelul nostru implicit pentru majoritatea imaginilor de sine stătătoare. Asta face din Nano Banana 2.1 următoarea alegere pe care o recomandăm, mai ales când contează raportul calitate-preț.

Până la 10 imagini de referință

Imaginile de referință sunt felul în care păstrezi un produs, un personaj sau un stil vizual consecvent de la o generare la alta. Nano Banana 2.1 acceptă până la 10 deodată (JPEG, PNG sau WebP, maximum 30 MB fiecare), cu două mai multe decât Nano Banana 2.

Câteva moduri de a folosi spațiul în plus:

Dacă lucrezi cu conținut de brand în loturi, ghidul nostru despre cum păstrezi un brand consecvent pe parcursul a 30 de generări se potrivește bine cu cele zece locuri de referință.

Rapoarte extreme: 1:4, 4:1, 1:8 și 8:1

Nano Banana 2.1 adaugă patru rapoarte extreme peste setul obișnuit (1:1, 16:9, 9:16, 4:3, 3:4, 3:2, 2:3, 21:9, 5:4 și 4:5):

Banner ultra-lat 4:1 realizat cu Nano Banana 2.1, cu un raft lung din stejar pe care stau căni și ceainice ceramice pistruiate, lucrate manual

Un banner 4:1 generat cu Nano Banana 2.1. Peretele deschis din dreapta lasă loc pentru un titlu.

Este și modelul către care își trimite rutarea noastră postările portret 4:5.

Cum se așază lângă celelalte modele de imagini

Pentru comparații mai vechi din familie, vezi Nano Banana 2 vs Pro vs Lite și GPT Image 2.5 vs Nano Banana 2.

Cum îl folosești

În studioul de imagini, alege Nano Banana 2.1 din lista de modele și setează o rezoluție. Fiecare nivel (1K, 2K și 4K) are prețul lui, așa că compară-le live pe pagina modele disponibile, fără să ghicești.

Prin MCP sau REST, apelezi modelul după ID și trimiți resolution, sau apelezi direct ID-urile pentru 2K și 4K:

{
  "model": "nano-banana-2-1",
  "prompt": "Panoramic header banner, long oak shelf of hand-thrown ceramic cups, soft north-window light",
  "aspect_ratio": "4:1",
  "resolution": "2K"
}

Toate imaginile din acest articol au fost făcute cu Nano Banana 2.1.

Gemini 3.8 Flash TTS: modelul de voce

Gemini 3.8 Flash TTS (gemini-3-8-flash-tts) transformă textul în vorbire și este gândit pentru conversație, nu pentru citiri izolate. Unde variantele mai vechi de text to speech te obligă să generezi fiecare replică separat și să lipești apoi audio-ul, acesta primește tot schimbul de replici deodată.

Doi prezentatori de podcast la o masă din nuc, cu microfoane și căști, unul dintre ei râzând în mijlocul unei fraze, genul de schimb firesc pe care Gemini 3.8 Flash TTS este construit să îl redea

O singură cerere, două voci

Declari unul sau doi vorbitori, apoi scrii o listă ordonată de replici. Fiecare replică are vorbitorul ei, textul și, opțional, un stil de rostire de până la 500 de caractere:

Speaker 1 (curious, upbeat podcast host): So you actually tried it for a week?
Speaker 2 (dry, amused): <laugh> Seven days. My kitchen has never been cleaner.

Un script poate avea până la 50 de replici. Dacă activezi cuvintele de umplutură, modelul adaugă ezitări naturale, de tip „hm” și „ăă”, între cei doi vorbitori, iar asta face un dialog să sune a doi oameni, nu a doi cititori. Cuvintele de umplutură funcționează doar la scripturile cu doi vorbitori.

40 de taguri de rostire

Tagurile inline din paranteze unghiulare îți permit să plasezi un moment exact unde se petrece: <laugh>, <sigh>, <whispers>, <short pause>, <long pause>, <gasp>, <chuckle>, <breath>, <cough>, <yawn> și încă 30.

Două observații practice:

70 de voci grupate pe utilizări

Cele 70 de voci sunt grupate după rolul pentru care se potrivesc: Tutor, Reclame și voiceover, Instrucțiuni, Podcast, Povestitor, Asistent digital, Call center, Concierge, Suport tehnic și Profesional. Apasă pe orice nume de mai jos ca să asculți un eșantion real de la acest model.

Utilizare Voci de încercat
Podcast Jori, Veda
Reclame și voiceover Koda, Kore
Povestitor Enzo, Zali
Tutor Lumi, Bodi

Vocea implicită este Fola. Un nume de voce care nu se află în listă este respins înainte să se consume vreun credit.

Limbă, lungime și format

Nu există o setare de limbă. Modelul citește limba din textul tău, așa că scrie fiecare replică în limba în care vrei să o auzi. Scripturile pot ajunge la 5.000 de caractere în total, tagurile incluse, iar ieșirea este un fișier WAV mono de 24 kHz.

Dacă trebuie să fixezi o variantă regională exactă, de pildă spaniola din Mexic față de cea din Europa, sau vrei indicații libere cu paranteze drepte, Gemini 3.1 Flash se potrivește mai bine. Comparația noastră pentru Gemini TTS arată cum diferă variantele.

Cum îl folosești

În studio, deschide Audio, Dialog, alege fila Google, apoi 3.8 Flash. Adaugă vorbitorii, scrie replicile și folosește panoul de taguri ca să introduci indicațiile de rostire.

Dintr-un agent sau dintr-un script, folosește generate_dialogue cu provider setat pe gemini-3.8:

{
  "provider": "gemini-3.8",
  "speakers": [{ "voice": "Jori" }, { "voice": "Veda" }],
  "dialogue_turns": [
    { "speaker": "Speaker 1", "text": "So you actually tried it for a week?", "style": "curious, upbeat podcast host" },
    { "speaker": "Speaker 2", "text": "<laugh> Seven days. My kitchen has never been cleaner.", "style": "dry, amused" }
  ],
  "filler_words": true
}

Facturarea se face la 1.000 de caractere de text, tagurile incluse, cu un minim per generare. Verifică tariful actual pe pagina modele disponibile sau în studio înainte de un script lung. Conectarea MCP o configurezi din setările MCP, iar pentru REST vezi pagina pentru dezvoltatori și API.

Cele două modele împreună

Cele două modele acoperă jumătăți diferite ale unei lansări. Un episod de podcast, de exemplu, are nevoie de o copertă și de o conversație:

  1. Generează coperta cu Nano Banana 2.1, la 4:5 pentru social media și 1:1 pentru directoare, trimițând logoul emisiunii și fotografiile gazdelor ca referințe.
  2. Scrie introducerea episodului ca script cu doi vorbitori, adaugă <short pause> și <laugh> acolo unde le-ar pune o gazdă umană și redă totul într-o singură cerere de dialog.
  3. Taie un banner 4:1 din aceleași referințe pentru antetul paginii episodului.

Ambele merg din același sold de credite, deci nu mai ai un al doilea abonament de gestionat.

Întrebări frecvente

Ce este Nano Banana 2.1?

Nano Banana 2.1 este cel mai nou model de imagini din familia Nano Banana de pe Kubeez. Generează și editează imagini, acceptă până la 10 imagini de referință și adaugă rapoartele 1:4, 4:1, 1:8 și 8:1.

Câte imagini de referință poate folosi Nano Banana 2.1?

Până la 10 per editare, fișiere JPEG, PNG sau WebP de maximum 30 MB fiecare.

Să aleg Nano Banana 2.1 sau GPT Image 2.5 Sunburst?

Sunburst este alegerea noastră implicită pentru majoritatea imaginilor de sine stătătoare, mai ales cele cu text și oameni fotorealiști. Alege Nano Banana 2.1 pentru portrete 4:5, rapoarte extreme, editări cu multe referințe și loturi unde contează valoarea.

Câți vorbitori acceptă Gemini 3.8 Flash TTS?

Unul sau doi, într-o singură cerere. Pentru trei sau mai multe voci, generează replicile separat și lipește audio-ul.

Merg tagurile cu paranteze drepte, de tip [laughs], pe Gemini 3.8?

Nu. Gemini 3.8 Flash TTS interpretează taguri cu paranteze unghiulare, precum <laugh>. Indicațiile cu paranteze drepte sunt pentru Gemini 3.1 Flash.

Care sunt limitele de lungime și formatul de ieșire?

Un script poate avea până la 5.000 de caractere în total, tagurile incluse, repartizate pe cel mult 50 de replici. Ieșirea este WAV.

Pot folosi ambele modele prin API?

Da. Ambele sunt disponibile în studio, prin MCP și prin API-ul REST. Pentru voce, apelezi generate_dialogue cu provider setat pe gemini-3.8. Pentru imagini, apelezi generate_media cu ID-ul de model nano-banana-2-1.

See also