Tehnologie
Nano Banana 2.1 și Gemini 3.8 TTS, acum pe Kubeez
Nano Banana 2.1 și Gemini 3.8 Flash TTS sunt live pe Kubeez: 10 imagini de referință, rapoarte 1:8 și 8:1, dialog cu două voci și 40 de taguri de rostire.
· Kubeez
Nano Banana 2.1 și Gemini 3.8 Flash TTS sunt acum disponibile pe Kubeez. Primul este un model de imagini care acceptă până la 10 imagini de referință și generează cadre ultra-late sau ultra-înalte. Al doilea este un model text to speech care dă glas unei conversații între două persoane dintr-o singură cerere, cu un stil de rostire pentru fiecare replică și 40 de taguri inline precum <laugh> și <whispers>.
În articol vezi ce face fiecare model, unde se potrivește în gama Kubeez și cum le încerci chiar azi în studio, prin MCP sau prin API-ul REST.
Pe scurt, ce este nou
| Nano Banana 2.1 | Gemini 3.8 Flash TTS | |
|---|---|---|
| Tip | Generare și editare de imagini | Text to speech și dialog |
| Noutatea principală | Până la 10 imagini de referință | 1 sau 2 vorbitori, un stil pe replică |
| Mai include | Rapoartele 1:4, 4:1, 1:8 și 8:1 | 40 de taguri de rostire în paranteze unghiulare, 70 de voci |
| Limite | Prompt de până la 20.000 de caractere | Până la 5.000 de caractere, ieșire WAV |
| Unde îl găsești | Studioul de imagini, MCP, REST | Studioul audio Dialog, MCP, REST |
Nano Banana 2.1: modelul de imagini
Nano Banana 2.1 este un model nou din familia Nano Banana, creat atât pentru generare, cât și pentru editare. Este un model separat de Nano Banana 2, cu propriile ID-uri, nano-banana-2-1, nano-banana-2-1-2K și nano-banana-2-1-4K, așa că fluxurile tale cu Nano Banana 2 merg mai departe neschimbate.
În clasamentele publice de imagini ocupă un loc doi solid, în spatele lui GPT Image 2.5 Sunburst, care rămâne modelul nostru implicit pentru majoritatea imaginilor de sine stătătoare. Asta face din Nano Banana 2.1 următoarea alegere pe care o recomandăm, mai ales când contează raportul calitate-preț.
Până la 10 imagini de referință
Imaginile de referință sunt felul în care păstrezi un produs, un personaj sau un stil vizual consecvent de la o generare la alta. Nano Banana 2.1 acceptă până la 10 deodată (JPEG, PNG sau WebP, maximum 30 MB fiecare), cu două mai multe decât Nano Banana 2.
Câteva moduri de a folosi spațiul în plus:
- Fotografii de produs: trimite mai multe unghiuri ale aceluiași produs, ca modelul să nu mai inventeze părțile pe care nu le vede.
- Identitatea brandului: adaugă un logo, o paletă de culori și câteva imagini din campanii anterioare într-o singură editare.
- Seturi de personaje: oferă un chip din unghiuri diferite, apoi așază personajul în scene noi.
Dacă lucrezi cu conținut de brand în loturi, ghidul nostru despre cum păstrezi un brand consecvent pe parcursul a 30 de generări se potrivește bine cu cele zece locuri de referință.
Rapoarte extreme: 1:4, 4:1, 1:8 și 8:1
Nano Banana 2.1 adaugă patru rapoarte extreme peste setul obișnuit (1:1, 16:9, 9:16, 4:3, 3:4, 3:2, 2:3, 21:9, 5:4 și 4:5):
- 4:1 și 8:1 pentru bannere de site, anteturi de email, benzi panoramice și grafice de tip cronologie.
- 1:4 și 1:8 pentru panouri verticale lungi, bare laterale și benzi de poveste pe verticală.

Un banner 4:1 generat cu Nano Banana 2.1. Peretele deschis din dreapta lasă loc pentru un titlu.
Este și modelul către care își trimite rutarea noastră postările portret 4:5.
Cum se așază lângă celelalte modele de imagini
- GPT Image 2.5 Sunburst rămâne alegerea implicită pentru imagini cu mult text, oameni fotorealiști și majoritatea lucrărilor de sine stătătoare.
- Nano Banana 2.1 este locul doi. Îl alegi pentru 4:5, rapoarte extreme, editări cu multe referințe și loturi unde contează valoarea.
- Nano Banana 2 Lite rămâne alegerea pentru buget și viteză, la schițe și volume mari.
Pentru comparații mai vechi din familie, vezi Nano Banana 2 vs Pro vs Lite și GPT Image 2.5 vs Nano Banana 2.
Cum îl folosești
În studioul de imagini, alege Nano Banana 2.1 din lista de modele și setează o rezoluție. Fiecare nivel (1K, 2K și 4K) are prețul lui, așa că compară-le live pe pagina modele disponibile, fără să ghicești.
Prin MCP sau REST, apelezi modelul după ID și trimiți resolution, sau apelezi direct ID-urile pentru 2K și 4K:
{
"model": "nano-banana-2-1",
"prompt": "Panoramic header banner, long oak shelf of hand-thrown ceramic cups, soft north-window light",
"aspect_ratio": "4:1",
"resolution": "2K"
}
Toate imaginile din acest articol au fost făcute cu Nano Banana 2.1.
Gemini 3.8 Flash TTS: modelul de voce
Gemini 3.8 Flash TTS (gemini-3-8-flash-tts) transformă textul în vorbire și este gândit pentru conversație, nu pentru citiri izolate. Unde variantele mai vechi de text to speech te obligă să generezi fiecare replică separat și să lipești apoi audio-ul, acesta primește tot schimbul de replici deodată.

O singură cerere, două voci
Declari unul sau doi vorbitori, apoi scrii o listă ordonată de replici. Fiecare replică are vorbitorul ei, textul și, opțional, un stil de rostire de până la 500 de caractere:
Speaker 1 (curious, upbeat podcast host): So you actually tried it for a week?
Speaker 2 (dry, amused): <laugh> Seven days. My kitchen has never been cleaner.
Un script poate avea până la 50 de replici. Dacă activezi cuvintele de umplutură, modelul adaugă ezitări naturale, de tip „hm” și „ăă”, între cei doi vorbitori, iar asta face un dialog să sune a doi oameni, nu a doi cititori. Cuvintele de umplutură funcționează doar la scripturile cu doi vorbitori.
40 de taguri de rostire
Tagurile inline din paranteze unghiulare îți permit să plasezi un moment exact unde se petrece: <laugh>, <sigh>, <whispers>, <short pause>, <long pause>, <gasp>, <chuckle>, <breath>, <cough>, <yawn> și încă 30.
Două observații practice:
- Folosește paranteze unghiulare. Tagurile cu paranteze drepte nu sunt interpretate de acest model (ele țin de Gemini 3.1 Flash).
- Tagurile intră în totalul de caractere și în factură, așa că mai bine câteva momente bine alese decât un zid de taguri.
70 de voci grupate pe utilizări
Cele 70 de voci sunt grupate după rolul pentru care se potrivesc: Tutor, Reclame și voiceover, Instrucțiuni, Podcast, Povestitor, Asistent digital, Call center, Concierge, Suport tehnic și Profesional. Apasă pe orice nume de mai jos ca să asculți un eșantion real de la acest model.
| Utilizare | Voci de încercat |
|---|---|
| Podcast | Jori, Veda |
| Reclame și voiceover | Koda, Kore |
| Povestitor | Enzo, Zali |
| Tutor | Lumi, Bodi |
Vocea implicită este Fola. Un nume de voce care nu se află în listă este respins înainte să se consume vreun credit.
Limbă, lungime și format
Nu există o setare de limbă. Modelul citește limba din textul tău, așa că scrie fiecare replică în limba în care vrei să o auzi. Scripturile pot ajunge la 5.000 de caractere în total, tagurile incluse, iar ieșirea este un fișier WAV mono de 24 kHz.
Dacă trebuie să fixezi o variantă regională exactă, de pildă spaniola din Mexic față de cea din Europa, sau vrei indicații libere cu paranteze drepte, Gemini 3.1 Flash se potrivește mai bine. Comparația noastră pentru Gemini TTS arată cum diferă variantele.
Cum îl folosești
În studio, deschide Audio, Dialog, alege fila Google, apoi 3.8 Flash. Adaugă vorbitorii, scrie replicile și folosește panoul de taguri ca să introduci indicațiile de rostire.
Dintr-un agent sau dintr-un script, folosește generate_dialogue cu provider setat pe gemini-3.8:
{
"provider": "gemini-3.8",
"speakers": [{ "voice": "Jori" }, { "voice": "Veda" }],
"dialogue_turns": [
{ "speaker": "Speaker 1", "text": "So you actually tried it for a week?", "style": "curious, upbeat podcast host" },
{ "speaker": "Speaker 2", "text": "<laugh> Seven days. My kitchen has never been cleaner.", "style": "dry, amused" }
],
"filler_words": true
}
Facturarea se face la 1.000 de caractere de text, tagurile incluse, cu un minim per generare. Verifică tariful actual pe pagina modele disponibile sau în studio înainte de un script lung. Conectarea MCP o configurezi din setările MCP, iar pentru REST vezi pagina pentru dezvoltatori și API.
Cele două modele împreună
Cele două modele acoperă jumătăți diferite ale unei lansări. Un episod de podcast, de exemplu, are nevoie de o copertă și de o conversație:
- Generează coperta cu Nano Banana 2.1, la 4:5 pentru social media și 1:1 pentru directoare, trimițând logoul emisiunii și fotografiile gazdelor ca referințe.
- Scrie introducerea episodului ca script cu doi vorbitori, adaugă
<short pause>și<laugh>acolo unde le-ar pune o gazdă umană și redă totul într-o singură cerere de dialog. - Taie un banner 4:1 din aceleași referințe pentru antetul paginii episodului.
Ambele merg din același sold de credite, deci nu mai ai un al doilea abonament de gestionat.
Întrebări frecvente
Ce este Nano Banana 2.1?
Nano Banana 2.1 este cel mai nou model de imagini din familia Nano Banana de pe Kubeez. Generează și editează imagini, acceptă până la 10 imagini de referință și adaugă rapoartele 1:4, 4:1, 1:8 și 8:1.
Câte imagini de referință poate folosi Nano Banana 2.1?
Până la 10 per editare, fișiere JPEG, PNG sau WebP de maximum 30 MB fiecare.
Să aleg Nano Banana 2.1 sau GPT Image 2.5 Sunburst?
Sunburst este alegerea noastră implicită pentru majoritatea imaginilor de sine stătătoare, mai ales cele cu text și oameni fotorealiști. Alege Nano Banana 2.1 pentru portrete 4:5, rapoarte extreme, editări cu multe referințe și loturi unde contează valoarea.
Câți vorbitori acceptă Gemini 3.8 Flash TTS?
Unul sau doi, într-o singură cerere. Pentru trei sau mai multe voci, generează replicile separat și lipește audio-ul.
Merg tagurile cu paranteze drepte, de tip [laughs], pe Gemini 3.8?
Nu. Gemini 3.8 Flash TTS interpretează taguri cu paranteze unghiulare, precum <laugh>. Indicațiile cu paranteze drepte sunt pentru Gemini 3.1 Flash.
Care sunt limitele de lungime și formatul de ieșire?
Un script poate avea până la 5.000 de caractere în total, tagurile incluse, repartizate pe cel mult 50 de replici. Ieșirea este WAV.
Pot folosi ambele modele prin API?
Da. Ambele sunt disponibile în studio, prin MCP și prin API-ul REST. Pentru voce, apelezi generate_dialogue cu provider setat pe gemini-3.8. Pentru imagini, apelezi generate_media cu ID-ul de model nano-banana-2-1.