Kubeey
    Cunoaște Kubeey, agentul tău AI creativ
    Încearcă acum

    Instrumente dialog

    Generați conținut audio TTS cu o singură voce pe Replicate. Instrumentul generate_dialogue acceptă un singur text și o singură voce per apel (scenele cu mai multe voci se obțin combinând rezultatele mai multor apeluri) și suportă doi furnizori:

    • ElevenLabs v3 (provider: "elevenlabs", opțiunea implicită): 26 de voci cu nume umane, prosodia cea mai naturală.
    • Google Gemini 3.1 Flash TTS (provider: "google"): 30 de voci, peste 70 de limbi, un prompt de stil în limbaj natural și etichete expresive inline ([sigh], [laughing], [whispering], [shouting], [extremely fast], [like dracula]) care sunt efectiv interpretate.

    Ambii furnizori au aceeași tarifa (26 credite / 1000 de caractere). Catalogul complet apare și prin get_models (filtru model_type: "speech").


    #ElevenLabs v3 (implicit)

    elevenlabs/v3 acceptă aceste 26 de voci (sensibile la majuscule). Orice altă valoare este respinsă cu 400 Unsupported voice și nu se taxează creditele. Etichetele audio precum [laughs] sunt eliminate pe server înainte de sinteză (nu sunt rostite).

    #Voci feminine

    ID voceDescrierePrevizualizare
    RachelAmericancă, calmă și articulată
    AriaAmericancă, expresivă, voce răgușită
    DomiAmericancă tânără, puternică, încrezătoare
    SarahAmericancă tânără, blândă și caldă
    JaneAustraliancă matură și demnă
    JuniperAmericancă, naturală și articulată
    ArabellaNaratoare britanică misterioasă
    HopeAmericancă luminoasă și optimistă
    BlondieAmericancă, ton conversațional relaxat
    PriyankaIndianică, voce senzuală și liniștitoare
    AlexandraAmericancă tânără, conversațională
    MonikaIndianică, voce profundă și naturală

    #Voci masculine

    ID voceDescrierePrevizualizare
    DrewNarator american echilibrat
    ClydePersonaj veteran de război, voce aspră
    PaulReporter de teren, ton autoritar
    DaveBritanic tânăr, ton conversațional
    RogerAmerican elegant, ton de business
    FinPersonaj de marinar cu accent irlandez
    JamesNarator australian calm
    BradfordBritanic teatral și articulat
    ReginaldPersonaj britanic intens și dramatic
    GamingPersonaj de gaming, energic și expresiv
    AustinAmerican country, ton degajat
    KuonVoce de personaj veselă și constantă
    MarkAmerican, ton casual și relaxat
    GrimblewoodPersonaj fantasy, voce gravă și răgușită

    #Google Gemini 3.1 Flash TTS

    Transmite provider: "google". Gemini adaugă un prompt de stil în limbaj natural (setează tonul, ritmul, accentul, emoția sau un personaj) și interpretează etichetele [tags] inline în loc să le elimine. Acceptă 30 de voci (sensibile la majuscule) și coduri de limbă BCP-47.

    Etichetele inline sunt interpretate, nu eliminate: [sigh], [laughing], [uhm], [whispering], [shouting], [sarcasm], [robotic], [extremely fast], [short pause] / [medium pause] / [long pause], și etichete descriptive libere precum [like dracula] sau [excitedly].

    #Voci feminine

    ID voceCaracterPrevizualizare
    KoreFermă
    ZephyrLuminoasă
    LedaTinerească
    AoedeDegajată
    CallirrhoeRelaxată
    AutonoeLuminoasă
    DespinaFluentă
    ErinomeClară
    LaomedeiaOptimistă
    AchernarDelicată
    GacruxMatură
    PulcherrimaDirectă
    VindemiatrixBlândă
    SulafatCaldă

    #Voci masculine

    ID voceCaracterPrevizualizare
    PuckOptimist
    CharonInformativ
    FenrirExcitabil
    OrusFerm
    EnceladusRăsuflet
    IapetusClar
    UmbrielRelaxat
    AlgenibGrav
    AlgiebaFluid
    SchedarEgal
    AchirdPrietenos
    ZubenelgenubiCasual
    SadachbiaVioi
    SadaltagerInformat
    AlnilamFerm
    RasalgethiInformativ

    Limbi: Coduri BCP-47 (de ex. en-US, en-GB, es-ES, es-MX, pt-BR, fr-FR, de-DE, it-IT, ja-JP, ko-KR, hi-IN, ar-001, ru-RU, ro-RO, tr-TR, vi-VN, th-TH și peste 70 altele), sau auto pentru detectare automată. Implicit en-US. Apelați get_limits_for_model('text-to-dialogue-gemini') pentru lista completă.


    #generate_dialogue

    Generează un clip TTS cu o singură voce.

    Parametri:

    ParametruTipObligatoriuDescriere
    text (sau prompt)stringDaElevenLabs: 5–5000 caractere (după eliminarea etichetelor [bracket]). Google: până la 4000 de bytes (UTF-8), etichetele [tags] inline sunt păstrate.
    providerstringNuelevenlabs (implicit) sau google.
    voicestringNuID de voce pentru furnizorul ales. Implicit: Rachel (ElevenLabs) / Kore (Google).
    style_promptstringNuDoar Google. Instrucțiune de livrare în limbaj natural (ton, ritm, accent, emoție, personaj). Până la 4000 de bytes; text + style_prompt trebuie să fie ≤ 8000 de bytes în total. Implicit: Say the following.
    language_codestringNuElevenLabs: cod ISO (implicit en; 29 acceptate). Google: cod BCP-47 (implicit en-US) sau auto.
    stabilitynumberNuDoar ElevenLabs. 0..1, implicit 0.5. Valori mai mari = mai stabilă, mai mici = mai expresivă.
    similarity_boostnumberNuDoar ElevenLabs. 0..1, implicit 0.75.
    stylenumberNuDoar ElevenLabs. 0..1, implicit 0. Exagerare a stilului.
    speednumberNuDoar ElevenLabs. 0.7..1.2, implicit 1.0.
    previous_text / next_textstringNuDoar ElevenLabs. Context înconjurător pentru prozodie consistentă între fragmente concatenate.

    ElevenLabs elimină [HEY] / [laughs] / [whispers] înainte de sinteză. Google interpretează etichetele inline (vezi lista de etichete de mai sus).

    Exemplu (Google Gemini):

    {
      "provider": "google",
      "text": "[whispering] I have a secret. [laughing] Just kidding!",
      "voice": "Callirrhoe",
      "style_prompt": "Speak playfully, like sharing a fun secret with a friend.",
      "language_code": "en-US"
    }
    

    Exemplu (ElevenLabs):

    {
      "text": "Bun venit înapoi, ești gata să generezi?",
      "voice": "Rachel",
      "stability": 0.5,
      "language_code": "ro"
    }
    

    Răspuns: Întoarce un generation_id. Verificați progresul cu get_generation_status.

    #Scene cu mai multe voci

    generate_dialogue este monovoce. Pentru un dialog între doi vorbitori, apelați instrumentul o dată per replică (ElevenLabs: transmițând previous_text / next_text pentru continuitate prosodică) și concatenați apoi fișierele audio rezultate.

    #get_generation_status

    Folosiți generation_id returnat de generate_dialogue pentru a verifica progresul. Când statusul este completed, URL-ul fișierului audio se află în array-ul outputs (media_type: "audio").


    #Credite și limite

    • Cost: 26 de credite la fiecare 1000 de caractere, ambii furnizori (rotunjire: zecimal ≤ 0.3 în jos, > 0.3 în sus).
    • Minim: 1 credit pentru orice text nevid.
    • Lungime minimă: 5 caractere după eliminarea etichetelor audio.
    • Lungime maximă: ElevenLabs 5000 de caractere; Google 4000 de bytes pentru text (și ≤ 8000 de bytes pentru text + style_prompt combinate).

    Vedeți Limitări pentru detalii complete.