Suno Speech (Beta): KI-Sprecher, Erzählungen und Spoken Word mit Hintergrundmusik in einem einzigen Track

Suno Speech ist eine neue Beta auf Sunos Create-Seite, die eine Sprechstimme und ihre Hintergrundmusik gleichzeitig erzeugt. Wie Simple- und Advanced-Modus funktionieren, die Regler Vocal Gender, Background music und Variety, Prompt-Beispiele, die bekannten Schwächen der Beta und was Suno noch nicht angekündigt hat.

Suno Speech (Beta): KI-Sprecher, Erzählungen und Spoken Word mit Hintergrundmusik in einem einzigen Track

Am 1. Oktober 2026 hat Suno Speech (Beta) für alle im Web, auf iOS und auf Android freigeschaltet. Es ist die erste Suno-Funktion, bei der nicht gesungen wird: Du tippst eine Idee ein oder fügst ein Skript ein, beschreibst die Stimme und die Musik, und Suno erzeugt eine gesprochene Performance und ihren Soundtrack zusammen, als einen Track. Suno nennt es „das erste Audiomodell, das Stimme und Musik zusammen als einen stimmigen Track erzeugt".

Die Kurzfassung: Suno Speech ist ein KI-Sprecher mit eingebautem Komponisten. Der Simple-Modus schreibt den Text aus einer einzeiligen Idee selbst; der Advanced-Modus liest dein eigenes Skript in dem Stil, den du beschreibst. Hintergrundmusik ist standardmäßig an und lässt sich für reine Sprache abschalten. Ein Take kann etwa acht Minuten lang sein. Credit-Preis, Sprachliste und API hat Suno noch nicht veröffentlicht, und Suno sagt offen, dass die Beta noch Ecken und Kanten hat.

Quellen für alles Folgende: Sunos Ankündigung von Chief Product Officer Jack Brody, die Release Note vom 1. Oktober, Sunos offizielles Tutorial-Video How to Use Suno Speech (Beta) (die Screenshots der Oberfläche in diesem Artikel stammen daraus), der Bericht von The Verge und die Reaktionen auf X. Wo Suno etwas nicht gesagt hat, schreiben wir das, statt zu raten. Diese Seite ist ein unabhängiges Suno-Download-Tool und nicht mit Suno verbunden.

Sunos Launch-Grafik für Speech: Karten mit dem Label SPEECH für Sunset Calmness (Meditation, sanfte Stimme), Go Team! (energiegeladene Cheerleaderin), Digitale Roboto (italienischer Roboter, 90er-Beep-Bop), Scottish Catter (schottisches Geplauder, Pub, Dudelsack) und Grocery Lists (viktorianisches Englisch mit Cembalo)
Sunos Launch-Grafik. Jede Karte ist ein Speech-Track: ein Titel, darunter Stimme und Musik in wenigen Worten. Bild: Suno.

Suno Speech auf einen Blick

Suno Speech (Beta)
Start 1. Oktober 2026, als offene Beta nach einem Monat Test mit einer kleinen Gruppe
Wo suno.com und die Suno-Apps für iOS und Android, unter Create → Speech
Wer darf es nutzen Laut Suno alle; eine Einschränkung nach Tarif wurde nicht angekündigt
Was es erzeugt Eine Sprechstimme und Originalmusik in einem Track; die Musik lässt sich abschalten
Modi Simple (Idee beschreiben) und Advanced (eigenes Skript + Sprechstil)
Regler Vocal Gender (Male / Female), Background music (On / Off), Variety-Schieberegler
Länge Bis etwa 8 Minuten pro Take
Noch nicht angekündigt Credit-Kosten pro Take, unterstützte Sprachen, API, eigene Voice als Sprecher

Was Suno Speech eigentlich macht

KI-Sprechertexte sind heute meist zwei Arbeitsschritte. Ein Text-to-Speech-Tool (TTS) liest das Skript, ein Musik-Tool oder eine Stock-Bibliothek liefert das Musikbett, und jemand legt beides im Editor übereinander und gleicht die Pegel an. Suno Speech erledigt beides in einem Durchgang. Weil die Musik zusammen mit der Stimme entsteht, kann sie anschwellen, wenn der Vortrag dramatisch wird, und zurückgehen, wenn der Sprecher langsamer wird, statt die ganze Zeit gleich laut darunter zu laufen.

Suno bewirbt die Funktion mit verspielten Beispielen. Die Release Note nennt „Gutenachtgeschichten über sanftem Klavier, Motivationsreden über Stadiontrommeln, ASMR-Einkaufslisten und mehr". In der Ankündigung zählt Brody auf, was das Team beim Entwickeln gemacht hat: Nachrichten von Freunden als „völlig überproduzierte dramatische Lesungen", gewöhnliche Sprachnachrichten mit „unnötig epischer Filmmusik", Meditationen, Gedichte, Motivationsansprachen und Gutenachtgeschichten für die eigenen Kinder. Sunos Tutorial ergänzt praktischere Anwendungen: einen Museums-Audioguide, eine Bahnhofsdurchsage, ein Spoken-Word-Stück und eine Lernerklärung.

Es ist auch nicht Sunos erstes Sprachmodell. Bevor Suno ganz auf Songs setzte, veröffentlichte die Firma 2023 Bark, ein Open-Source-Text-to-Speech-Modell. Speech ist das erste Sprachmodell, das direkt in die Suno-App eingebaut ist.

So nutzt du Suno Speech im Web

Öffne suno.com/create. Das linke Panel hat jetzt drei Tabs: Songs, Speech und Sounds. Klick auf Speech. Das Panel trägt ein rotes BETA-Abzeichen, oben wählst du zwischen Simple und Advanced.

Simple-Modus: die fertige Idee beschreiben

Das Create-Panel von Suno mit ausgewähltem Speech-Tab, aktivem Simple-Modus, einem BETA-Abzeichen und einem Prompt, der beginnt mit: A museum audio guide explaining an obviously fake
Create → Speech → Simple. Ein Prompt beschreibt Inhalt, Stimme und Musik.

Im Simple-Modus schreibst du einen einzigen Prompt, der abdeckt, was gesagt wird, wer es sagt und was darunter läuft. Das Skript schreibst nicht du, sondern Suno. Im Tutorial ist der Prompt ein Museums-Audioguide für eine offensichtlich erfundene Ausstellung über die Erfindung der Schlummertaste – „ruhiger, ernster Erzähler, leicht dramatisch, mit eleganter Orchestermusik darunter" –, und Suno liefert eine komplette Erzählung („Welcome to Gallery 7. Please stand a respectful distance from the glass…") mit passender Orchestermusik. Das Ergebnis im Tutorial ist gut fünf Minuten lang, und die Anfrage liefert zwei Takes, genau wie eine Song-Generierung.

Das Beispiel von The Verge, „a pirate captain rallying his crew" (ein Piratenkapitän, der seine Mannschaft anfeuert), zeigt, wie wenig du tippen musst.

Advanced-Modus: dein Skript, deine Regie

Suno Speech im Advanced-Modus mit einem Feld Custom script (Write or paste your speech) und einem Feld Style of speech (Describe the delivery: tone, pacing, mood and setting); rechts stehen in der Bibliothek zwei Speech-Takes von The Snooze Button mit 5:13 und 5:19
Der Advanced-Modus teilt den Prompt in zwei: Custom script für die Worte, Style of speech für den Vortrag.

Wechsle zu Advanced, wenn du schon genau weißt, was gesagt werden soll. Du bekommst zwei Felder:

  • Custom script – „Write or paste your speech" (Text schreiben oder einfügen). Das ist der Text, den Suno spricht.
  • Style of speech – „Describe the delivery: tone, pacing, mood and setting" (Vortrag beschreiben: Ton, Tempo, Stimmung und Umgebung). Hier führst du Regie über die Performance und, wenn die Musik an ist, auch über den Soundtrack.

Die beste Demonstration im Tutorial behält eine kurze Durchsage bei und ändert nur den Stil. „Ruhiger, professioneller Bahnhofssprecher, langsam und gemessen, völlig ernst" ergibt eine trockene Lesung von „Attention passengers, the 6:42 train to nowhere in particular is now boarding on platform 9." Ändert man den Stil zu „zunehmend panischer Sprecher, der versucht professionell zu bleiben; beginnt kontrolliert, wird mit jedem Satz schneller und genervter", kommen dieselben Worte als völlig andere Performance zurück.

Sunos Formatierungstipp für das Skript ist einfach: Schreib es wie normale Rede, in schlichten Absätzen. Du brauchst keine Songtext-Formatierung und keine Abschnitts-Tags in eckigen Klammern wie [Verse] oder [Chorus] wie bei einem Song.

Die Advanced-Regler: Vocal Gender, Background music und Variety

Der Advanced-Bereich von Suno Speech mit drei Zeilen: Vocal Gender mit Male und Female, Background music mit Off und On (On ausgewählt) und ein Variety-Schieberegler auf Normal
Die drei Schalter unter Advanced. Background music steht standardmäßig auf On.
  • Vocal Gender – Male oder Female. In der Standardansicht ist keins ausgewählt; du brauchst es also nur, wenn das Geschlecht wichtig ist.
  • Background music – standardmäßig an. Stell es auf Off, wenn du reines Sprachaudio brauchst: Sprechertext für ein Video, das du selbst vertonst, Dialoge, Anleitungen oder alles, wofür du die Musik schon hast.
  • Variety – wie stark die Takes voneinander abweichen dürfen. Steht standardmäßig auf Normal; nach links für vorhersehbarere, nach rechts für überraschendere Lesungen.

Suno Speech auf iPhone und Android

Die Suno-App auf dem Smartphone mit Speech oben ausgewählt, einem Chip Backing music on, den Chips Script und Tone und dem Prompt: I have a test tomorrow. Explain osmosis to me like a p
Auf dem Smartphone erscheinen dieselben Optionen als Chips: Backing music, Script und Tone.

Speech gibt es auch in den Apps; wenn es nicht auftaucht, rät Sunos Ankündigung auf X, „die App auf die neueste Version zu aktualisieren". In der App wählst du Speech im Menü oben in Create, und die Advanced-Felder werden zu Chips: Backing music on (mit dem × entfernen), Script und Tone. Das Smartphone-Beispiel im Tutorial ist eine Lernhilfe – „Ich habe morgen eine Prüfung. Erklär mir Osmose wie ein geduldiger Nachhilfelehrer. Fang mit einer einfachen Analogie an und gib mir dann eine kurze Erklärung, die ich mir für die Prüfung merken kann" –, aus der Lernstoff zum Anhören auf dem Schulweg wird.

Prompt-Beispiele für Suno Speech

Sie folgen dem Muster aus Sunos eigenen Beispielen: erst was das Stück ist, dann die Stimme, dann die Musik.

Gutenachtgeschichte (Simple-Modus)

A two-minute bedtime story about a fox who learns to share fireflies. Soft, warm storyteller voice with a gentle smile in it, slow pace. Quiet piano and soft night pads underneath, lullaby tempo.

Motivationsrede (Simple-Modus)

A coach’s half-time pep talk to a team that is losing 2–0. Loud, rallying, building to a shout. Stadium drums and brass that grow with every line.

Eigenes Skript (Advanced-Modus)

Custom script: den genauen Text in kurzen Absätzen einfügen.

Style of speech: Warm adult narrator, intimate and conversational, steady pace, clear pronunciation. Sparse felt piano underneath, voice forward in the mix, gentle ending.

Reiner Sprechertext ohne Musik (Advanced-Modus)

Background music: Off. Variety: ganz links.

Style of speech: Neutral, friendly product-demo narrator, medium pace, clear diction. No background music.

Welche Sprachen Speech unterstützt, hat Suno nicht veröffentlicht. Wenn du es auf Deutsch nutzen willst, teste erst mit einem kurzen Skript, bevor du ein langes einfügst.

Tipps für bessere Ergebnisse

  • Führ Regie beim Vortrag, nicht nur beim Inhalt. Ton, Tempo, Stimmung und Umgebung sind die vier Dinge, nach denen Sunos eigener Platzhaltertext fragt. „Beginnt ruhig, wird schneller, endet atemlos" bringt mehr als „dramatisch".
  • Gib dem Skript Sprechform. Kurze Sätze, Satzzeichen dort, wo ein Sprecher atmen würde, Absätze zwischen Gedanken. Reime und wiederholte Refrains können das Modell in einen rhythmischen, halb gesungenen Vortrag ziehen.
  • Teste den Stil an einem kurzen Skript. Die Bahnhofsdurchsage im Tutorial zeigt, dass dieselben Worte völlig anders klingen können; leg den Stil mit ein paar Zeilen fest, bevor du ein Fünf-Minuten-Skript einfügst.
  • Hör mit dem Text daneben. Prüf Namen, Zahlen und jedes Wort, das exakt stimmen muss, bevor du veröffentlichst. Das ist ein kreatives Werkzeug, keine wortgenaue TTS-Engine.
  • Für reine Stimme Signale stapeln. Der Hauptschalter ist Background music auf Off. Ein früher Community-Tipp, von aireiter zusammengetragen, ergänzt Variety ganz nach links und „No background music." im Stil- bzw. Tone-Feld, weil sich trotzdem gelegentlich Musik einschlich. Sieh das als Workaround, nicht als Garantie.
  • Keine echten Personen imitieren. Beschreib die Stimme über Alter, Klangfarbe, Akzent und Haltung, statt jemanden zu nennen, dessen Stimme du nicht verwenden darfst.

Was laut Suno in der Beta noch schiefgeht

Suno ist hier ungewöhnlich offen. „Beta heißt wirklich Beta", schreibt Brody. „Gelegentlich wandern britische Akzente nach Australien und wieder zurück. Dramatische Pausen können sehr dramatisch ausfallen." Rechne damit, dass ein Teil der Takes mitten im Skript den Akzent wechselt, eine Pause zu lang ausfällt oder ein Wort anders betont wird, als du es meintest. Zwei Takes erzeugen und den besseren nehmen gehört zum Ablauf.

Was Suno noch nicht veröffentlicht hat:

  • Credit-Kosten. Weder Ankündigung noch Release Note nennen einen Preis pro Take oder sagen, ob Free- und Bezahltarife unterschiedliche Limits haben. Die Create-Ansicht zeigt dein Guthaben; schau vor einer Reihe langer Skripte nach.
  • Sprachen. Es gibt keine veröffentlichte Liste unterstützter Sprachen.
  • Deine eigene Stimme. Mit der separaten Funktion Voices kannst du Songs mit deiner verifizierten Stimme singen lassen. Nichts, was Suno veröffentlicht hat, sagt, dass eine gespeicherte Voice in Speech als Sprecher dienen kann.
  • Eine API. Speech gibt es nur auf der Website und in den Apps, wie den Rest von Suno. Unser Suno-API-Ratgeber erklärt, was das für Entwickler bedeutet.
  • Eigene Rechte für Speech. Suno hat keine separaten Bedingungen für Speech herausgegeben. Die allgemeine Regel: Kommerzielle Nutzung gilt für das, was in einem Bezahltarif entsteht; Inhalte aus dem Free-Tarif sind für den privaten Gebrauch. Unser Rechtsratgeber geht ins Detail.

Suno Speech vs. Text-to-Speech-Tool

Suno Speech und Tools wie ElevenLabs lösen unterschiedliche Probleme. Nimm Suno Speech, wenn Performance und Musik zusammengehören: Gutenachtgeschichten, Gedichte, Meditationen, Trailer, Trinksprüche, Figurenstücke, dramatische Lesungen aus dem Gruppenchat. Nimm ein spezialisiertes TTS-Tool, wenn du dieselbe Stimme über Hunderte Clips, exaktes Timing, wortgenaue Aussprache oder eine API brauchst: Produkt-Tutorials, Hörbücher, Barrierefreiheit, Apps. Beides lässt sich auch kombinieren: die vertonte Fassung in Suno, eine trockene TTS-Lesung für alles, was präzise sein muss.

Was auf X gesagt wird

Sunos eigene Ankündigung auf X war kurz: „Speech is now in Beta. Try the first model ever that creates spoken audio with matching background music. Update your app for the latest." („Speech ist jetzt in der Beta. Probier das erste Modell, das gesprochenes Audio mit passender Hintergrundmusik erzeugt. Aktualisiere deine App.") KI-News-Accounts griffen es innerhalb weniger Stunden auf; der chinesischsprachige KI-Kommentator Gorden Sun (@Gorden_Sun) nannte es einen naheliegenden Schritt für eine Firma, die schon gesungene Stimmen erzeugt – mit dem Verkaufsargument, dass „die erzeugte Stimme perfekt zur Hintergrundmusik passt".

Nicht alle waren überzeugt. Auf r/SunoAI nannte ein Nutzer Sunos eigene Demo „besorgniserregend schlecht" (zitiert im oben verlinkten aireiter-Ratgeber), und The Verge wies darauf hin, dass KI-Sprache ein voller Markt ist, von ElevenLabs bis Adobe, und deutete den Start auch als Versuch, sich über Musik hinaus breiter aufzustellen. Am selben Tag sagte CEO Mikey Shulman bei Bloomberg, Suno liege inzwischen „weit über" den zuletzt gemeldeten 2 Millionen Abonnenten und 300 Millionen Dollar Umsatz, nannte aber keine neue Zahl.

Suno-Speech-Tracks herunterladen

Speech-Takes erscheinen in deinem Workspace neben deinen Songs, mit dem Label SPEECH und denselben Buttons für Like, Anpinnen und Teilen. Wenn du eine Datei behalten willst, nutze den offiziellen Suno-Download deines Tarifs; solange Suno nichts anderes sagt, gelten dieselben Download-Limits wie für Songs.

Suno Music Downloader funktioniert mit öffentlichen Suno-Links. Wenn du einen Speech-Track veröffentlichst und sein Teilen-Link eine normale suno.com/song/…-Seite öffnet, füg ihn ein und speichere eine Hörkopie als M4A, MP3, WAV oder MP4 für den privaten Gebrauch – ohne Suno-Login und ohne dein Download-Kontingent zu belasten. Speech ist noch in der Beta; wenn ein Speech-Link im Tool nicht lädt, sag uns Bescheid, dann schauen wir es uns an.

Häufig gestellte Fragen

Was ist Suno Speech? Suno Speech ist eine Beta-Funktion auf Sunos Create-Seite, die gesprochenes Audio – Erzählungen, Sprechertexte, Geschichten, Reden – zusammen mit originaler Hintergrundmusik in einem Track erzeugt. Suno hat sie am 1. Oktober 2026 gestartet und bezeichnet sie als erstes Audiomodell, das Stimme und Musik gemeinsam erzeugt.

Ist Suno Speech kostenlos? Suno sagt, die Beta steht allen im Web und auf dem Smartphone offen, hat aber nicht veröffentlicht, wie viele Credits ein Speech-Take kostet oder ob die Limits je nach Tarif unterschiedlich sind. Dein Credit-Guthaben steht in der Create-Ansicht.

Wie benutze ich Suno Speech? Öffne Create auf suno.com oder in der App und wähle Speech. Im Simple-Modus beschreibst du Stück, Stimme und Musik in einem Prompt. Im Advanced-Modus fügst du deinen eigenen Text in Custom script ein, beschreibst den Vortrag in Style of speech und stellst bei Bedarf Vocal Gender, Background music und Variety ein.

Kann Suno Speech einen Sprechertext ohne Musik erzeugen? Ja. Schalte Background music im Advanced-Modus aus oder entferne auf dem Smartphone den Chip Backing music. Manche Nutzer schreiben zusätzlich „No background music." in den Stil und senken Variety, weil sich in der Beta gelegentlich Musik einschlich.

Wie lang kann ein Suno-Speech-Track sein? Laut Sunos Tutorial bis etwa acht Minuten pro Take.

Kann ich meine eigene Stimme in Suno Speech verwenden? Das hat Suno nicht gesagt. Eigene Stimmen gehören zur separaten Funktion Voices für Songs, und nichts Veröffentlichtes besagt, dass eine gespeicherte Voice einen Speech-Track sprechen kann.

Hat Suno Speech eine API? Nein. Wie der Rest von Suno ist Speech nur auf der Website und in den Apps für iOS und Android verfügbar.

Kann Suno Speech Text-to-Speech ersetzen? Nicht für alles. Am stärksten ist es bei kurzen, ausdrucksstarken Stücken, in denen Musik zum Ergebnis gehört. Für lange, wortgenaue oder wiederholbare Sprechertexte ist ein spezialisiertes TTS-Tool weiterhin berechenbarer, und Suno warnt selbst, dass Akzente und Pausen in der Beta schwanken können.

Kann ich Suno-Speech-Tracks mit Suno Music Downloader herunterladen? Das Tool liest öffentliche Suno-Links. Ein veröffentlichter Speech-Track, der sich als normale suno.com/song-Seite öffnet, lässt sich wie ein Song speichern; Speech ist neu und in der Beta, also sag uns Bescheid, wenn ein Speech-Link nicht funktioniert.

Wir aktualisieren diesen Artikel, sobald Suno Preise, Sprachen oder andere Änderungen an Speech veröffentlicht.

← Alle Artikel