Introducción
Buscas "seed audio" porque un clip que escuchaste sonaba como actuación real — la voz se aferró a una palabra, cayó hasta casi nada, volvió con rabia — y todas las herramientas de voz que has probado producen una lectura limpia, pareja y ligeramente aburrida de la misma línea. Quieres saber qué es Seed Audio 1.0, si es la razón por la que ese clip sonaba vivo y qué tienes que escribir para conseguirlo.
Seed Audio 1.0 es un modelo de generación de voz construido alrededor de la actuación: toma el estado emocional, la escena y el ritmo como instrucciones reales, no como adorno. Esta guía explica qué significa eso, qué debe contener un prompt de Seed Audio, cuándo un modelo de voz estable como ElevenLabs es la mejor opción y cómo usar Seed Audio 1.0 en ArcLoop para que la actuación pertenezca a un personaje y no a un solo clip.
Qué es Seed Audio 1.0
Seed Audio 1.0 es uno de los modelos de voz disponibles en ArcLoop para voiceover de personajes, junto con ElevenLabs y Doubao. Donde la mayoría de los modelos de voz están optimizados para decir una línea con claridad en una voz elegida, Seed Audio 1.0 está optimizado para actuar la línea: lee la descripción de quién habla, qué siente, dónde está y cómo cambia ese sentimiento a lo largo de la frase, y moldea el tono, el ritmo, la respiración y las pausas para encajar con todo eso.
En la práctica eso te da:
- Emoción que se mueve dentro de una línea — tranquila al principio, quebrándose en la última palabra — en lugar de una emoción aplicada de manera uniforme.
- Entrega consciente de la escena — un susurro en un pasillo, una voz alzada sobre el ruido, una línea dicha entre lágrimas.
- Textura vocal y dialecto como parte del personaje, no como un filtro añadido después.
- Pasajes enteros que mantienen la tensión, útiles para monólogos y confrontaciones.
Lo que no es: un banco de voces fijo. Si lo que necesitas es la misma voz reconocible repetida con variación mínima en cientos de líneas, ese es otro trabajo, explicado más adelante.
Seed Audio 1.0 vs ElevenLabs: cuál usar según la tarea
La diferencia es por tipo de tarea, no por calidad. La comparación de doblaje va escena por escena; la versión corta:
- Seed Audio 1.0 cuando la escena tiene que actuarse — confrontación, llanto, esconder el pánico, una confesión que cambia a mitad. El prompt describe la actuación; el modelo la entrega.
- ElevenLabs cuando la voz tiene que ser estable y reutilizable en muchas líneas e idiomas, y diriges a nivel de línea con etiquetas como
[whispers]o[angry].
Dentro de una serie, muchas producciones usan ambos: Seed Audio 1.0 para las grandes escenas del protagonista, ElevenLabs para personajes secundarios y diálogos en volumen. Elige por personaje, no por clip, para que un personaje no cambie de voz entre episodios.
Reglas para un prompt de Seed Audio 1.0
- Da el estado antes de la línea. Quién es, qué siente, qué está ocultando, y luego las palabras.
- Describe el movimiento, no la etiqueta. "Intenta mantener la calma, la rabia se rompe en las últimas palabras" supera a "enfadado".
- Establece la escena en una cláusula. Un pasillo, una llamada de teléfono, al otro lado de un mostrador — cambia cómo suena la voz.
- Nombra el ritmo. Más lento de lo normal, una pausa antes de la última palabra, acelerado y luego parado.
- Mantén la línea corta. Una línea del tamaño de un subtítulo le da espacio a la actuación; un párrafo se lee.
- Mantén el perfil de voz fijo en el asset. La dirección cambia por línea; la voz no.
Cómo usar Seed Audio 1.0 en ArcLoop, paso a paso
- Escribe el perfil de voz del personaje en el asset en My Assets: edad, tono, ritmo, textura, rango emocional, un hábito. Esto es la constante; la guía del generador de voz explica cómo construirlo.
- Vincula la voz del personaje al asset y elige Seed Audio 1.0 como su motor para la temporada.
- En cada shot card, escribe la línea con su estado y escena — la dirección de actuación vive con el shot, no en un documento aparte.
- Genera primero el vídeo del shot, para que el timing y la expresión existan antes de poner la voz encima.
- Ejecuta Generate Voiceover en Edit. Las líneas aparecen en la línea de tiempo junto a sus shots.
- Escucha con la imagen. Si la actuación choca con la cara, ajusta la dirección en la línea — el estado, el ritmo, dónde se quiebra — y regenera solo esa línea.
- Añade el BGM al final, bajo la actuación, para que la mezcla no oculte las pausas que dirigiste.
Ejemplo 1: una línea de confrontación
Voice: @Mira (profile on asset, Seed Audio 1.0). Scene: kitchen, across the counter from @Daniel, she has already seen the boarding pass. State: controlled on the surface, anger underneath, refusing to give him a reaction. Pace: slower than her normal; a full pause before the last word. Line: "How was Osaka." Note: flat, the period audible, no rise at the end.
Ejemplo 2: una línea que cambia a mitad
Voice: @Kaito (profile on asset, Seed Audio 1.0). Scene: shrine steps at dawn, alone, reading the letter aloud to himself. State: starts steady, almost amused; the second sentence lands and the voice thins out. Pace: even, then a catch before "stay." Line: "You said you'd wait at the gate. You didn't say you'd stay." Note: the last word barely voiced.
Ejemplo 3: una línea susurrada en un pasillo
Voice: @Liora (profile on asset, Seed Audio 1.0). Scene: hotel corridor at night, on the phone to @Rowan, staff could hear her. State: frightened, keeping it down, trying to sound like she is in control. Pace: quick, breath audible between phrases. Line: "It's my brother's initials. On a staff card. Don't come up." Note: whisper throughout; the last three words firmer.
Las formas más comunes en que los prompts de Seed Audio fallan
- Solo la línea. Sin estado ni escena, el modelo actúa un promedio. Añade quién y qué.
- Una etiqueta en lugar de movimiento. "Triste" da tristeza uniforme. Di dónde cambia.
- Un párrafo como línea. El texto largo se lee, no se actúa. Recórtalo a la frase.
- Voz elegida de nuevo por clip. Una persona distinta cada vez. Vincúlala al asset.
- Revisada sin la cara. La mejor toma puede no encajar con el shot. Escucha en la línea de tiempo.
Preguntas frecuentes
¿Está Seed Audio 1.0 disponible en ArcLoop? Sí. Es uno de los motores de voz de personaje; vincúlalo en el character asset y ejecuta Generate Voiceover en Edit.
¿Clona la voz de una persona real? Ese no es el uso aquí, y no es lo que lo hace valioso para una serie. Construye un perfil de voz original en el asset y dirígelo.
¿Qué idiomas admite? Escribe la dirección en inglés y la línea en el idioma de la historia; mantén el mismo perfil en todos los idiomas para que el personaje suene igual en todas partes.
¿Cuándo debería cambiar a ElevenLabs? Cuando un personaje tiene cientos de líneas de rutina y necesita sonar idéntico en cada una, o cuando necesitas control por etiquetas de audio a nivel de línea en lugar de una escena actuada.
Siguiente paso
Elige la escena donde la voz tiene que hacer más trabajo — la confesión, la acusación, la línea dicha entre lágrimas. Escribe el estado, la escena y el ritmo encima de la línea en el shot card, vincula Seed Audio 1.0 al personaje en ArcLoop y genera el voiceover en la línea de tiempo. Escúchalo una vez con la imagen antes de cambiar nada.





