Una conversación telefónica parece sencilla sobre el papel: dos personajes hablando en lugares diferentes. En la secuencia generada, fondos similares y líneas de mirada ambiguas pueden hacer que esos lugares parezcan una sola habitación. Las líneas de diálogo por sí solas también omiten el momento más revelador: la reacción silenciosa del oyente, que el público ve pero el otro interlocutor no puede.
Dale a cada interlocutor un espacio físico reconocible, una postura clara al sostener el teléfono y algo concreto en lo que fijar la mirada mientras escucha. Luego decide qué reacción necesita ver el público antes de la siguiente réplica. Esta guía te muestra cómo escenificar esa brecha de información entre dos ubicaciones sin perder la geografía de la llamada.
Lo que sabe cada interlocutor — y lo que solo ve el público
Antes de construir cualquier plano, anota tres cosas para cada interlocutor:
- Lo que saben al contestar. Los hechos de los que disponen y el estado emocional que esos hechos generan.
- Lo que el otro puede escuchar. Las líneas de diálogo y cualquier sonido que pretendan compartir, o que revelen sin querer.
- Lo que solo el público puede ver. Una mano temblorosa, una mirada hacia una puerta, una foto boca abajo sobre un escritorio.
Esta tercera capa es donde las escenas de llamada telefónica generan su tensión. Si al Interlocutor A se le dice algo que lo cambia todo, el público lo ve procesar esa información en silencio antes de que A hable. El Interlocutor B no puede ver eso. El público sí. Esa brecha de información es la escena.
Usa esas tres respuestas para decidir a qué interlocutor necesita ver el público a continuación.
Construye assets separados para cada ubicación
Dale a las ubicaciones anclajes visuales distintos: una encimera de cocina con una lámpara cálida para un interlocutor, una cama de hotel con una ventana con luz fría para el otro. Revisa los fondos juntos para que los espectadores puedan identificar cada lugar antes de que nadie hable.
En My Assets, crea dos scene assets diferenciados: uno para la ubicación de cada interlocutor. Dale a cada scene asset una reference image que muestre el entorno real, no solo una paleta de colores. Una cocina de apartamento pequeño es un asset diferente al escritorio de una habitación de hotel. Vincula esas reference images como Main images y luego comprueba cada vista generada con el espacio establecido.
Para cada interlocutor, confirma su character asset y vincula reference images útiles. Si una referencia con el teléfono en mano ayuda a explicar la postura, agrégala junto a la referencia de aspecto principal. En la descripción de cada Shot, especifica la mano que sostiene el teléfono cuando la continuidad lo requiera; la referencia del asset no reemplaza una acción clara.
Crea los character assets ficticios Nadia y Ryo, los scene assets NadiaKitchen y RyoHotelRoom, y los prop assets NadiaPhone, RyoPhone y WaterGlass en My Assets. Vincula sus reference images antes de seleccionarlos mediante
@. El caso siguiente es un ejercicio de diseño original; sus imágenes ilustran composiciones propuestas, no resultados de video verificados.
Separa la línea entrante, la respuesta silenciosa y la réplica
Para un intercambio cuya respuesta no verbal importa, considera tres unidades dramáticas. Pueden recibir cobertura independiente sin convertir cada línea de la llamada en el mismo patrón de tres planos:
Beat 1 — La línea entrante. El interlocutor pronuncia su frase. La cámara cubre el rostro o el cuerpo del hablante. La voz, el encuadre y la nota de interpretación van aquí.
Beat 2 — La respuesta silenciosa. Corta al interlocutor que escucha antes de que hable. Es el beat más descuidado en las escenas telefónicas del drama corto. El oyente está procesando la información y el público lee su rostro para comprender el peso de lo que acaba de decirse. Sin línea. Una sola acción. Una sola emoción.
Beat 3 — La réplica hablada. Ahora el oyente se convierte en el hablante. Quédate con él o elige un encuadre diferente de la misma ubicación. La réplica impacta de otra manera porque el público ya la ha visto formarse.
Usa el beat silencioso cuando cambie la forma en que se entiende la réplica siguiente. No es necesario que aparezca después de cada línea.
Cómo escenificar la conversación telefónica plano a plano
Con los assets construidos y los beats trazados, abre tu Episode y genera un conjunto inicial de Shots con Generate Shots. La IA elaborará una secuencia basada en tu Story Outline. A partir de ahí, revisa cada shot card y modifica o añade Shots para que coincidan con tu plan de beats.
Para cada corte a una nueva ubicación, confirma que la referencia del scene asset esté incluida en el shot card. Usa @ para referenciar explícitamente el personaje y la escena — no vuelvas a describir la habitación desde cero en cada shot card. Usa la referencia de escena recurrente para el espacio ya establecido y luego describe el nuevo ángulo, la acción y el contacto con los objetos relevantes. Genera las imágenes primero y compara ambas habitaciones antes de pasar al vídeo.
Para el beat de reacción en silencio, resiste la tentación de añadir un diálogo. Escribe solo la acción y el encuadre. Una descripción de shot que diga "@Nadia se queda completamente inmóvil, mirando la pared encima del fregadero. La llamada sigue activa pero ella no ha dicho nada. Primer plano de su cara." es más efectiva que rellenarla con narración.
Elige una voz para cada interlocutor y mantén esa elección de forma consistente al preparar los diálogos. En Edit, usa Generate Voiceover para las líneas que necesites y luego escucha los resultados junto a los shots correspondientes. Comprueba tú mismo la identidad del hablante y el registro; una selección de voz no garantiza que cada línea generada tenga la emoción o el ritmo deseados.
En el caso original Coastal Signal, la investigadora marina Nadia llama a su distanciado colaborador Ryo para decirle que su estudio conjunto va a ser cancelado. Ella está en su cocina; él, en un hotel al otro lado del país. Una escena anterior establece que él espera una llamada diferente. Nadia no sabe de qué trata esa otra llamada.
Ejemplo 1 — Frase que recibe el interlocutor, ubicación de Nadia:
Medium locked view of @Nadia at the counter in @NadiaKitchen. @Nadia speaks the line, “The department approved the shutdown this morning. I thought you should hear it from me.” @NadiaPhone stays at her right ear and her left hand remains resting on the counter edge. Keep her delivery level, with no added head turn or hand gesture. A warm overhead lamp separates her face from the dark window. One spoken line, no camera movement or cut.

Ejemplo 2 — Beat de reacción en silencio, ubicación de Ryo:
Medium-close locked view of @Ryo seated on the bed in @RyoHotelRoom. @Ryo slowly sets @WaterGlass on the nightstand while @RyoPhone stays at his left ear. Keep the glass, supporting hand and tabletop fully visible, with his face above the action. He remains silent and his posture otherwise still. Cool window light outlines the glass without obscuring its contact with the table. One placement only, with no jaw clench, second gesture, camera movement, or reply.

Ejemplo 3 — Respuesta hablada, permaneciendo con quien escucha:
Wide locked view across @RyoHotelRoom, with @Ryo still seated on the bed and @WaterGlass resting on the same nightstand. @Ryo speaks, “How long have you known?” in a controlled, slower delivery. @RyoPhone remains at his left ear, and his free hand rests on his thigh. Keep the bed, nightstand and cold window visible to establish the unchanged location. One spoken question only; no standing, walking, new gesture, camera movement, or other caller’s reply.

Qué falla y cómo detectarlo
Un fallo frecuente es la geografía poco clara: el espectador confunde a los interlocutores pensando que comparten una misma habitación. Revisa los shots seguidos sin diálogo. Comprueba los fondos de ubicación, la posición del teléfono y la dirección de la mirada. Cambia el encuadre o la referencia confusa y vuelve a revisar. Unas líneas de mirada similares por sí solas no confirman un error; la pregunta es si el conjunto de pistas hace que cada ubicación sea legible.
El segundo fallo es la pérdida de identidad de voz entre cortes. Escucha el diálogo sin las imágenes. ¿Cada interlocutor sigue sonando como la misma persona en su siguiente línea? Revisa la voz del personaje seleccionada y corrige o reemplaza la línea que rompe la continuidad. Mantén los cambios emocionales motivados por la conversación y escucha la frase de reemplazo en su contexto.
El tercer fallo es ocultar una reacción necesaria. Si se supone que una respuesta disimula la sorpresa pero el público nunca llega a ver esa sorpresa, añade cobertura para la reacción antes de la línea. Compara las duraciones en Edit; la pausa debe revelar algo, en lugar de seguir una regla fija de dos segundos.
Cómo ensamblar la cobertura alternante en Edit
En Edit, organiza la cobertura según quién aporta la siguiente información útil. El ejemplo usa A para la línea de Nadia, B para la acción en silencio de Ryo y luego B de nuevo para su respuesta. Una alternancia estricta A/B interrumpiría esa progresión de forma innecesaria.
Comprueba tres cosas en la secuencia ensamblada:
- Reconocimiento del hablante. ¿Puede el público identificar al instante en qué ubicación se encuentra en cada corte? Si las escenas se parecen, el primer fotograma de cada shot necesita un ancla visual más sólida.
- Causalidad de la respuesta. ¿Cada réplica sigue a una información que el interlocutor realmente ha recibido? Usa una reacción en silencio cuando cambia el significado de la respuesta; una respuesta verbal directa también puede ser clara.
- Continuidad dentro de cada ubicación. Mantén consistentes la mano que sostiene el auricular, los muebles y el estado de los objetos. Si alguien se mueve durante el tiempo omitido por el corte, establece la nueva posición con claridad; no necesitas un plano de desplazamiento para cada movimiento plausible.
Usa Generate Voiceover para las líneas elegidas y revisa el audio con el corte. Un oyente en silencio puede seguir escuchando al otro interlocutor, así que distingue entre «este personaje no está hablando» y «toda la banda sonora está en silencio». No dependas de un efecto de filtro de teléfono sin verificar para identificar al hablante.
Para intercambios en un espacio compartido, consulta la guía de escenas de diálogo. Para planificar voces en todo un reparto, usa la guía de voces para múltiples personajes. Abre tu proyecto de ArcLoop, prepara las dos ubicaciones y prueba la línea, la reacción y la respuesta juntas.
Preguntas frecuentes
¿Necesito dos Episodes separados para cada ubicación? No. Ambas ubicaciones viven dentro del mismo Episode y Storyboard. La separación la gestionan tus scene assets y las descripciones de los shot cards, no la estructura del Episode.
¿Puedo usar el mismo character asset tanto para la versión hablando como para la versión escuchando del mismo personaje? Sí. Un character asset cubre toda la cobertura de ese personaje. Escribe la postura y el estado emocional en la descripción del shot — el asset se encarga de la identidad, y la descripción se encarga de lo que es nuevo en cada shot.
¿Qué hago si el beat de reacción en silencio genera al personaje con la boca abierta? Revisa la descripción del shot para indicar explícitamente que el personaje no está hablando — «en silencio», «no responde» o «sostiene el teléfono sin hablar». Una descripción clara con una sola acción por shot reduce los encuadres ambiguos.
¿La voz fuera de campo necesita un efecto de teléfono? El sonido distante o comprimido es opcional. Primero deja claro quién habla y desde dónde a través de la imagen, el orden de los diálogos y las reacciones. Escucha el audio real en Edit y evita que la historia dependa de un efecto que el resultado generado no haya entregado.





