Convierte el retrato de tu personaje en un vídeo corto con voz. Añade el audio, consulta los créditos estimados y revisa el resultado antes de exportarlo. Explora el proceso de APOB y compáralo con HeyGen.
Este recorrido utiliza a Mara, una presentadora de moda ficticia y original, y la frase breve «One jacket, two looks.». Empieza con esta pequeña prueba antes de planificar una introducción más larga para un lookbook.
1. Sube tu personaje y confirma con Save
Abre APOB e inicia sesión. En la pantalla de inicio, elige Continue with No Model; en la barra lateral, la misma entrada se llama Quick Start with no model. En el espacio de trabajo, selecciona Talking video → Talking Avatar.
Elige Upload image, selecciona el retrato, espera a que termine la carga y haz clic en Save. La imagen debe aparecer en Reference image. Select content es la alternativa para una imagen que ya está disponible en la aplicación.
Para Mara usamos un retrato frontal con la boca despejada. Una vista previa no demuestra por sí sola que la carga haya terminado correctamente: durante este recorrido falló una carga y Save permaneció gris. Al reintentarlo en un navegador normal, la carga se completó. Confirma que la imagen de referencia esté seleccionada antes de continuar. Para crear un personaje nuevo, empieza con el generador de influencers con IA.


2. Elige cómo proporcionar la frase hablada
Para convertir texto en voz, permanece en Create audio, elige un Voice model e introduce en Script únicamente las palabras que se pronunciarán:
One jacket, two looks.
Nuestra configuración utiliza la voz integrada Leah, Overall mood: None y Speed: 1.0×. En esta ejecución no creamos un modelo de voz personalizado ni subimos una grabación.
Si ya tienes una grabación de voz autorizada, cambia a Select audio → Click to upload audio. Para preparar y escuchar primero una toma reutilizable, elige Select audio → Generate audio, escúchala en History y selecciona el audio terminado. Esa preparación independiente puede tener su propio cargo. Proceso de audio reutilizable.
Deja instrucciones como «cortar al plano de la chaqueta» en tus notas de edición. No son diálogo hablado. Elige una voz adecuada para el idioma del guion y revisa la pronunciación antes de producir un vídeo más largo.
3. Espera a que se calcule el coste definitivo antes de generar
Selecciona valores compatibles de Quality y Resolution. Los controles examinados muestran Best / 720P, Ultra / FHD y UltraS / 720P, FHD o QHD.
Nuestra estimación inicial era de aproximadamente tres segundos y 60 créditos. Tras el cálculo, pasó a ser de 2 segundos × 20 créditos/segundo = 40 créditos cotizados. El símbolo ≈ distingue la estimación provisional del cálculo terminado.
Cambiar la velocidad del habla modifica la duración y activa un nuevo cálculo. Si al pulsar Generate se solicita calcular la duración, espera a que termine y revisa el coste resultante antes de volver a pulsar. Funcionamiento del cálculo de créditos.
Presupuesto de intentos = todos los costes de generación cotizados + la preparación cobrada por separado. Tres intentos con el mismo coste cotizado requieren un presupuesto de 3 × ese coste, más la preparación. Una cotización no es un recibo: consulta Profile → Credit usage table → View all → Used para ver las deducciones. Los BONUS UltraS credits específicos solo sirven para tareas elegibles. Historial y saldos de créditos.


4. Abre el resultado y revisa la toma completa
Después de enviar la solicitud, espera a que termine la tarea en Generation y haz clic en su miniatura. Si primero se abre una vista previa, selecciona Details. Activa el sonido con el icono del altavoz. Compara los valores guardados de Voice model, Speed, Quality, Resolution y Script con la configuración que querías usar.
Reproduce el vídeo completo con sonido. Revisa la sincronización de la boca, la forma del rostro, los dientes, las primeras y últimas palabras y el encuadre previsto. Examina toda la toma; no la des por buena por un solo fotograma. Revisa también los elementos inesperados, como los movimientos de las manos.
Si una toma no funciona, anota el problema y cambia solo una entrada o un ajuste cada vez. Cuando agotes el presupuesto para intentos, revisa el retrato o el audio antes de repetir la generación. Una frase corta de prueba no permite validar todos los personajes ni los guiones más largos.
5. Descarga el archivo y comprueba los requisitos de entrega
En un ordenador, abre More actions → Download. Guarda el archivo y reprodúcelo localmente. Si la descarga aún no está lista, espera a que terminen la generación y la preparación del archivo. Controles de contenido y descarga.
Comprueba las dimensiones reales, la duración, el sonido y las condiciones de la marca de agua. La etiqueta 720P de la interfaz no sustituye la medición del archivo descargado: el ejemplo de este recorrido tiene 624 × 816 a 25 fps, está en formato MP4 H.264/AAC y contiene aproximadamente 2,005 segundos de vídeo.
Para el lookbook de Mara, añade planos de las prendas y subtítulos por separado en la edición final. El retrato parlante presenta el conjunto; no demuestra el movimiento real de la tela ni cómo queda la prenda. Verifica que la exportación final cumpla los requisitos de destino antes de sustituir un proceso más amplio.
Utiliza una imagen autorizada y una toma de audio breve. Comprueba el coste cotizado antes de generar.
¿Por qué considerar APOB para un proceso de personajes que ya utilizas?
Vale la pena evaluar APOB si ya preparas allí las imágenes o la voz de tus personajes. Selecciona una imagen aprobada, elige una toma de audio y revisa el coste de generación antes de confirmar. Estos pasos documentados permiten evaluar un clip concreto; no demuestran una ventaja de calidad o coste frente a HeyGen. Entradas de imagen y voz, audio reutilizable.
¿Qué herramienta se ajusta a la tarea que quieres sustituir?
Tu próxima tarea | Proceso documentado que puedes considerar | Criterio para decidir |
|---|---|---|
Hacer hablar al retrato de un personaje | APOB Talking Avatar o HeyGen Avatar IV | Ambos aceptan personajes basados en imágenes y voz. Evalúa tus resultados reales. |
Cambiar la voz de un vídeo de personaje existente | Lip Sync de APOB | Un vídeo con audio de sustitución utiliza una entrada distinta de un retrato estático. |
Traducir material de vídeo existente | Video Translator de HeyGen | Añadir diálogo de sustitución no traduce por sí solo un vídeo. |
Crear un avatar personal a partir de vídeo | Avatar V de HeyGen | Evalúa el proceso basado en una persona grabada cuando sea central para el proyecto. |
Entregar contenido de formación SCORM | Exportaciones Business o Enterprise de HeyGen | Conserva un proceso de entrega al LMS que funcione mientras evalúas un clip parlante independiente. |
Estos son puntos de partida documentados, no un inventario completo de funciones. En esta revisión no se establecieron procesos equivalentes de APOB para traducción, avatares personales o SCORM. La comparación de sincronización labial, estabilidad, velocidad y coste sigue sin haberse probado.
¿Qué debes conservar de un proyecto de HeyGen?
Prepara el retrato original y sus permisos, el guion, un audio que pueda usarse de forma independiente, el texto de los subtítulos, el encuadre y las especificaciones de archivo necesarias. Tener acceso a un proyecto de HeyGen no demuestra que su avatar o archivo de proyecto pueda transferirse a APOB; la portabilidad sigue sin verificarse.
Evalúa una introducción autónoma antes de sustituir un proceso más amplio. Registra el gasto total y las tomas aceptadas. Los créditos de distintos productos no son unidades monetarias equivalentes: cualquier comparación de costes necesita los precios reales de los planes, las condiciones de facturación asumidas y todos los intentos.
Utiliza los prompts de imagen en Generate Image; la documentación llama a su editor Chat to generate, mientras que la interfaz de escritorio probada también mostraba Description. Introduce las frases habladas en Script o grábalas. Selecciona los controles de producción por separado: Create audio integrado incluye Overall mood, + Mood y Speed; el diálogo de audio independiente utiliza Emotion. Editor de imágenes, Talking Avatar, Diálogo de audio.
Creadora de moda: prepara el retrato de la presentadora
Propósito y campo: Crea una referencia con espacio para subtítulos en el cuadro del prompt de imagen.
Retrato editorial de pecho hacia arriba de una presentadora virtual de moda adulta y original, melena corta cobriza, chaqueta gris carbón sobre una camiseta crema, mirando a cámara, boca relajada y cerrada, rostro iluminado uniformemente, fondo de estudio liso gris cálido. Deja espacio despejado bajo los hombros para un subtítulo. Sin texto, logotipos de marcas, micrófono ni manos que tapen la cara.
Resultado y controles separados: Un retrato candidato. Selecciona la relación de aspecto y la calidad de imagen en la interfaz; examina el encuadre antes de animarlo.
Creador de ficción: define un narrador original
Propósito y campo: Define a un archivista en el cuadro del prompt de imagen.
Archivista ficticio adulto y original con gafas redondas, pelo oscuro muy corto y cárdigan color óxido. Composición frontal de pecho hacia arriba, ambos ojos y toda la boca visibles, estanterías suavemente desenfocadas detrás, luz cálida de escritorio equilibrada con luz frontal suave. Expresión serena. Sin parecido con un actor identificado, sin texto ni sombras intensas sobre la boca.
Resultado y controles separados: Un retrato de narrador. Elige el formato por separado, añade los gráficos del título durante la edición y revisa las gafas y los detalles faciales en el resultado parlante.
Profesional de marketing de comercio electrónico: responde sin un testimonio falso
Propósito y campo: Introduce indicaciones de cuidado verificadas en Script o en una grabación de voz.
¿Te preguntas cómo cuidar tu nueva bolsa? Empieza por su etiqueta de cuidados. Consulta las instrucciones antes de elegir un ciclo de lavado y conserva la etiqueta para más adelante.
Resultado y controles separados: Una introducción de mascota para preguntas frecuentes. Confirma los datos del producto, selecciona la voz y añade planos reales de la etiqueta durante la edición.
Editor de redes sociales: compara dos mensajes de apertura
Propósito y campo: Genera dos opciones de voz a partir de Script o de audio grabado.
Guion A:
Antes de elegir el conjunto, mira su silueta. Esta combinación parte de una prenda estructurada y deja el resto relajado.
Guion B:
¿Qué detalle hace que este conjunto parezca equilibrado? Empieza por la chaqueta y sigue la línea hasta los pantalones.
Resultado y controles separados: Dos opciones editoriales. Mantén fijos el personaje y los ajustes de entrega. La preferencia del público requiere una prueba de audiencia independiente.
Productor: comprueba la pronunciación antes del clip principal
Propósito y campo: Usa Script o audio grabado para comprobar un título y consonantes repetidas.
Bienvenidos a The Midnight Archive. Antes de que empiece la historia, imagina un sobre de papel azul junto a una campana de latón.
Resultado y controles separados: Una toma de diagnóstico. Aprueba primero la pronunciación y después examina los movimientos de los labios durante la reproducción, antes de producir la introducción completa.
Utiliza un retrato aprobado, una frase hablada y un presupuesto fijo de intentos. Evalúa el resultado guardado según tu encargo de publicación antes de cambiar el resto del proceso. Para planos de movimiento independientes, explora Image to Video.
Empieza tu prueba de vídeo de personaje
Acerca de esta comparación: Preparada para APOB AI con investigación y redacción asistidas por IA. El 10 de septiembre de 2026, un agente de IA que operaba en Codex completó dos ejecuciones de APOB Talking Avatar con el mismo retrato ficticio original y la misma frase hablada; esta guía ilustrada muestra la segunda ejecución. El retrato de entrada y la portada OG se crearon con otra herramienta de generación de imágenes. Las cotizaciones conservadas, las descargas normales, las comprobaciones de archivos y las transcripciones automáticas respaldan el recorrido. Las deducciones reales siguen sin confirmarse; no se afirma que haya habido una revisión auditiva humana ni una prueba de rendimiento equivalente en HeyGen. Las capacidades de HeyGen se revisaron mediante su documentación oficial.
Autoriza el uso de rostro y voz. Obtén permiso explícito y verificable para usar la imagen y la voz de una persona real, incluidos el mensaje previsto, la campaña y el procesamiento con IA. Poseer una fotografía no implica necesariamente permiso para hacer hablar a quien aparece en ella. Condiciones de APOB.
Comprueba los derechos de entrada y las condiciones del servicio. Revisa las ilustraciones, la música, los guiones y los materiales del producto. Las condiciones de APOB reconocen la propiedad del contenido generado en la medida permitida por la legislación aplicable, sujeta a derechos de terceros y a una licencia de servicio amplia y continua que abarca modelos y contenido generado, incluidos usos promocionales. Confirma su compatibilidad con los contratos de clientes. Derechos de contenido, secciones 5.1–5.2.
Utiliza los avisos adecuados. YouTube utiliza AI use para el contenido realista con IA que cumple sus criterios; TikTok también exige identificar las imágenes, el audio y los vídeos realistas generados. YouTube, TikTok.
Mantén las recomendaciones veraces. Aclara el papel de la presentadora virtual cuando pueda confundir al público. No inventes experiencias de clientes. TikTok también exige identificar el contenido comercial cuando es promocional; ese aviso tiene una finalidad distinta de la etiqueta de IA. Aviso de contenido comercial.
Comprueba los requisitos de confidencialidad del cliente. La visibilidad, el uso para entrenamiento y la conservación son cuestiones distintas. Resuélvelas antes de subir archivos; la pregunta sobre privacidad de abajo explica las condiciones correspondientes. Política de privacidad.
Estos son ejemplos de producción, no resultados de clientes. Las duraciones son objetivos: mide el audio y respeta los límites del modo seleccionado.
Una presentadora virtual de moda introduce el próximo lookbook
Una creadora de moda independiente necesita que Mara presente una serie de estilismo a seguidores que están decidiendo si verla. Utiliza un retrato de estudio aprobado y busca una introducción vertical de 12–18 segundos.
Guion hablado: «Soy Mara, tu presentadora virtual de estilo. Hoy combinamos una chaqueta estructurada con pantalones de pernera ancha. Mira los siguientes planos para ver los detalles».
El clip presenta a la anfitriona y el tema. Añade planos de las prendas por separado para mostrar detalles o ajuste; la introducción del avatar no demuestra cómo queda una prenda real.
Un narrador ficticio abre una historia de misterio en YouTube Shorts
Para The Midnight Archive, utiliza un retrato original de un narrador adulto y una voz recurrente aprobada. Busca una apertura de 10–15 segundos que deje claro a los aficionados al misterio que se trata de ficción.
Guion hablado: «Esta noche en The Midnight Archive: un farero recibe una carta fechada mañana. Un detalle del sobre lo cambia todo».
Añade el título durante la edición y continúa con escenas de la historia por separado. Mantén el vídeo completo, cuadrado o vertical, dentro del límite de tres minutos para cumplir los requisitos de Shorts de YouTube; la apertura es solo una parte de esa duración. Requisitos de Shorts.
Una mascota de marca responde una pregunta sobre el cuidado de una bolsa
Un equipo de comercio electrónico necesita una respuesta práctica para sus clientes actuales. Parte de una ilustración de mascota propiedad de la marca, con la boca visible, y busca un clip de preguntas frecuentes del producto de 10–15 segundos.
Guion hablado: «Antes de limpiar tu bolsa, consulta la etiqueta de cuidados del interior. Allí están las instrucciones para este tejido. Tenla a mano para el próximo lavado».
Confirma que el producto tenga la etiqueta descrita y muestra un primer plano real. Prueba la boca estilizada antes de producir más respuestas. La mascota puede comunicar información aprobada; no debe hacerse pasar por un cliente satisfecho.
Reutiliza entradas aprobadas. Las ilustraciones de personajes guardadas y el audio terminado pueden servir como material de origen para la prueba.
Revisa el gasto previsto. La cotización muestra el coste de la configuración seleccionada antes de enviar la tarea.
Separa las decisiones de producción. Aprueba la pista de voz antes de evaluar un rostro animado.
Los reintentos suman costes. Presupuesta todos los intentos y la preparación cobrada por separado, no solo la toma aceptada.
Los clips cortos tienen límites. El máximo documentado de Talking Avatar es de tres minutos; los proyectos más largos necesitan otro planteamiento. Límites de duración.
El acabado sigue siendo necesario. Los planos de apoyo, los subtítulos y las comprobaciones de entrega quedan fuera de la tarea de hacer hablar a un retrato.
No se requiere tarjeta de crédito
¿Es APOB una alternativa a HeyGen para avatares parlantes?
Es una opción para evaluar un retrato estático de personaje con voz. HeyGen también admite personajes basados en fotos y personajes virtuales, por lo que la entrada de personajes no es por sí sola una ventaja exclusiva. Compara tu proceso real y el resultado aceptado. HeyGen Avatar IV.
¿Cuándo debería seguir usando HeyGen?
Tenlo en cuenta si dependes de avatares personales basados en vídeo, de la traducción de material existente o de exportaciones de formación SCORM elegibles. Un retrato que habla brevemente no sustituye esos requisitos.
¿Puedo probar APOB sin una suscripción de pago?
El plan Nano tiene una recarga diaria de 80 créditos. Comprueba el coste exacto y el saldo elegible para el clip elegido; la asignación diaria no garantiza una duración o un número de intentos determinados. Guía de planes y créditos.
¿Cómo sé cuánto costará mi vídeo?
Lee el coste cotizado definitivo después de elegir voz, guion, velocidad, calidad y resolución. Añade la preparación cobrada por separado. Nuestra configuración de dos segundos cotizó 40 créditos; el registro de la cuenta actualizado no mostraba una deducción correspondiente, por lo que es una cotización, no un gasto confirmado. Las suscripciones actuales aparecen en Pricing o Upgrade.
¿Dónde consulto los cargos por reintentos o los reembolsos?
Presupuesta cada nueva generación como otro intento. En Profile → Credit usage table → View all, Used filtra deducciones y Added muestra adiciones. Una entrada REFUNDED indica créditos devueltos; una toma no deseada no da por sí sola derecho a un reintento gratuito. Historial de facturación.
¿Puedo subir mi voz o crear un modelo de voz personalizado?
Sube una grabación autorizada mediante Select audio. Crear un modelo de voz personalizado reutilizable es una tarea aparte; la guía de APOB exige Macro o un plan superior. Las grabaciones de origen para ese modelo deben durar entre 10 y 90 segundos; no confundas ese intervalo con los límites de audio del vídeo parlante. Modelos de voz.
¿Cuánto puede durar el clip parlante?
El intervalo documentado es de 1–180 segundos, y de 4–180 segundos para UltraS. Por tanto, nuestro guion de dos segundos no constituye una prueba de UltraS. Usa la duración exacta del audio sintetizado o seleccionado al elegir el modo. Límites de Talking Avatar.
¿Una calidad más alta garantiza mejor sincronización labial?
Esta revisión no estableció ese resultado. Elige un nivel compatible con los requisitos de entrega y examina el rostro y la voz. Mide también las dimensiones en píxeles del archivo exportado: las de nuestro ejemplo descargado diferían de la etiqueta de la interfaz. Aquí no se han comparado los niveles de generación.
¿Por qué Generate sigue desactivado o me pide esperar?
Primero confirma que la imagen haya terminado de cargarse y que se haya proporcionado la entrada de voz necesaria. Para texto hablado, elige una voz y limita el guion a 2.000 caracteres visibles. Una cotización exacta caducada o pendiente puede activar un cálculo en vez de una generación. Lee el mensaje recibido antes de reintentarlo. Comprobaciones de generación.
¿Por qué mi vídeo terminado no tiene sonido en la vista previa?
El reproductor comienza silenciado por las restricciones de reproducción automática del navegador. Haz clic en el icono del altavoz para activar el sonido. La guía oficial indica que este control aparece cuando el contenido tiene audio; si no aparece, revisa el resultado seleccionado y su archivo, en lugar de suponer que todos los vídeos incluyen una pista de sonido. Ayuda de reproducción.
¿Tendrá marca de agua mi descarga?
La guía oficial exige marca de agua en las descargas de Nano y en el contenido generado originalmente con una cuenta gratuita, incluso después de mejorar el plan. Los fotogramas examinados no mostraron una marca evidente; es una observación específica de la cuenta aún sin resolver, que no demuestra acceso sin marca de agua. Confirma los requisitos de entrega sin marca antes de generar. Condiciones de marca de agua.
¿Puedo usar el resultado comercialmente?
Las condiciones de APOB contemplan el uso creativo comercial, sujeto a sus requisitos y a los derechos sobre tus entradas. Una cuenta de pago no resuelve los derechos de imagen, autoría, recomendaciones comerciales ni las obligaciones de contratos con clientes. Obtén permiso para rostros y voces reales y presenta de forma veraz el papel de la presentadora virtual. Condiciones.
¿Son privados mis archivos y puedo eliminarlos?
El modo privado exige un plan de pago y Nano no permite ocultar contenido que ya es público. Para eliminar un elemento de tu propiedad, abre sus detalles y elige More actions → Delete. Eliminar la cuenta es una acción aparte y permanente en Profile → Account settings. Siguen aplicándose las excepciones de conservación de la política, incluida la posible conservación de modelos públicos populares. La visibilidad no demuestra exclusión de los usos para entrenamiento de IA/ML previstos en la política. Visibilidad y eliminación de contenido, eliminación de cuenta, Política de privacidad.
¿Puedo publicar el clip en TikTok o YouTube Shorts?
Comprueba que el archivo real y la edición final cumplan los requisitos de la plataforma. Los Shorts de YouTube cuadrados o verticales que cumplen los criterios pueden durar hasta tres minutos. Añade subtítulos legibles, los planos de apoyo necesarios y los avisos obligatorios de contenido sintético o comercial. Un archivo con formato de retrato no es automáticamente una exportación 9:16. Especificaciones de Shorts, Aviso de IA en TikTok.
¿Qué ocurre si ya tengo un vídeo de personaje?
Utiliza el vídeo de origen y un audio de sustitución autorizado con Lip Sync. Talking Avatar parte de una imagen estática. Ni proporcionar una pista nueva ni cambiar el movimiento de la boca traduce automáticamente el diálogo original. Selección del modo.












