Crea un presentador de IA, un modelo virtual o un personaje parlante coherente a partir de texto o de una imagen autorizada. Elige Texto a video, Imagen a video o Video parlante según el material de origen que ya tengas.
Paso 1: Abra un modelo público y elija la tarea de video
El problema: APOB incluye varios modos de video, y elegir únicamente por el nombre de la función puede abrir el flujo de trabajo de entrada incorrecto.
Desde la página de inicio de APOB, elija un modelo que esté autorizado a utilizar. Para esta guía, seleccionamos a Miranda, un modelo público de la comunidad, no un modelo personal privado. Abra Video y seleccione de texto a video (Text-to-Video), de imagen a video (Image-to-Video) o video hablado (Talking Video) según el recurso que ya tenga disponible.
Ejemplo práctico: Un creador de contenido que no aparece en cámara y que no tiene un retrato de origen puede comenzar con la opción de texto a video. Un profesional de marketing que ya cuenta con la imagen aprobada de un personaje debe elegir de imagen a video.


Paso 2: Utiliza Texto a Video cuando no tengas una imagen de origen
El problema: Una indicación corta como "mujer presentando un producto" deja sin resolver la identidad, la acción, el entorno y el comportamiento de la cámara.
El espacio de trabajo inspeccionado de Texto a Video mantuvo a Miranda vinculada al campo de descripción y mostró los controles de Audio nativo, Modelo de voz, Estilo artístico, Movimiento de cámara, Vestimenta, Arquitectura, Paisaje, Clima, Elemento, Plantilla y Añadir toma. Describe al personaje, una acción, el entorno, el encuadre, la iluminación y lo que debe permanecer estable. Selecciona la opción de Audio nativo en lugar de asumir que el resultado será silencioso.
Ejemplo realista: Un creador de contenido científico puede pedirle al presentador recurrente que mire a la cámara, haga un pequeño gesto de introducción y haga una pausa en un estudio compacto. Añade una segunda toma solo después de que la primera prueba de identidad y encuadre sea exitosa.
Paso 3: Usar Imagen a video cuando la persona ya está aprobada
El problema: Una referencia recortada, obstruida o no autorizada puede debilitar el movimiento y generar riesgos de privacidad o de derechos de autor.
Elija Seleccionar contenido para reutilizar material autorizado de APOB o Subir imagen para una fuente que tenga derecho a usar. Un rostro despejado, manos visibles cuando sea pertinente y espacio alrededor del cuerpo le dan al modelo un mayor contexto para el movimiento. Dirija el movimiento en lugar de volver a describir cada detalle que ya es visible.
Instrucción probada: El sujeto da un pequeño paso hacia la cámara, relaja los hombros y sonríe de forma natural. Mantenga constantes el rostro, el cabello, la ropa y el fondo. Utilice un acercamiento de cámara lento y sutil, con manos estables y sin movimientos bruscos.
Ejemplo realista: Para una presentación de liderazgo de opinión en LinkedIn, solicite un leve giro de cabeza y un primer plano medio fijo en lugar de una caminata por la oficina.


Paso 4: Elegir entre Avatar Parlante o Sincronización Labial para el habla
El problema: Una imagen estática y un video existente requieren flujos de trabajo de voz distintos.
Avatar Parlante parte de una imagen de referencia y un audio generado o subido. La Sincronización Labial (Lip Sync) parte de un video de referencia existente más un audio generado o subido. En la interfaz analizada de Avatar Parlante, la opción Crear audio ofrecía un modelo de voz y un campo de texto para el guion de hasta 2000 caracteres.
La guía oficial de APOB documenta un rango de audio de 1 segundo a 3 minutos para Avatar Parlante: https://help.apob.ai/en/articles/15699750-talking-video . La guía de Sincronización Labial documenta un rango de 1 segundo a 15 minutos para el video de referencia y el audio: https://help.apob.ai/en/articles/15699765-lip-sync .
Ejemplo práctico: Un equipo de SaaS crea la presentación de un entrenador ficticio de 12 segundos y luego pasa a una grabación de pantalla real para que la explicación siga siendo precisa.
Paso 5: Verifique la duración, la calidad, la visibilidad y los créditos
El problema: Los equipos pueden desperdiciar créditos o exponer recursos no publicados al asumir que todos los modos tienen el mismo costo o estado de privacidad.
En nuestra prueba anterior de Imagen a Video, la configuración seleccionada mostraba cinco segundos, 720P, opciones Fast/Ultra/UltraS, 200 créditos por segundo y una estimación de 1,000 créditos. Estas son observaciones de una cuenta y sesión específicas, no tarifas fijas ni derechos del plan. Verifique el audio nativo, la voz seleccionada y el estado de visibilidad antes de generar.
Ejemplo práctico: Un vendedor de moda prueba un giro moderado de cinco segundos antes de producir un catálogo con múltiples atuendos. Esto confirma el encuadre y la identidad antes de realizar un mayor compromiso de créditos.

Paso 6: Genera, confirma la visibilidad y revisa cada fotograma
El problema: un clip puede parecer convincente a velocidad normal aunque contenga una mano distorsionada, una etiqueta de producto que cambia, un rostro inconsistente o una demostración engañosa.
Nuestra prueba de imagen a video de cinco segundos se completó en aproximadamente dos minutos y apareció en Generación con una etiqueta Pública. El tiempo varía según el modelo, la calidad y la cola de espera. Revise la continuidad del rostro y el cabello, la dirección de la mirada, los dientes, los hombros, las manos, el contacto con objetos, la estabilidad del fondo, el movimiento de la cámara y el primer y último cuadro.
Ejemplo realista: si un presentador parece presionar el dosificador de un producto de belleza pero el envase cambia de forma, conserve al presentador para el gancho de voz y corte a tomas reales del producto para la aplicación. No utilice interacciones sintéticas como prueba de la eficacia del producto.
Prompts expertos para videos humanos con IA
Presentador de comercio electrónico (propósito: gancho de producto vertical sin alterar el artículo suministrado). Instrucción: Una presentadora ficticia de organización del hogar aparece de cintura para arriba en una cocina de apartamento luminosa, sosteniendo a la altura del pecho el organizador de cajones compacto suministrado. Lo eleva una vez, señala el divisor ajustable con un gesto medido y vuelve a colocar ambas manos en una posición estable. Luz natural suave, manos realistas, cámara fija en formato 9:16 con un sutil acercamiento (push-in). Preservar rostro, cabello, camiseta de punto color crema, forma del producto, etiqueta, color y posición del divisor. Sin dedos adicionales, cambios de etiqueta ni movimientos rápidos. Resultado esperado: un inicio de cinco segundos enfocado para TikTok o Reels.
Presentador científico recurrente (propósito: toma de presentador repetible para Shorts). Instrucción: El mismo presentador científico ficticio, de unos veintitantos años, cabello corto, oscuro y rizado, gafas redondas, sobrecamisa azul marino, de pecho para arriba en un estudio compacto con un modelo molecular suavemente iluminado. Mira a la cámara, levanta una mano ligeramente y luego vuelve a una posición neutral. Cámara fija en formato 9:16. Preservar rostro, gafas, cabello, vestuario, iluminación y fondo. Un solo gesto. Resultado esperado: una toma de gancho o transición reconocible.
Presentador de inducción/onboarding (propósito: convertir el retrato aprobado de un instructor en una introducción hablada). Guion: Bienvenido al panel de control. En esta lección, crearemos una campaña, asignaremos a su propietario y verificaremos el estado de aprobación antes de publicar. Mantenga esta ventana abierta y siga los pasos resaltados en la pantalla. Resultado esperado: una breve introducción del presentador que da paso a una grabación de pantalla precisa.
Giro de catálogo de moda (propósito: mostrar la silueta con un movimiento contenido). Instrucción: Modelo de moda ficticia de cuerpo completo con la chaqueta gris carbón y los pantalones negros de corte recto suministrados, fondo neutro de galería de arte, luz direccional suave. Da un paso lento, gira 30 grados a la izquierda y hace una pausa mostrando ambas manos. Cámara estática de plano medio-ancho en formato 9:16. Preservar el color de la prenda, las costuras, los botones, las proporciones, el rostro y el cabello. Resultado esperado: un clip de catálogo controlado; genere una vista trasera separada en lugar de una rotación completa de 360 grados.
Mantenga a una persona reconocible a lo largo de contenidos relacionados. Por ejemplo, un presentador de viajes recurrente puede aparecer en consejos de aeropuertos, explicaciones de hoteles y videos de destinos sin necesidad de redefinir su identidad en cada prompt. Tenga en cuenta que la coherencia sigue dependiendo de la calidad de la referencia, el ángulo, la iluminación, el modelo y la complejidad del movimiento.
Avance desde la identidad hacia el movimiento y el habla en flujos de trabajo conectados. Apruebe al personaje ficticio antes de consumir créditos en animación, locución o variantes de campaña.
Pruebe una variable creativa sin necesidad de repetir un rodaje físico. Mantenga estables al presentador y la oferta mientras compara un gancho centrado en el problema, enfocado en el producto o basado en una demostración. No utilice este flujo de trabajo para inventar experiencias de clientes o testimonios.
Consulte la estimación de generación antes de comprometerse. La interfaz de prueba mostraba una tarifa por segundo y un cálculo total junto al botón Generar; confíe siempre en la estimación actual de la aplicación.
Trabaje dentro de las limitaciones visibles. Los controles de movimiento, calidad, cámara, audio y tomas adicionales no eliminan la necesidad de revisar detalles como las manos, el contacto con objetos, la identidad, los derechos, la transparencia sobre IA y la precisión del producto.
Pruebe tres ganchos de TikTok Shop con un solo presentador de ficción. Mantenga estables el presentador, la oferta y el metraje del producto, cambiando solo la primera línea o el gesto. La investigación de HubSpot de 2025 identifica los videos de formato corto como el formato de contenido más utilizado por los especialistas en marketing y el formato que más a menudo se asocia con el ROI más alto: https://blog.hubspot.com/news-trends/content-trends-global-preferences
Presente productos de comercio electrónico sin inventar pruebas de producto. Use la persona IA para el gancho y la transición, luego corte a imágenes o metraje precisos del producto para mostrar el color, las dimensiones, el ajuste, el ensamblaje y el rendimiento.
Cree una serie recurrente de creadores de ficción. Mantenga una guía de personaje para el rostro, el cabello, el vestuario, el tono, las declaraciones de divulgación y las afirmaciones restringidas. IAB proyectó que el gasto publicitario en la economía de creadores en EE. UU. alcanzaría los 37 000 millones de dólares en 2025 e informó que tres de cada cuatro marcas utilizaban o planeaban utilizar IA para tareas de marketing de creadores: https://www.iab.com/insights/2025-creator-economy-ad-spend-strategy-report/
Agregue un presentador a los Shorts de YouTube sin rostro. Utilice un presentador de ficción para la apertura y la conclusión, con material de archivo (B-roll) autorizado, diagramas o demostraciones reales entre líneas. YouTube informa que los Shorts promedian más de 200 000 millones de vistas diarias: https://blog.youtube/press/
Cree un catálogo (lookbook) de concepto de moda controlado. Anime un paso o un giro parcial por clip y revise los bordes de la prenda, las manos, la silueta y el color. No reemplace las imágenes precisas del producto cuando el ajuste o el material afecten la compra.
Localice la inducción de productos con un entrenador de ficción. Mantenga la grabación de pantalla aprobada sin cambios y cree breves presentaciones del entrenador en diferentes idiomas. Utilice un revisor calificado para la terminología técnica, regulada o relacionada con la seguridad.
Menor dependencia de las sesiones de rodaje: ideal para conceptos, introducciones recurrentes, ganchos y variaciones creativas que no requieren una demostración física real.
Identidad reutilizable: un personaje ficticio aprobado puede dar cohesión a una serie de videos a través de distintas escenas y formatos.
Pruebas controladas: modifique un solo elemento a la vez, ya sea un gancho, un gesto, el fondo o el encuadre.
Composición adaptada a cada plataforma: planifique tomas en formato vertical, cuadrado, de lectura de pantalla ochentera (feed) o de paisaje antes de la generación.
Opciones de voz integradas: el Avatar Parlante se crea a partir de una imagen estática, mientras que la Sincronización Labial funciona tanto con metraje existente como con audio nuevo.
Los detalles humanos pueden fallar: las manos, los dientes, la dirección de la mirada, el cabello, la ropa y el contacto con los objetos requieren una revisión minuciosa.
La coherencia no está garantizada: los nuevos ángulos, la iluminación, los modelos y las acciones complejas pueden alterar el aspecto de la persona.
Las secuencias largas son más difíciles de controlar: los guiones y las acciones suelen funcionar mejor si se dividen en tomas cortas.
Los créditos y los límites varían: el costo, la duración, la calidad y los controles dependen de la cuenta y del modo activo.
El creador del contenido sigue siendo el único responsable de obtener el consentimiento, así como de las reclamaciones, los derechos de autor, la divulgación, la privacidad y el cumplimiento de las normas de las plataformas.
No se requiere tarjeta de crédito
Flujo de trabajo, calidad, créditos, privacidad, uso comercial y compatibilidad con plataformas
¿Puede la IA crear un video de una persona?
Sí. Puede generar una persona ficticia desde una descripción o animar una imagen autorizada. Revisa cada resultado antes de publicarlo.
¿Cómo creo un video humano a partir de una foto?
Sube una imagen clara que te pertenezca o para la que tengas permiso, elige Imagen a video y describe una acción limitada y un movimiento de cámara.
¿Puedo empezar sin una foto?
Sí. Crea un personaje ficticio de APOB o usa Texto a video. Define identidad, entorno, acción, encuadre y formato antes de producir una serie.
¿Puedo hacer que la persona de IA hable?
Sí. Usa Avatar parlante para animar una imagen facial o Sincronización labial para adaptar un video existente a un audio nuevo.
¿Cuál es la diferencia entre Avatar parlante y Sincronización labial?
Avatar parlante anima una imagen fija con audio. Sincronización labial conserva el video y ajusta el movimiento de la boca al audio nuevo.
¿Pueden Texto a video o Imagen a video incluir audio?
Los espacios de trabajo de modelos públicos que revisamos mostraban un control de Audio nativo, y Texto a video también incluía un control de Modelo de voz. La disponibilidad depende del modelo y la configuración seleccionados. Comprueba el control antes de generar.
¿Cuál es el mejor generador gratuito de videos humanos con IA?
La mejor opción depende del material de origen, la coherencia de identidad, el flujo de voz, los derechos de uso, la visibilidad, la resolución y el coste total en créditos. Prueba la tarea exacta con un recurso autorizado, en lugar de comparar solo las promesas de las páginas de inicio.
¿APOB es un generador de videos humanos con IA 100 % gratuito?
APOB utiliza créditos para la generación y ofrece formas de empezar sin comprar un paquete de producción completo. No debe describirse como ilimitado ni permanentemente gratuito. Consulta https://app.apob.ai/subscription y la estimación actual junto a Generar.
¿Puede ChatGPT crear un video humano con IA?
ChatGPT puede ayudar a preparar un concepto, guion, lista de planos o prompt de movimiento, según el producto y el plan. APOB proporciona el flujo de identidad, imagen, movimiento, avatar parlante y sincronización labial descrito en esta página. Comprueba las funciones actuales de cada producto.
¿Puedo usar la misma persona en varios videos?
Sí. Reutiliza el mismo personaje de APOB o una referencia autorizada y mantén estable el bloque de identidad en tus prompts. Los resultados pueden variar según el ángulo, la iluminación, el modelo y la complejidad del movimiento; revisa cada clip.
¿Cómo se calculan los créditos de video?
La aplicación muestra la tarifa y el total estimado antes de generar. El coste depende del modo, la duración, la calidad y la configuración elegida.
¿Por qué no está disponible el botón Generar?
Generar permanece inactivo hasta que el modo recibe todos los datos obligatorios. Imagen a video necesita una imagen de referencia y una descripción de movimiento; Avatar parlante necesita una imagen y un guion o audio; Sincronización labial necesita un video de referencia y audio. Las cargas fallidas o incompletas también pueden bloquear la generación.
¿Puedo usar comercialmente los videos generados con APOB?
Depende de los términos vigentes de APOB y de los derechos sobre la imagen, voz, música, marcas y demás materiales de entrada.
¿Mis videos humanos son privados?
No lo des por hecho. Comprueba la etiqueta de visibilidad del modelo y del resultado; algunos modelos públicos muestran los resultados como públicos.
¿Cómo consigo un resultado más realista?
Usa una referencia clara, pide una sola acción, limita el movimiento de cámara y revisa el clip fotograma a fotograma.
¿Qué relación de aspecto debo elegir?
Usa 9:16 para TikTok, Reels y Shorts; 16:9 para YouTube estándar, sitios web y formación; y 1:1 o 4:5 para ubicaciones de feed compatibles. Confirma las especificaciones del destino antes de generar.
¿APOB funciona para TikTok, Instagram y YouTube?
Sí. El flujo puede crear clips de origen para esas plataformas. Exporta y edita según los requisitos actuales de cada plataforma sobre relación de aspecto, duración, subtítulos, publicidad, música y contenido sintético.
¿Debo indicar que la persona fue generada por IA?
Depende de la plataforma, la jurisdicción y el contexto. Sigue las reglas actuales y no presentes un personaje ficticio como una persona real.
