Hacer un video musical con IA suena sencillo hasta que te sientas a hacerlo. En mi caso fueron 3.000 créditos, más de 15 escenas fallidas y unas 9 horas de trabajo desde cero, incluyendo la edición. Y eso con experiencia.
Este artículo no es una promesa de que es fácil. Es el proceso real de cómo creé un videoclip completo usando Seedance 2.0 4K dentro de Higgsfield, con lipsync en dos idiomas, consistencia de personaje en todas las escenas y un flujo de trabajo que puedes replicar. Lo que falló, cómo lo resolví y qué haría diferente la próxima vez.
Si prefieres ver el proceso completo en video, lo tienes aquí:
Y si quieres ver el resultado final, el videoclip completo está en Instagram de Arca Artificial. Aquí encontrarás los prompts listos para copiar, los costes reales y los trucos técnicos que no caben en 27 minutos de grabación.
Si ya leíste el artículo anterior sobre lipsync con Seedance 2.0 en Magnific, este es el mismo flujo pero aplicado a Higgsfield, con diferencias técnicas importantes que vale la pena conocer.
Video musical con IA Higgsfield tutorial: por dónde empezar
El primer error que comete la mayoría es empezar por el personaje o por las escenas. El punto de partida correcto es la canción. Siempre.
¿Por qué? Porque la canción te dice todo lo que necesitas saber antes de generar una sola imagen: cómo estructurar el video en escenas, qué va en cada parte, dónde va a haber lipsync y dónde no. Sin esa referencia, generas a ciegas.
En mi caso no tenía canción propia, así que me fui a Suno. Escribí la letra con ayuda de Claude, inspirándome en el estilo Kawai Metal, mezclando japonés con español. El estilo lo define todo en el prompt de Suno: en este caso puse 190 BPM, que es la velocidad a la que va la canción. Este dato importa más de lo que parece, y te explico por qué cuando lleguemos al lipsync.
Estoy usando Suno 5 Pro para sacar el máximo potencial del modelo. Entre todas las versiones que generé me quedé con una y a partir de ahí empecé a trabajar en el resto.
Crear el personaje y el character sheet
Con la canción lista, me enfoqué en el personaje. Para la imagen base usé Midjourney 8.1 en modo estándar con aspecto ratio vertical, buscando algo fotorrealista. El modo HD daba resultados demasiado plásticos, así que bajé al estándar hasta conseguir una imagen que me convenciera por la piel y los colores.
Una vez tienes al personaje, el siguiente paso es el character sheet: la ficha visual que vas a usar como referencia en cada escena para mantener la consistencia. Sin esto, el personaje va cambiando poco a poco entre tomas hasta que al final parece otra persona.
Este es el prompt base para crear el character sheet. Sube tu imagen de referencia y adapta los detalles a tu personaje:
Hoja de referencia fotorrealista del personaje: cuatro vistas del mismo personaje sobre un fondo gris neutro. Vista 1: vista de tres cuartos de frente de cuerpo entero; se ve todo el cuerpo, desde la cabeza hasta los pies. Vista 2: vista trasera de cuerpo entero del mismo personaje, directamente desde atrás; se ve todo el cuerpo, desde la cabeza hasta los pies. Vista 3: primer plano de cabeza y hombros, vista frontal directa, con detalles nítidos de la textura de la piel, el pelo y la superficie del traje. Vista 4: primer plano de cabeza y hombros, vista de perfil a 90 grados hacia la izquierda, con el cuello y la parte superior de los hombros visibles. Personaje: [EDAD] [GÉNERO], [ORIGEN ÉTNICO / RASGOS], [PELO: longitud, color, peinado], [RASGOS DISTINTIVOS: pecas, cicatrices, etc.], [EXPRESIÓN]. Vestuario: [DESCRIBE EL ATUENDO EN DETALLE: prendas, colores, materiales, accesorios, calzado]. Iluminación y presentación: iluminación de estudio limpia, luz principal suave en la parte superior izquierda, luz de relleno suave desde la derecha. Fotorrealismo cinematográfico, enfoque nítido en todas las vistas, identidad del personaje, proporciones y detalles del vestuario coherentes en todas las vistas. Sin texto, sin marcas de agua, sin etiquetas, sin figuras adicionales, sin entorno de fondo. Fondo liso de color gris neutro. --ar 16:9 --sin texto, letras, leyendas, etiquetas, palabras ni marcas de agua
Para personajes secundarios que no necesitan cara visible, como los músicos enmascarados que usé en mi video, el truco es generarlos en fondo neutro. Así puedes recortar cada uno por separado y usarlos individualmente en las escenas sin que el fondo interfiera.
Si el personaje va a cambiar de vestuario según la sección de la canción, genera un character sheet por cada outfit. Es trabajo extra, pero es lo que mantiene la coherencia visual de principio a fin.
El guion antes de generar una sola escena
Antes de abrir Higgsfield, escribe el guion. No hace falta que sea perfecto ni detallado al milímetro, pero necesitas saber qué va a pasar en cada parte de la canción.
En mi caso la canción trataba de una chica que se levanta temprano, se hace un café y ese café le da energía para pasar el día y tocar en su banda de metal. Simple. Pero tener eso claro me permitió separar las escenas desde el principio: cuáles iban a tener lipsync y cuáles eran de actuación pura.
Esta separación es clave porque el proceso de generación es completamente distinto en cada caso. Las escenas de actuación son más libres. Las de lipsync requieren preparación específica del audio y un prompt diferente.
Seedance 2.0 4K en Higgsfield: lo que cuesta y lo que da
Antes de entrar en el proceso de generación, los números reales para que no te lleves sorpresas:
4 segundos en Seedance 2.0 4K → 88 créditos
15 segundos en Seedance 2.0 4K → 330 créditos (descuento desde 390)
Para un videoclip con varias escenas y regeneraciones, el coste sube rápido. En mi caso llegué a unos 3.000 créditos con las escenas fallidas incluidas.
La manera de reducir ese gasto es usar el modo Fast o Light de Seedance para probar el prompt antes de lanzarlo en 4K. Si el resultado del Fast confirma que el prompt funciona, lo generas en 4K. Si no funciona, ajustas el prompt sin haber gastado los créditos del 4K.
Otro dato importante: Seedance 2.0 4K en Higgsfield tiene opción de bitrate alto o estándar. El bitrate alto genera el video con más información de color, lo que te da más margen para hacer correcciones en posproducción sin degradar la calidad visual. Si vas a retocar el color en Premiere o DaVinci, usa bitrate alto. Si el video va directo sin retoques, el estándar es suficiente.
Cómo hacer lipsync en este video musical con IA Higgsfield tutorial
Aquí está el truco más importante del artículo y el que más créditos me ahorró una vez lo descubrí.
El instinto natural es subir el fragmento de audio como MP3 directamente a Higgsfield. El problema es que cuando lo haces así, Higgsfield modifica el audio internamente y el lipsync pierde precisión. La boca se mueve, pero no exactamente con lo que dice la canción.
La solución es exportar el fragmento como MP4 con fondo negro. En tu editor de video, ya sea Premiere, DaVinci o CapCut, colocas el fragmento de audio que quieres sincronizar, añades debajo un cuadro de color sólido negro y exportas eso como MP4. Sin imagen real, solo el audio encima de un fondo negro.
Cuando subes ese MP4 a Higgsfield, el modelo interpreta el audio sin modificarlo y el lipsync sale mucho más preciso. Probé ambas versiones varias veces y la diferencia es consistente.
Un dato sobre el tempo: a 190 BPM el lipsync con mezcla de idiomas se complica. Cuanto más rápida es la canción y más cambios de idioma hay en una misma frase, más le cuesta a Seedance mantener la sincronización. Para esas partes, es mejor usarlas como escenas de actuación y reservar el lipsync para las secciones más melódicas y lentas.
Este es el prompt base para el lipsync. Adapta las partes entre corchetes a tu proyecto:
No music, natural sound only. A cinematic vertical selfie-style shot of [CHARACTER DESCRIPTION] filming himself/herself on a smartphone front camera in [LOCATION + ENVIRONMENT DETAILS], [LIGHTING / TIME OF DAY], starting exactly from the frame in [@IMAGE REFERENCE]. He/she holds the phone at arm's length, arm slightly visible, looking directly into the lens with [EXPRESSION]. [00:00-00:0X]: he/she speaks the exact words "[YOUR LINE HERE]" in perfect lipsync with the audio, natural relaxed talking, mouth clearly moving. Authentic phone-camera look, slightly soft phone quality, mild grain, realistic smartphone footage. [DISTINCTIVE PHYSICAL FEATURES]. negative: low quality, flicker, deformed anatomy, identity drift, closed mouth.
Tres reglas que no tienen excepción:
El personaje tiene que mirar directamente a cámara. Si no mira a cámara, Seedance no puede hacer el lipsync correctamente.
La letra va entre comillas, exacta. No parafrasees. No resumas. La letra exacta que aparece en esa parte de la canción.
«No music, natural sound only» siempre al inicio. Sin esto el modelo puede añadir audio generado encima del tuyo y arruinar la sincronización.
Cómo extender escenas en Higgsfield sin perder continuidad
Una de las ventajas de Higgsfield respecto a otras plataformas es que el sistema de extend funciona de forma más intuitiva. Cuando quieres continuar un clip desde donde terminó, etiquetas el video anterior en el prompt con @video1 y Higgsfield lo toma como punto de partida para la extensión.
En otras plataformas el extend a veces vuelve al frame inicial en lugar de continuar desde el final. En Higgsfield funciona mejor, aunque no es perfecto.
Cuando el extend falla y el modelo no arranca desde donde terminó el clip anterior, la solución es exportar el último frame del clip, usarlo como imagen de referencia en el siguiente prompt e indicarlo explícitamente como start frame.
Cómo resolver errores sin perder créditos
Este es el punto que más gente se salta y que más créditos hace perder: descartar un video completo por un error puntual.
Un ejemplo concreto del proceso: en la primera escena, Seedance puso el reloj marcando las 00:00, lo que no tenía sentido visual con la escena siendo de día. En lugar de regenerar todo el clip, lo que hice fue exportar solo los primeros 3 segundos en 1080p desde Premiere y usar Gemini Omniflash para corregir el reloj en esa parte.
Gemini en Higgsfield trabaja en 720p máximo, lo que baja la calidad de esa parte. La solución fue crear una máscara en Premiere que cubre solo los relojes. Así el resto del video se mantiene en 4K y solo los relojes, que son un detalle pequeño, quedan en 720.
No descartes un video por un error puntual. Analiza si ese error afecta el video completo o solo un momento concreto. Si es puntual, puedes taparlo con una escena de corte, ajustarlo en edición o usar solo los segundos buenos del clip.
Preguntas frecuentes
¿Cuánto cuesta hacer un video musical con Seedance 2.0 4K en Higgsfield?
Un clip de 4 segundos cuesta 88 créditos. Un clip de 15 segundos cuesta 330 créditos, con descuento desde los 390 habituales. Para un videoclip completo con regeneraciones, el coste puede superar los 3.000 créditos. Usa el modo Fast para probar el prompt antes de generarlo en 4K y reducir el gasto en pruebas.
¿Cómo hacer lipsync con Seedance 2.0 en Higgsfield?
Exporta el fragmento de canción como MP4 con fondo negro desde tu editor, no como MP3. Cuando subes un MP3, Higgsfield modifica el audio y el lipsync pierde precisión. Con el MP4 de fondo negro el audio se mantiene intacto. El personaje tiene que mirar directamente a cámara y la letra tiene que ir entre comillas en el prompt.
¿Qué es el bitrate alto en Seedance 2.0 4K y para qué sirve?
El bitrate alto genera el video con más información de color, lo que permite correcciones en posproducción sin degradar la calidad visual. El estándar funciona bien si no vas a retocar el color en edición. Para proyectos con corrección de color en Premiere o DaVinci, usa bitrate alto.
¿Cómo extender escenas en Higgsfield con Seedance 2.0?
Etiqueta el video anterior en el prompt con @video1 para que Higgsfield lo tome como punto de partida. Si el extend falla y el modelo vuelve al frame inicial, exporta el último frame del clip, úsalo como imagen de referencia en el siguiente prompt e indícalo como start frame.
Para mí
Seedance 2.0 4K vale la pena. La calidad del video es alucinante para lo que es generación con IA. Los costes están altos y van a seguir subiendo, sobre todo con lo que viene con Seedance 2.5 y sus clips de hasta 180 segundos.
Lo que aprendí en estas 9 horas es que el trabajo real de un video musical con IA no está en generar. Está en preparar: la canción, el guion, el character sheet, el audio cortado por fragmentos. Eso es lo que determina si el resultado final funciona o no.
Si quieres ver el videoclip completo, lo tienes en Instagram de Arca Artificial. El proceso completo en video, en el canal de YouTube.
