La Evolución de la Interacción con IA: Desde el Diálogo hasta la Forma Embodiment

Recientemente, mientras investigaba el campo de la interacción embodied, mi objetivo inicial era simplemente familiarizarme con las capacidades de la plataforma y ejecutar una demostración básica. Sin embargo, en el proceso descubrí un problema digno de reflexión: muchos Agentes ya poseen fuertes capacidades de comprensión y generación, pero permanecen atascados en interfaces de interacción puramente textuales.

Durante el último año, la industria ha perfeccionado considerablemente la construcción de Agentes: conectando grandes modelos con bases de conocimiento, llamadas a herramientas y flujos de trabajo, todo presentado finalmente a través de un cuadro de entrada. En escenarios como la programación y la organización de documentos, son muy eficientes. Pero en entornos que requieren una atmósfera de servicio, como tiendas, salas de exhibición, atención al cliente y formación, la interacción puramente textual se muestra limitada, y los usuarios pueden no estar dispuestos a iniciar preguntas activamente.

Por lo tanto, este artículo se centra no tanto en si la imagen del humano digital es sofisticada, sino en: ¿cuáles son los límites de la interacción puramente textual? ¿Por qué las formas embodied se convierten en una dirección de interacción más natural? Esencialmente, se trata de si podemos comprender, responder, expresar e interactuar, conectando todo en una experiencia natural coherente.

Plataforma de Humanos Digitales Embodied de IA con Interacción en Tiempo Real - FStar Cloud

Abrimos primero el sitio web oficial de FStar Cloud: https://xingyun3d.com

No se trata simplemente de hacer que un humano digital lea un guion, ni de crear un video de un avatar virtual para terminar. Los escenarios que se muestran en la parte inferior del inicio de sesión, como compañía antes de dormir, robots de servicio médico, asesores de marca y entrevistadores de IA, comparten un punto en común: requieren respuestas en tiempo real, no reproducción unidireccional.

Así que mi enfoque de observación cambió posteriormente.

Dejé de preocuparme solo por si el humano digital se veía bien, y comencé a ver si podía ser impulsado en tiempo real. Si podía conectarse a un agente de texto, si podía generar voz, expresiones y acciones basadas en las respuestas, y si podía transformar al AI de un cuadro de respuesta en pantalla a un objeto interactivo en pantalla.

Esta es realmente la área que quiero desarrollar en este artículo.

Los problemas de los Agentes de texto puro no son que no puedan responder, sino que carecen de presencia

Anteriormente también pensé que siempre que el Prompt esté bien escrito, el Agente puede parecer más humano. Por ejemplo, hacer que su tono sea más suave y que use menos lenguaje formal. A corto plazo, esto funciona, pero esto solo es antropomórfico a nivel de texto.

La interacción real humano-máquina no depende solo del texto. Cuando vas a comprar, el empleado dice que este modelo es más adecuado para el desplazamiento diario, esta declaración en sí es bastante común. Pero cuándo lo dice, si el tono es afirmativo, si señala el producto, si te mira a los ojos, todo esto afectará si estás dispuesto a seguir escuchando. Los Agentes de texto no tienen estas cosas. Solo pueden generar oraciones, con suerte agregar algunos emoji o escribir una sonrisa entre paréntesis.

Por lo tanto, creo que el techo de los Agentes de texto puro tiene principalmente tres limitaciones.

Primero, es difícil que aparezcan proactivamente. El cuadro de chat siempre espera la entrada del usuario, asumiendo por defecto que el usuario ya sabe qué preguntar. Pero en la realidad, muchos usuarios no saben qué preguntar. Las tiendas, las salas de exhibición, las consultas médicas y la tutoría requieren primero orientación, no ser arrojados a un cuadro de entrada.

Segundo, carecen de un ritmo de expresión real. El LLM puede escribir "Comprendo sus preocupaciones", pero si es solo texto, su fuerza es limitada. Lo que realmente relaja a la gente puede ser un ritmo de habla más lento, expresiones más naturales, movimientos no exagerados, una pausa de medio segundo antes de responder.

Tercero, es difícil establecer una relación de servicio. El Agente de texto es más como una herramienta, mientras que el Agente embodied es más como un objeto que te está sirviendo. Esta diferencia afectará si el usuario se queda, si hace más preguntas y si continúa con la siguiente consulta. La conversión a menudo no comienza con la respuesta, sino con "estoy dispuesto a seguir charlando".

Entrando en la consola de FStar Cloud: no está generando videos, sino impulsando personajes

Al hacer clic en la página de experiencia de conducción embodied en la plataforma, vi directamente el personaje humano digital en el centro, con la opción de cambiar entre diferentes personajes, como compañía antes de dormir, novio IA, servicio financiero y novia arrogante. También se pueden ver el tipo de personaje, idioma, introducción del personaje, tono de voz, interruptor de generación de acciones de IA, modelo ASR y opciones de modelo de lenguaje grande.

Mi primera impresión de esta página fue que se parece más a una consola de control de personajes, no a un editor de video. Las herramientas de generación de video suelen preocuparse por el guion, duración, imágenes y exportación. Esta página se preocupa por el personaje, voz, acciones, modelo de diálogo, ASR, comenzar a chatear, una dirección completamente diferente.

Elegí un personaje "entusiasta contador de chistes" para probar, este personaje tiene algo de estilo anime y es un poco exagerado, pero al menos no es un cuadro en blanco. Antes de que ingreses nada, ya está allí. Incluso sin hablar, el centro de la pantalla ya está ocupado por un personaje de estilo anime.

Un cuadro de entrada está esperando que lo uses, un humano digital está esperando que interactúes.

La palabra realmente clave en la documentación: Impulsión en Tiempo Real

En la documentación oficial, principalmente revisé dos partes: una es la descripción de integración del SDK de Impulsión Embodied, y la otra es la descripción de uso de la interfaz de consulta KA de Impulsión Embodied. La primera se inclina más hacia la integración del frontend, y la segunda más hacia la autenticación de interfaz y las llamadas de servicio.

Creo que la palabra más importante aquí no es "humano digital", sino "impulsión". La documentación menciona que puede realizar renderizado y conducción de humanos digitales 3D en tiempo real, síntesis de voz y sincronización de labios, y admite el control de estados como Idle / Listen / Speak. Esto indica que no solo genera un video de humano digital, sino que permite que el humano digital entre en diferentes estados según la entrada: espera, escucha, reflexión, habla.

La otra documentación de interfaz de consulta KA es más orientada a la ingeniería, que incluye descripciones de autenticación, cálculo de X-TOKEN, llamadas a interfaz y código de demostración. Esta parte, vista junto con el SDK anterior, básicamente puede mostrar el enfoque de integración: el frontend se encarga de la visualización y el control de estado del humano digital, mientras que el lado de la interfaz se encarga de las consultas, autenticación y llamadas a capacidades comerciales.

Por lo tanto, al juzgar si es adecuado para crear un Agente embodied, principalmente me fijo en estos tres puntos: ¿puede impulsarse en tiempo real? ¿pueden sincronizarse los labios y el habla? ¿pueden controlarse los estados? Si solo es TTS + una imagen de humano digital, muchas herramientas pueden hacerlo; pero si puede convertir la respuesta de texto en voz, labios, expresiones, acciones y cambios de estado, entonces se acerca más a un Agente embodied inteligente que puede controlarse en tiempo real y ser implementado, en lugar de un contenido que se reproduce pasivamente.

Desde cero hasta uno: primero que el humano digital aparezca

Antes de la integración, primero se debe crear una aplicación en la consola, obtener AppID y AppSecret, y luego configurar información como la imagen del humano digital, escena, tono de voz y actuación. Este proceso es similar a integrar otros servicios en la nube: crear aplicación, obtener clave, inicializar SDK. 1.Crear aplicación y realizar configuraciones como imagen, escena, tono de voz y actuación

2.Después de completar, al salir puedes ver tu App ID y App Secret Preparar un contenedor para el humano digital, introducir el JS SDK, y luego crear una instancia XmovAvatar, configurando parámetros como containerId, appId, appSecret, gatewayServer. A continuación se muestra un código de ejemplo, en proyectos reales seguir la documentación oficial y tus propias claves, no expongas las claves.

const humanoDigital = new AvatarInteractivo({
        contenedorId: '#contenedor',
        idAplicacion: ID_APP,
        secretoAplicacion: SECRETO_APP,
        servidorPuertaEnlace: PUERTA_ENLACE,
        registrarLog: false,

        widgetProxy: {
          'activar_subtitulo': (datos) => {
            const elemento = document.getElementById('texto-subtitulo');
            if (elemento && datos && datos.texto) {
              elemento.textContent = datos.texto;
              elemento.classList.add('mostrar');
            }
          },
          'desactivar_subtitulo': () => {
            document.getElementById('texto-subtitulo').classList.remove('mostrar');
          }
        },


La primera vez que lo ejecuté, el problema que encontré primero no fue el SDK, sino la proporción del contenedor. Escribí un div al azar, y cuando apareció el humano digital, se veía un poco apretado. Esto también demuestra que la experiencia del Agente embodied no solo depende del modelo, sino que el contenedor frontend, la proporción de la imagen, la posición del subtítulo, el tamaño del personaje, todos afectan si se parece a una persona que te está sirviendo.

Háganlo hablar: lo más difícil no es la API, es que no parezca una presentación de diapositivas

Una vez que el humano digital se muestra, el siguiente paso es hacer que hable. La documentación oficial tiene métodos como estadoReposoInteractivo() y hablar() para cambiar estados y controlar la expresión en tiempo real. Técnicamente no es difícil, lo realmente difícil es el contenido.

La primera vez que pasé la respuesta del LLM directamente al humano digital, la experiencia fue muy mala. No que no pudiera reproducirse, sino que era demasiado como una presentación de diapositivas.

El usuario pregunta: "¿Para qué escenarios es adecuado este producto?"

El LLM responde naturalmente: "Este producto es aplicable en recepción de salas de exhibición, orientación inteligente de compras, formación y educación, servicio al cliente y postventa, entre otros escenarios de negocio..."

El texto se ve bien. Pero cuando el humano digital lo lee con seriedad, es como un presentador en una conferencia recitando un guion. En ese momento entendí aproximadamente: la respuesta de un Agente de texto no puede transferirse sin más a un Agente embodied.

El texto destinado a ser leído por humanos, y las palabras que se le dicen a un humano digital, no son la misma cosa.

Así que modifiqué el Prompt. El objetivo no era que fuera más completo, sino que sonara más como una persona hablando.

Eres un asesor de productos de IA, responsable de presentar los productos a los usuarios de forma oral.

Requisitos:
1. No escribir como un manual de instrucciones.
2. Cada respuesta debe tener menos de 80 caracteres.
3. Evitar usar "primero, en segundo lugar, en resumen".
4. Puede tener una sensación de pausa ligera.
5. Si la pregunta del usuario es muy amplia, primero dar una dirección, luego guiar al usuario para que continúe preguntando.


Después de modificar, la misma pregunta podría convertirse en: "Creo que es más adecuado para tres tipos de lugares: salas de exhibición, tiendas, y pantallas de formación. Porque estos lugares no solo muestrran información, también necesitan explicaciones y orientación."

Esta frase no es elaborada, pero cuando el humano digital la dice, suena mucho más natural.

Aquí hay un pequeño detalle: la velocidad del habla. Un poco más rápido suena como un locutor, un poco más lento suena como si se atascase. El humano digital es más sensible que un TTS normal, porque tiene cara, movimiento labial y acciones. Un asistente de voz normal que suena extraño, quizás puedas tolerarlo; pero un humano digital con expresiones que suena extraño, la sensación de incomodidad se amplifica.

La salida de un Agente embodied no debería ser solo texto

Al llegar aquí, descubrí que la estructura de salida del Agente original ya no era suficiente. Antes solo necesitaba devolver un bloque de respuesta, ahora es mejor devolver un conjunto de parámetros adecuados para la expresión: texto, emoción, acción, tono, subtítulo, si mostrar imágenes, e incluso si se necesita hacer una pregunta de seguimiento.

Por ejemplo, así:

{
  "texto": "Creo que este方案 es más adecuado para la orientación en tiendas.",
  "emocion": "amistoso",
  "accion": "explicar",
  "subtitulo": true,
  "es_inicio": true,
  "es_fin": true
}


El frontend luego pasa este conjunto de información al SDK:

async function avatarHablar(bloque) {
  if (!humanoDigital) return

  humanoDigital.estadoReposoInteractivo()

  await humanoDigital.hablar(
    bloque.texto,
    bloque.es_inicio ?? true,
    bloque.es_fin ?? true
  )
}


Aquí podemos ver la división de aguas entre los Agentes embodied y los ChatBots de texto. Los ChatBots de texto buscan respuestas precisas, completas y lógicas; los Agentes embodied también deben considerar cómo decirlo, cuándo decirlo, qué acción acompañar, si puede interrumpirse, cómo aparecer el subtítulo y cómo continuar el usuario.

La documentación del SDK oficial también menciona capacidades como la visualización de componentes Widget y devoluciones de llamada de eventos personalizadas. En el contexto de un Agente embodied, estas no son simples funciones de IU, sino parte de la expresión. Cuando el humano digital explica un producto, aparece una tarjeta de imagen al lado; cuando explica pasos, aparece una presentación de diapositivas; cuando responde preguntas, se muestra un subtítulo. Todo esto trabajando junto crea una interfaz de interacción completa.

¿Por qué al unir LLM + TTS + renderizado, aún no parece humano?

Muchas personas que crean Agentes de humanos digital, naturalmente piensan en un enfoque de tres etapas: el LLM es responsable de responder, el TTS de hablar, y el motor de renderizado de hacer que el personaje se mueva. Suena razonable, pero al probarlo, el problema está en la unión.

El LLM habla demasiado formalmente, el TTS suena como un locutor, los labios no sincronizan, las acciones no tienen relación con el significado, y la expresión es siempre una sonrisa. Cada módulo por separado parece correcto, pero juntos parecen falsos. Como si varios departamentos estuvieran turnándose en la misma pantalla.

Por lo tanto, creo que la clave de un Agente embodied no es solo agregar una imagen de humano digital, sino conectar la cadena entre cognición y expresión. Modelos grandes multimodales de texto a 3D desarrollados internamente, renderizado en el cliente, sincronización de voz, expresiones y acciones, todo finalmente busca transformar la respuesta del AI en un proceso expresivo perceptible.

Por supuesto, un Agente embodied mal hecho puede ser aún más incómodo. Si la respuesta textual es un poco deficiente, el usuario puede solo pensar que es prolijo; si las acciones del humano digital son falsas, los labios lentos o el tono de voz demasiado formal, el usuario simplemente se desconectará. Esto también indica que está entrando en un área más cercana a la interacción real.

El escenario de prueba que elegí: Orientación en Tiendas / Salas de Exhibición

Para no ser demasiado general, definí el escenario de prueba como asesor de productos de IA, más específicamente, como un guía explicativo en tiendas o salas de exhibición. Este escenario es ideal para comparar Agentes de texto y Agentes embodied, porque no es simplemente buscar información, ni charlar casualmente, sino requiere guiar al usuario para continuar.

El problema de los Agentes de texto puro aquí es obvio: esperan que el usuario pregunte. Si el usuario no sabe qué preguntar, termina. La ventaja de los Agentes embodied también es obvia: pueden hablar primero. Por ejemplo: "Primero puedes decirme, ¿te preocupa más el precio, la efectividad, o la dificultad de integración?"

Esta frase es común, pero reduce el costo de iniciar la interacción para el usuario. Muchas conversiones ocurren en pequeños detalles como este. Si el usuario está dispuesto a detenerse, hacer la primera pregunta, hacer más preguntas, o dejar sus datos de contacto, no depende de una respuesta perfecta, sino de todo el proceso de interacción.

Por ejemplo, si le pregunto al humano digital qué producto tiene mejor calidad, dará recomendaciones razonables.

La estructura básica de mi Demo es aproximadamente así:

Lado izquierdo de la página: Área de visualización del humano digital
Lado derecho de la página: Área de entrada de preguntas + Preguntas recomendadas
Parte inferior: Estado actual / Registro
Backend: Generación de respuesta coloquial por parte del LLM
Frontend: Llamada al SDK de FStar Cloud para impulsar la transmisión del humano digital


Las preguntas recomendadas pueden configurarse como:

1. ¿Para qué escenarios es adecuado este方案?
2. ¿En qué se diferencia de un ChatBot normal?
3. ¿Es difícil para los desarrolladores la integración?
4. Si quiero crear una orientación en tienda, ¿cómo debería diseñarla?


Cuando el usuario pregunta "¿En qué se diferencia de un ChatBot normal?", espero que el humano digital no responda como una enciclopedia, sino diga: "Un ChatBot es más como un cuadro de entrada, responde solo cuando le preguntas. Un Agente embodied aparece proactivamente en la pantalla, usando voz, expresiones y acciones para explicar las preguntas. En tiendas o salas de exhibición, los usuarios encuentran más fácil iniciar la primera interacción."

Esta frase no es compleja, pero es más adecuada para ser dicha.

¿Por qué, en el mismo escenario de negocio, los embodied inteligentes pueden tener una tasa de conversión más alta?

Aquí no podemos simplemente decir "porque hay un humano digital, la conversión será definitivamente más alta". La conversión real depende del escenario, contenido, intención del usuario y el producto en sí. Pero desde el mecanismo de interacción, los embodied inteligentes sí pueden aumentar algunas oportunidades clave.

Primero, atraen más fácilmente la atención. Un personaje que se mueve, habla y aparece proactivamente, es más fácil que un cuadro de entrada haga que el usuario mire unos segundos más. En muchas pantallas fuera de línea, el primer paso no es la venta, sino hacer que la gente se detenga.

Segundo, reducen más fácilmente el umbral para hacer preguntas. Los Agentes de texto puro requieren que el usuario organice el lenguaje, mientras que los Agentes embodied pueden primero dar opciones, guiar una dirección, o plantear una pregunta. El usuario no necesita saber desde el principio lo que quiere preguntar.

Tercero, establecen más fácilmente una sensación de confianza. El usuario puede no realmente creer que sea humano, pero la voz, expresiones y ritmo hacen que el servicio se sienta más fuerte. Especialmente en escenarios que requieren explicaciones como finanzas, medicina, educación y orientación, un texto y un "personaje que te está explicando" no se sienten igual.

Cuarto, son más adecuados para explicar productos complejos. Apilar texto nadie lo lee, y los videos promocionales no son interactivos. Los Agentes embodied pueden explicar mientras ajustan la dirección según los comentarios del usuario, lo que los diferencia de los videos tradicionales.

Por lo tanto, el valor de los Agentes embodied no es que sean más geniales, sino que llevan al usuario de simplemente navegar información a participar en un diálogo. Si este paso ocurre, entonces hay espacio para las conversiones posteriores.

Perspectiva del desarrollador: lo ideal es que se pueda conectar a Agentes existentes

Desde la perspectiva del desarrollador, lo que más me importa no es lo geniales que sean las imágenes, sino: ¿puede conectarse a proyectos existentes? ¿La documentación es comprensible? ¿Pueden controlarse los estados? ¿Puede interrumpirse la respuesta? ¿Pueden modificarse los subtítulos y la IU?

La impresión que me dio el SDK de FStar Cloud es que no requiere que reestructuras la lógica de tu Agente existente, sino que conectas la salida del Agente de texto a una capa de expresión embodied. Puedes seguir usando tu propio LLM, base de conocimiento, interfaces de backend, siempre que el contenido final generado sea adecuado para la transmisión, y luego se lo entregues al humano digital para su expresión.

Esta ruta es bastante realista. La mayoría de los desarrolladores no pueden crear desde cero humanos digitales 3D, sincronización labial, conducción de acciones y renderizado del lado del cliente. El valor del SDK está aquí: encapsula la parte más difícil de desarrollar (la expresión embodied), permitiendo que los desarrolladores se enfoquen en el negocio y el diseño de interacción.

Sin embargo, los Agentes embodied también traerán nuevos problemas de depuración. Los errores de los Agentes de texto eran muy directos: respuesta incorrecta, formato incorrecto, error de interfaz. Los errores de los Agentes embodied a veces son difíciles de describir, como "no es natural", "suena demasiado como un locutor", "movimientos excesivos", "los labios un poco más lentos". Estos no son cosas que la consola te pueda decir directamente, requieren ver, escuchar y ajustar repetidamente.

Esto también podría ser lo interesante de esta dirección. No solo se trata de escribir código, sino de ajustar un personaje.

La próxima generación de puntos de entrada para Agentes, probablemente no sean cuadros de texto

Al escribir esto, no estoy negando el valor de los ChatBots. Los Agentes de texto siguen siendo muy importantes para escribir código, buscar información y organizar contenido; son eficientes. Tampoco quiero que un humano digital aparezca para leerme registros de errores, sería demasiado lento.

Pero el cuadro de chat no es el final de todas las interacciones con IA. Especialmente en escenarios que requieren recepción, explicación, compañía, guía y establecimiento de confianza, la capacidad expresiva de los Agentes de texto puro es insuficiente. Pueden dar respuestas, pero es difícil que el usuario sienta que "alguien me está sirviendo".

El núcleo de los Agentes embodied no es simplemente darle al AI una bonita apariencia externa, sino hacer que el aparezca frente al usuario a través de voz, expresiones, acciones y retroalimentación en tiempo real. Antes operábamos herramientas, ahora es más como si hubiera un personaje en la pantalla recibiéndonos. Este cambio, aplicado a escenarios como tiendas, salas de exhibición, formación y atención al cliente, no es solo un cambio de experiencia, sino también un cambio de conversión.

Cuando finalmente se ejecutó la Demo, miré la pantalla por un momento. El humano digital estaba allí, esperando mi pregunta. Ciertamente no es una persona real, ni me entiende realmente. Pero ya no se parece mucho a un cuadro de chat.

La próxima vez que vea "Ingrese su pregunta" en el centro de la pantalla, podría un poco impaciente.

Podría haber hablado primero.

Sitio web oficial de FStar Cloud: https://xingyun3d.com/?utm_campaign=daily&utm_source=jixinghuiKoc123

Etiquetas: IA embodied interacción humano-computadora humanos digitales SDK de IA interfaz de usuario conversacional

Publicado el 8-14 03:14