Álbum de fotos
I. Acerca del producto
1.1 Introducción del producto
Este producto es un sistema humano digital interactivo por voz, ideal para su implementación privada en empresas. Permite la interacción de voz inteligente y la consulta/respuesta de datos en empresas, escuelas y entidades gubernamentales. Desarrollado a partir de un modelo de inferencia a gran escala, un modelo de reconocimiento de voz, un modelo de síntesis de voz y un motor de flujo de trabajo, puede alternar de forma flexible entre redes públicas y modelos de implementación local para satisfacer las necesidades personalizadas de procesamiento de datos de las empresas. Se centra en el valor empresarial, es ligero, personalizable y de rápida implementación.
1.2 Representación de los personajes
Permite personalizar la imagen de tu propio personaje y ofrece más de diez imágenes para elegir en la biblioteca de imágenes.
1.3 Ventajas principales
La principal diferencia entre nosotros y otros fabricantes de humanos digitales:
- Uso en múltiples terminales: No se limita a máquinas todo en uno, sino que puede utilizarse de forma flexible en varios terminales, como ordenadores Windows, tabletas Android (con diferentes marcas de agua), páginas web, cuentas oficiales y miniprogramas.
- Sistema de respuesta a preguntas privadas: Puede conectarse de forma flexible con los datos internos de la empresa a través de interfaces, consultas a bases de datos, etc., lo que permite a los humanos digitales responder a contenido exclusivo y posibilita la consulta flexible de informes, vídeos y otro contenido.
- Implementación localizada: Admite la implementación privada localizada dentro de las empresas, ejecutándose en la intranet (todos los modelos y datos importantes son locales).
1.4 Lista de funciones del software
| Número de serie | categoría | Subelemento | ilustrar |
|---|---|---|---|
| 1 | Personalización de personajes | 1.1 Clonación de personajes | Grabación con pantalla verde: Clonación humana digital basada en vídeos grabados con pantalla verde proporcionados por la persona objetivo; Síntesis de IA: Generación de la imagen de una persona a partir de una fotografía; Admite varias acciones como esperar, permanecer quieto con las manos hacia abajo, hablar con las manos juntas, hablar con una mano y hablar con ambas manos. |
| 1.2 Clonación de voces de personajes | Admite la replicación rápida de 3 segundos, proporcionando grabaciones de voz humana reales de 3 a 10 segundos para replicar rápidamente las características vocales de la persona. | ||
| 1.3 Configuración de fondo | Ofrece opciones para configurar y cambiar la imagen de fondo del personaje humano digital. | ||
| 2 | Tecnología de voz | 2.1 Activación por voz | Permite nombrar a los humanos digitales, y el humano digital se despertará activamente y entablará una conversación cuando oiga que alguien lo llama por su nombre. |
| 2.2 Reconocimiento de voz | Basado en un extenso modelo de voz, este sistema de reconocimiento de voz integral y en tiempo real ofrece una tasa de error de palabras y una velocidad de inferencia simultánea líderes en la industria. Admite el reconocimiento de dialectos y puede identificar más de 10 idiomas nacionales. | ||
| 2.3 Síntesis de voz | Síntesis de voz basada en un modelo de voz extenso, que ofrece múltiples opciones de voz. Algoritmos de audio: AEC, ANC, AGC. |
1.5 Máquina humana digital todo en uno
Un dispositivo terminal interactivo inteligente que integra cámara y micrófono y está listo para usar nada más sacarlo de la caja.



II. Escenarios de aplicación
2.1 PC todo en uno con pantalla táctil
Este equipo todo en uno vertical con pantalla táctil es adecuado para entornos como vestíbulos y salas de exposiciones, ya que permite a los usuarios interactuar directamente mediante el tacto o la voz.
2.2 Marco de fotos electrónico
La pantalla interactiva con forma humana digital, con forma de marco de arte, se puede integrar en entornos domésticos y de oficina, permitiendo a los usuarios conversar con el humano digital dentro del marco electrónico mediante preguntas y respuestas activadas por voz.
2.3 Guía de la sala de exposiciones
Una solución de explicación digital basada en la interacción humana, adecuada para escenarios como museos de historia escolar, salas de exposiciones corporativas y museos, compatible con pantallas integradas de gran formato.
2.4 Consulta de datos industriales
Este humano digital, diseñado para entornos industriales, permite a los usuarios consultar datos de producción, el estado de los equipos y otra información mediante interacción por voz.
2.5 PC con Windows
| proyecto | Especificación |
|---|---|
| Método de instalación | Proporciona instalador exe |
| Terminales aplicables | Ordenador de atril/Máquina todo en uno con pantalla táctil |
| UPC | Procesadores i3 y superiores |
| Escenarios típicos | Computadora en el atril del aula, cuestionario de conocimiento interdisciplinario humano digital |
2.6 Letrero electrónico de clase
| proyecto | Especificación |
|---|---|
| Pantalla | Pantalla LCD IPS |
| tamaño | 18,5 pulgadas |
| resolución | 1920 × 1080 |
| chip | RK3288 de cuatro núcleos a 1,8 GHz |
| Memoria | 2 GB |
| memoria flash | 16 GB |
2.7 Perro robot industrial
Un perro robot biónico cuadrúpedo, una plataforma móvil de interacción digital con humanos, capaz de desplazarse por terrenos complejos e interactuar con los usuarios mediante la voz.
2.8 Conferencias a gran escala
La solución de pantalla interactiva extragrande es adecuada para la visualización e interacción digital entre personas en escenarios como grandes conferencias y aulas de conferencias.




III. Clonación de personajes
3.1 Grabación con pantalla verde
La clonación humana digital se realiza a partir de vídeos grabados con pantalla verde proporcionados por la persona objetivo. La grabación debe efectuarse en un entorno profesional con pantalla verde. Tras enviar el vídeo en alta definición, el entrenamiento de imagen suele completarse en 1 o 2 días hábiles.
3.2 Combinación de fotos
Los avatares generados por inteligencia artificial a partir de fotografías pueden crear rápidamente apariencias humanas digitales sin necesidad de equipos especializados.
3.3 Síntesis de sonido
Permite la replicación rápida de características de voz en 3 segundos. Solo se requieren de 3 a 10 segundos de grabación de voz real para replicar las características de la voz y utilizarlas en la síntesis digital de voz humana.



IV. Humano digital de interfaz
4.1 Preguntas y respuestas sobre humanos digitales
4.1.1 Respuesta de texto
El humano digital responde a las preguntas del usuario en formato de texto plano, lo cual es adecuado para escenarios de preguntas y respuestas basados en conocimientos generales.
4.1.2 Responder con imágenes y texto
Cuando una pregunta requiere explícitamente una respuesta con "texto e imágenes", el humano digital puede mostrar tanto texto como imágenes en la respuesta.
4.1.3 Respuestas en vídeo
Cuando la pregunta requiere explícitamente una "respuesta en vídeo", el humano digital puede acceder y reproducir los materiales de vídeo ya configurados en el servidor (los recursos del servidor deben contener los materiales de vídeo correspondientes).
4.2 Conmutación de interfaz
4.2.1 Conmutación multimodo
Puedes alternar libremente entre los modos de entrada de voz y de texto.
4.2.2 Cambio de múltiples fondos
Permite cambiar la imagen de fondo del humano digital.
4.2.3 Conmutación multirresolución
Ofrece múltiples resoluciones, incluyendo 1K, 2K y 4K, adecuadas tanto para dispositivos convencionales como para ordenadores todo en uno de pantalla grande.
4.2.4 Cambio entre múltiples figuras humanas digitales
Windows: Seleccione el humano digital que desea ejecutar a través de la aplicación de humano digital; Android: Haga clic en el punto en la esquina superior izquierda de la interfaz para que aparezca la interfaz de cambio de humano digital.
4.2.5 Cambio entre los modos horizontal y vertical
El modo horizontal es adecuado para clases virtuales y presentaciones de conocimiento empresarial; el modo vertical es adecuado para ordenadores todo en uno con pantallas grandes. Haga clic en el menú de la derecha para cambiar de modo.
4.3 Cambio entre modos de diálogo
4.3.1 Modo de activación
El sistema viene configurado por defecto en modo de activación, que se activa automáticamente e inicia una conversación cuando el humano digital oye que alguien lo llama por su "nombre".
4.3.2 Modo de entrada de texto
Haz clic en el menú "Modo de entrada" y aparecerá un cuadro de texto. Escribe el contenido que desees para hablar con el humano digital.
4.3.3 Modo de diálogo del teléfono móvil
Haz clic en el menú "Entrada de voz" y, a continuación, mantén pulsado el botón de abajo para conversar con el humano digital mediante la voz.
4.4 Gestión de aplicaciones
4.4.1 Actualización de la aplicación
Permite actualizar en línea el cliente humano digital a través de la aplicación.
4.4.2 Autorización de la aplicación
Permite la gestión de autorizaciones de aplicaciones, lo que posibilita el control sobre los permisos de uso de los diferentes usuarios.








V. Sistema de gestión de backend
5.1 Funcionamiento del sistema
5.1.1 Descarga del cliente
Descargue los paquetes de instalación del cliente para cada plataforma desde el panel de administración.
5.1.2 Gestión de Recursos Humanos con Múltiples Cifras
Proporcionamos desde uno hasta docenas de avatares digitales para diferentes clientes, que se gestionan de forma uniforme a través de la interfaz de información del avatar.
5.1.3 Cambio de nombre digital de personas
El nombre del humano digital es la palabra clave; cuando el humano digital escucha este nombre, comienza a conversar.
5.1.4 Consulta del registro de diálogo
Puedes filtrar por diferentes usuarios digitales para ver los registros de conversaciones recientes.
5.1.5 Autorización del sistema de usuario
Se otorgan diferentes permisos de menú y de datos a diferentes tipos de usuarios.
5.2 Gestión de la base de conocimientos de documentos
📌 Los usuarios habituales pueden simplemente subir archivos; no es necesario realizar ajustes en la estrategia de segmentación.
5.2.1 Gestión de archivos
Seleccione la carga de archivos locales (se admite arrastrar y soltar), el sistema dividirá el archivo según la estrategia predeterminada: chunk_size=500, chunk_overlap=50, separator=['\n\n'].
5.2.2 Gestión segmentada
Permite visualizar y ajustar manualmente segmentos de los documentos cargados.
5.3 Gestión de la base de conocimientos de control de calidad
5.3.1 Gestión de parejas de preguntas y respuestas
Mantenga manualmente pares estándar de preguntas y respuestas, adecuados para escenarios de respuesta precisa y de alta frecuencia.
5.3.2 Respuestas precisas a preguntas y respuestas
Permite configurar reglas de coincidencia precisas para garantizar que se devuelva una respuesta estándar preestablecida para una pregunta específica.
5.4 Modelo grande relacionado
5.4.1 Selección del modelo
Permite la conmutación flexible entre el modelo de red pública a gran escala y el modelo de despliegue local.
5.4.2 Entrenamiento del modelo
Permite ajustar y entrenar modelos basados en datos privados de la empresa.
5.5 Flujo de trabajo humano digital
5.5.1 Gestión del flujo de trabajo
Orquesta visualmente el proceso de preguntas y respuestas del humano digital, admitiendo la configuración de nodos mediante arrastrar y soltar.
| Nombre del nodo | Descripción de la función |
|---|---|
| 5.5.2 Nodo inicial | Nodo de inicio del flujo de trabajo (creado automáticamente, no se puede copiar ni eliminar). Configuración: El mensaje de apertura está vacío; recupera automáticamente la hora actual (aaaa-mm-dd hh:mm); almacena los n registros de chat más recientes, cuyo número se puede personalizar. |
| 5.5.3 Nodo de entrada | Recibe el contenido introducido por el usuario en el cuadro de diálogo y lo almacena en la variable user_input, sin necesidad de configuración adicional. |
| 5.5.4 Nodo de salida | Defina el contenido de la respuesta final que se devuelve al usuario. |
| 5.5.5 Nodos de modelo grandes | Llame a LLM para realizar inferencias y generar respuestas. |
| 5.5.6 Nodo auxiliar | Configure los comandos de solicitud a nivel del sistema y los comportamientos del asistente. |
| 5.5.7 Nodo de recuperación de la base de conocimientos de control de calidad | Recuperar pares de preguntas y respuestas coincidentes de la base de conocimientos de preguntas y respuestas. |
| 5.5.8 Nodo de preguntas y respuestas de la base de conocimientos del documento | Recupere el contenido relevante de la base de conocimientos del documento para responder a la pregunta. |
| 5.5.9 Nodo de bifurcación condicional | Determinar el flujo del proceso en función de las condiciones para implementar una lógica de diálogo compleja. |
5.6 Herramientas del sistema
Proporciona herramientas y funciones auxiliares relacionadas con el funcionamiento y el mantenimiento del sistema.











VI. Lado SaaS: Creación de un nuevo ser humano digital
| paso | funcionar | ilustrar |
|---|---|---|
| primer paso | 6.1 Usuarios registrados | Regístrate en la plataforma SaaS. |
| Paso 2 | 6.2.1 Creación de un nuevo flujo de trabajo | Crea un flujo de diálogo para humanos digitales. |
| 6.2.2 Creación de una nueva base de conocimientos | Cargue documentos o configure pares de preguntas y respuestas para el control de calidad. | |
| Paso 3 | 6.3.1 Creación de una nueva imagen de personaje | Elige o personaliza la apariencia de tu humano digital. |
| 6.3.2 Configuración de la asociación | Asegúrese de que el flujo de trabajo y la base de conocimientos de esta persona estén correctamente vinculados. | |
| Paso 4 | 6.4.1 Obtención del número de serie | Haz clic en el pequeño círculo situado en la esquina superior izquierda del dispositivo para comprobar el número de serie del mismo. |
| 6.4.2 Vinculación de dispositivos | Introduzca el número de serie en la sección "Vincular dispositivo" del sistema de gestión. Tras reiniciar la aplicación, el dispositivo mostrará el humano digital recién creado, cuyas respuestas se basan en una base de conocimientos específica. |








VII. Implementación de la privatización
7.1 Configuración del servidor del sistema
| asunto | ilustrar |
|---|---|
| 7.1.1 Máquina humana digital todo en uno | Dispositivos de hardware que integran pantalla táctil, cámara y micrófono, listos para usar nada más sacarlos de la caja. |
| 7.1.2 Servidor de computación de modelos grandes (opcional) | Para ejecutar modelos grandes localmente, se recomienda un servidor con GPU (NVIDIA RTX 3060 o superior) con 16 GB o más de RAM y 50 GB o más de espacio disponible en el disco duro, dependiendo de la concurrencia y el tamaño del modelo. |
7.2 Recopilación de datos del proyecto
| Tipo de datos | ilustrar |
|---|---|
| 7.2.1 Apariencia y voz del personaje | Proporcione un vídeo grabado con pantalla verde o una fotografía de alta definición de la persona objetivo, junto con una muestra de audio de 3 a 10 segundos. |
| 7.2.2 Recopilación de preguntas y respuestas de control de calidad | Recopile las preguntas empresariales más comunes y sus respuestas estándar, e impórtelas a la base de conocimientos de control de calidad. |
| 7.2.3 Procesamiento de datos (RAG) | Organice los documentos de su empresa (admite formatos PDF, Word, TXT, Markdown y otros), y el sistema los analizará automáticamente y generará resultados de búsqueda RAG mejorados. |
7.3 Integración de datos
- 7.3.1 Integración con la base de conocimientos de control de calidad: Importar los pares de preguntas y respuestas de control de calidad compilados al sistema.
- 7.3.2 Integración con la base de conocimientos de documentos: Cargue los documentos de la empresa y el sistema los segmentará e indexará automáticamente.
- 7.3.3 Integración de consultas de base de datos: Al integrarse con la base de datos interna de la empresa, el humano digital puede consultar datos comerciales (como informes, órdenes de trabajo, etc.) en tiempo real.

VIII. Precauciones
8.1 Encendido/apagado temporizado
Configura temporizadores para encender y apagar los dispositivos mediante tabletas, por ejemplo, apagándolos a las 22:00 y encendiéndolos a las 8:00, para garantizar un funcionamiento estable y ahorrar energía.

WeChat
WhatAPP