Fotoalbum
I. Über das Produkt
1.1 Produkteinführung
Dieses Produkt ist ein sprachgesteuertes, digitales Mensch-System, das sich für den privaten Einsatz in Unternehmen eignet. Es ist für intelligente Sprachinteraktion und Datenabfrage/Fragebeantwortung in Unternehmen, Schulen und Behörden einsetzbar. Basierend auf einem umfassenden Inferenzmodell, einem Spracherkennungsmodell, einem Sprachsynthesemodell und einer Workflow-Engine ermöglicht es einen flexiblen Wechsel zwischen öffentlichen Netzwerken und lokalen Bereitstellungsmodellen, um den individuellen Datenverarbeitungsanforderungen von Unternehmen gerecht zu werden. Es ist nutzerorientiert, ressourcenschonend, anpassbar und schnell einsatzbereit.
1.2 Charakterdarstellung
Es unterstützt die Anpassung eines eigenen Charakterbildes und bietet mehr als zehn Bilder zur Auswahl in der Bildbibliothek.
1.3 Kernvorteile
Der entscheidende Unterschied zwischen uns und anderen Herstellern digitaler Menschen:
- Nutzung auf mehreren Endgeräten: Es ist nicht auf All-in-One-Geräte beschränkt, sondern kann flexibel auf verschiedenen Endgeräten wie Windows-Computern, Android-Tablets (Klassenschildern), Webseiten, offiziellen Konten und Miniprogrammen genutzt werden.
- Private Fragebeantwortung: Es kann flexibel über Schnittstellen, Datenbankabfragen usw. mit internen Unternehmensdaten verbunden werden, sodass digitale Menschen exklusive Inhalte beantworten und Berichte, Videos und andere Inhalte flexibel abgefragt werden können.
- Lokalisierte Bereitstellung: Unterstützt die lokale private Bereitstellung innerhalb von Unternehmen, die im Intranet ausgeführt wird (alle großen Modelle und Daten sind lokal).
1.4 Liste der Softwarefunktionen
| Seriennummer | Kategorie | Unterpunkt | veranschaulichen |
|---|---|---|---|
| 1 | Charakteranpassung | 1.1 Charakterklonen | Greenscreen-Aufnahmen: Digitales Klonen von Personen auf Basis von Greenscreen-Aufnahmevideos, die von der Zielperson bereitgestellt werden; KI-Synthese: Generierung eines Personenbildes anhand eines Fotos der Person; Unterstützt verschiedene Aktionen wie Warten, Stillstehen mit gesenkten Händen, Sprechen mit zusammengelegten Händen, Sprechen mit einer Hand und Sprechen mit beiden Händen. |
| 1.2 Charakterstimmenklonen | Es unterstützt eine 3-sekündige Schnellreplikation und stellt 3-10 Sekunden echte menschliche Sprachaufnahmen bereit, um die Stimmmerkmale der Person schnell nachzubilden. | ||
| 1.3 Hintergrundeinstellungen | Bietet Optionen zum Festlegen und Ändern des Hintergrundbildes des digitalen Menschen. | ||
| 2 | Sprachtechnologie | 2.1 Sprachaufweckfunktion | Es unterstützt die Benennung digitaler Menschen, und der digitale Mensch wird aktiv aufwachen und sich an einem Gespräch beteiligen, wenn er hört, wie jemand seinen Namen ruft. |
| 2.2 Spracherkennung | Dieses auf einem umfangreichen Sprachmodell basierende Echtzeit-Spracherkennungssystem zeichnet sich durch eine branchenführende Fehlerrate und gleichzeitige Inferenzgeschwindigkeit aus. Es unterstützt die Dialekterkennung und kann mehr als zehn nationale Sprachen identifizieren. | ||
| 2.3 Sprachsynthese | Sprachsynthese basierend auf einem umfangreichen Sprachmodell mit vielfältigen Stimmoptionen. Audioalgorithmen: AEC, ANC, AGC. |
1.5 Digitale Mensch-All-in-One-Maschine
Ein intelligentes, interaktives Terminalgerät mit integrierter Kamera und Mikrofon, das sofort einsatzbereit ist.



II. Anwendungsszenarien
2,1-Zoll-Touchscreen-All-in-One-PC
Dieses vertikale Touchscreen-All-in-One-Gerät eignet sich für Einsatzbereiche wie Lobbys und Messehallen und ermöglicht es den Benutzern, direkt per Berührung oder Sprache zu interagieren.
2.2 Elektronischer Bilderrahmen
Der interaktive Bildschirm mit digitalem Menschen in Form eines Bilderrahmens kann in Wohn- und Büroumgebungen integriert werden und ermöglicht es den Benutzern, über sprachgesteuerte Fragen und Antworten mit dem digitalen Menschen innerhalb des elektronischen Rahmens zu kommunizieren.
2.3 Ausstellungshallenführer
Eine digitale, auf menschlichen Erklärungen basierende Lösung, die sich für Szenarien wie Schulmuseen, Firmenausstellungsräume und Museen eignet und die integrierte Anzeige auf großen Bildschirmen unterstützt.
2.4 Industriedatenabfrage
Dieser für industrielle Szenarien konzipierte digitale Mensch ermöglicht es Benutzern, Produktionsdaten, Gerätestatus und andere Informationen per Sprachinteraktion abzufragen.
2,5-Zoll-Windows-PC
| Projekt | Spezifikation |
|---|---|
| Installationsmethode | Bietet ein EXE-Installationsprogramm. |
| Anwendbare Anschlüsse | Podium-Computer/Touchscreen-All-in-One-Gerät |
| CPU | i3-Prozessoren und höher |
| Typische Szenarien | Klassenzimmer-Podium-Computer, digitales menschliches interdisziplinäres Wissensquiz |
2.6 Elektronisches Klassenschild
| Projekt | Spezifikation |
|---|---|
| Bildschirm | IPS-LCD-Display |
| Größe | 18,5 Zoll |
| Auflösung | 1920 × 1080 |
| Chip | RK3288 Quad-Core 1,8 GHz |
| Erinnerung | 2 GB |
| Flash-Speicher | 16 GB |
2.7 Industrieroboterhund
Ein vierbeiniger bionischer Roboterhund, eine mobile digitale Mensch-Maschine-Interaktionsplattform, die sich in komplexem Gelände bewegen und per Sprache mit Benutzern interagieren kann.
2.8 Großkonferenzen
Die Lösung mit extragroßem interaktivem Bildschirm eignet sich für die digitale Darstellung und Interaktion von Personen in Szenarien wie großen Konferenzen und Hörsälen.




III. Charakterklonen
3.1 Greenscreen-Aufnahmen
Die digitale Klonung von Personen erfolgt anhand von Greenscreen-Videos, die von der Zielperson bereitgestellt werden. Die Aufnahmen müssen in einer professionellen Greenscreen-Umgebung durchgeführt werden. Nach Einreichung des hochauflösenden Videomaterials kann das Bildtraining in der Regel innerhalb von ein bis zwei Werktagen abgeschlossen werden.
3.2 Fotokombination
Mithilfe von KI generierten Avataren auf Basis von Fotos können schnell digitale menschliche Erscheinungsbilder erzeugt werden, ohne dass dafür spezielle Ausrüstung benötigt wird.
3.3 Klangsynthese
Unterstützt die schnelle Nachbildung von Stimmmerkmalen in 3 Sekunden. Nur 3-10 Sekunden Sprachaufnahme einer realen Person sind erforderlich, um die Stimmmerkmale der Person für die digitale Sprachsynthese nachzubilden.



IV. Front-End Digital Human
4.1 Digitale Menschen – Fragen und Antworten
4.1.1 Textantwort
Der digitale Mensch beantwortet Benutzerfragen im Klartextformat, was für allgemeine wissensbasierte Frage-Antwort-Szenarien geeignet ist.
4.1.2 Antwort mit Bildern und Text
Wenn eine Frage ausdrücklich eine Antwort in Form von Text und Bildern erfordert, kann der digitale Mensch in der Antwort sowohl Text als auch Bilder anzeigen.
4.1.3 Videoantworten
Wenn die Frage ausdrücklich eine „Videoantwort“ erfordert, kann der digitale Mensch auf die bereits im Backend konfigurierten Videomaterialien zugreifen und diese abspielen (die Backend-Ressourcen müssen über die entsprechenden Videomaterialien verfügen).
4.2 Schnittstellenumschaltung
4.2.1 Multimodus-Umschaltung
Sie können jederzeit zwischen Sprach- und Texteingabemodus wechseln.
4.2.2 Mehrfaches Umschalten zwischen Hintergründen
Unterstützt das Ändern des Hintergrundbildes des digitalen Menschen.
4.2.3 Umschaltung zwischen mehreren Auflösungen
Es bietet verschiedene Auflösungen, darunter 1K, 2K und 4K, und eignet sich sowohl für normale Geräte als auch für All-in-One-Computer mit großem Bildschirm.
4.2.4 Wechseln zwischen mehreren digitalen menschlichen Figuren
Windows: Wählen Sie den digitalen Menschen aus, den Sie über die Anwendung für digitale Menschen steuern möchten; Android: Klicken Sie auf den Punkt in der oberen linken Ecke der Benutzeroberfläche, um die Benutzeroberfläche zum Wechseln der digitalen Menschen aufzurufen.
4.2.5 Umschalten zwischen Quer- und Hochformat
Der Querformatmodus eignet sich für interaktive Vorträge und Unternehmenspräsentationen; der Hochformatmodus ist ideal für All-in-One-Geräte mit großem Bildschirm. Klicken Sie auf das Menü rechts, um zwischen den Modi zu wechseln.
4.3 Umschalten zwischen Dialogmodi
4.3.1 Aufwachmodus
Das System ist standardmäßig im Aufwachmodus, der automatisch aktiviert wird und ein Gespräch beginnt, sobald der digitale Mensch seinen Namen hört.
4.3.2 Texteingabemodus
Klicken Sie auf das Menü „Eingabemodus“, woraufhin sich ein Texteingabefeld öffnet. Geben Sie den gewünschten Inhalt ein, um mit dem digitalen Menschen zu kommunizieren.
4.3.3 Mobiltelefon-Dialogmodus
Klicken Sie auf das Menü „Spracheingabe“ und halten Sie dann die darunter stehende Taste gedrückt, um per Sprache mit dem digitalen Menschen zu sprechen.
4.4 App-Verwaltung
4.4.1 App-Upgrade
Unterstützt Online-Upgrades des digitalen menschlichen Clients über die App.
4.4.2 App-Autorisierung
Es unterstützt die Verwaltung von App-Autorisierungen und ermöglicht so die Kontrolle über die Nutzungsberechtigungen verschiedener Benutzer.








V. Backend-Managementsystem
5.1 Systembetrieb
5.1.1 Client-Download
Laden Sie die Client-Installationspakete für jede Plattform vom Management-Backend herunter.
5.1.2 Mehrstelliges Personalmanagement
Wir stellen für verschiedene Kunden ein bis Dutzende digitale Avatare bereit, die einheitlich über die Avatar-Informationsschnittstelle verwaltet werden.
5.1.3 Digitale Umbenennung von Personen
Der Name des digitalen Menschen ist das Aktivierungswort; wenn der digitale Mensch diesen Namen hört, beginnt er zu sprechen.
5.1.4 Abfrage des Dialogprotokolls
Sie können nach verschiedenen digitalen Nutzern filtern, um die letzten Gesprächsverläufe anzuzeigen.
5.1.5 Benutzer-Systemautorisierung
Unterschiedlichen Benutzertypen werden unterschiedliche Menü- und Datenberechtigungen erteilt.
5.2 Dokumenten-Wissensdatenbankmanagement
📌 Normale Benutzer können einfach Dateien hochladen; Anpassungen an der Segmentierungsstrategie sind nicht erforderlich.
5.2.1 Dateiverwaltung
Wählen Sie „Lokaler Datei-Upload“ (Drag & Drop wird unterstützt). Das System teilt die Datei gemäß der Standardstrategie auf: chunk_size=500, chunk_overlap=50, separator=['\n\n'].
5.2.2 Segmentiertes Management
Es unterstützt das Anzeigen und manuelle Anpassen von Abschnitten hochgeladener Dokumente.
5.3 QA-Wissensdatenbankmanagement
5.3.1 Management von Frage-Antwort-Paaren
Manuell pflegen: Standardisierte Frage-Antwort-Paare, geeignet für häufige, präzise Antwortszenarien.
5.3.2 Präzise Antworten auf Fragen und Antworten
Es unterstützt die Konfiguration präziser Abgleichsregeln, um sicherzustellen, dass für eine bestimmte Frage eine voreingestellte Standardantwort zurückgegeben wird.
5.4 Großes Modell (bezogen)
5.4.1 Modellauswahl
Es unterstützt ein flexibles Umschalten zwischen dem großen öffentlichen Netzwerkmodell und dem lokalen Bereitstellungsmodell.
5.4.2 Modelltraining
Es unterstützt die Feinabstimmung und das Training von Modellen auf Basis von unternehmensinternen Daten.
5.5 Digitaler Mensch-Workflow
5.5.1 Workflow-Management
Visuelle Orchestrierung des Frage-Antwort-Prozesses des digitalen Menschen, Unterstützung der Drag-and-Drop-Knotenkonfiguration.
| Knotenname | Funktionsbeschreibung |
|---|---|
| 5.5.2 Startknoten | Workflow-Startknoten (automatisch erstellt, kann nicht kopiert oder gelöscht werden). Konfiguration: Die Eröffnungsnachricht ist leer; die aktuelle Zeit (JJJJ-MM-TT HH:MM) wird automatisch abgerufen; die letzten n Chatverläufe werden gespeichert, die Anzahl der Verläufe ist anpassbar. |
| 5.5.3 Eingabeknoten | Es empfängt den vom Benutzer im Dialogfeld eingegebenen Inhalt und speichert ihn in der Variable user_put, ohne dass eine zusätzliche Konfiguration erforderlich ist. |
| 5.5.4 Ausgabeknoten | Definiere den endgültigen Antwortinhalt, der an den Benutzer zurückgegeben wird. |
| 5.5.5 Große Modellknoten | Rufen Sie LLM auf, um Inferenz durchzuführen und Antworten zu generieren. |
| 5.5.6 Assistentenknoten | Konfigurieren Sie systemweite Eingabeaufforderungsbefehle und Assistentenverhalten. |
| 5.5.7 QA-Wissensdatenbank-Abrufknoten | Übereinstimmende Frage-Antwort-Paare aus der QA-Wissensdatenbank abrufen. |
| 5.5.8 Knoten „Dokumentenwissensdatenbank – Fragen und Antworten“ | Um die Frage zu beantworten, rufen Sie relevante Inhalte aus der Dokumentenwissensdatenbank ab. |
| 5.5.9 Bedingter Verzweigungsknoten | Den Ablauf des Prozesses anhand von Bedingungen bestimmen, um eine komplexe Dialoglogik zu implementieren. |
5.6 Systemwerkzeuge
Bietet Hilfswerkzeuge und Funktionen für den Systembetrieb und die Systemwartung.











VI. SaaS-Seite: Die Schaffung eines neuen digitalen Menschen
| Schritt | arbeiten | veranschaulichen |
|---|---|---|
| erster Schritt | 6.1 Registrierte Benutzer | Registrieren Sie ein Konto auf der SaaS-Plattform. |
| Schritt 2 | 6.2.1 Erstellen eines neuen Workflows | Erstellen Sie einen Dialogablauf für digitale Menschen. |
| 6.2.2 Erstellung einer neuen Wissensbasis | Dokumente hochladen oder Frage-Antwort-Paare für die Qualitätssicherung konfigurieren. | |
| Schritt 3 | 6.3.1 Erstellen eines neuen Charakterbildes | Wähle oder passe das Aussehen deines digitalen Menschen an. |
| 6.3.2 Konfiguration der Assoziation | Stellen Sie sicher, dass der Arbeitsablauf und die Wissensdatenbank dieser Person ordnungsgemäß verknüpft sind. | |
| Schritt 4 | 6.4.1 Beschaffung der Seriennummer | Klicken Sie auf den kleinen Kreis in der oberen linken Ecke des Geräts, um die Seriennummer des Geräts zu überprüfen. |
| 6.4.2 Gerätebindung | Geben Sie die Seriennummer im Bereich „Gerät binden“ des Verwaltungssystems ein. Nach dem Neustart der App zeigt das Gerät den neu erstellten digitalen Menschen an, dessen Antworten auf einer speziellen Wissensdatenbank basieren. |








VII. Umsetzung der Privatisierung
7.1 Systemserverkonfiguration
| Gegenstand | veranschaulichen |
|---|---|
| 7.1.1 Digitale Mensch-All-in-One-Maschine | Hardwaregeräte mit integriertem Touchscreen, Kamera und Mikrofon, die sofort einsatzbereit sind. |
| 7.1.2 Großer Modellrechnerserver (optional) | Für die lokale Ausführung großer Modelle wird ein GPU-Server (NVIDIA RTX 3060 oder höher) mit mindestens 16 GB RAM und mindestens 50 GB freiem Festplattenspeicher empfohlen, abhängig von der Anzahl der gleichzeitigen Ausführungen und der Modellgröße. |
7.2 Zusammenstellung der Projektdaten
| Datentyp | veranschaulichen |
|---|---|
| 7.2.1 Aussehen und Stimme der Figur | Bitte stellen Sie ein Video mit Greenscreen oder ein hochauflösendes Foto der Zielperson sowie eine 3- bis 10-sekündige Audioprobe zur Verfügung. |
| 7.2.2 Zusammenstellung der Fragen und Antworten | Stellen Sie häufig gestellte Fragen und Standardantworten für Unternehmen zusammen und importieren Sie diese in die QA-Wissensdatenbank. |
| 7.2.3 Datenverarbeitung (RAG) | Organisieren Sie Unternehmensdokumente (unterstützt PDF, Word, TXT, Markdown und andere Formate), und das System analysiert sie automatisch und generiert erweiterte RAG-Suchergebnisse. |
7.3 Datenintegration
- 7.3.1 Integration mit der QA-Wissensdatenbank: Importieren Sie die zusammengestellten QA-Fragen und -Antworten in das System.
- 7.3.2 Integration mit der Dokumenten-Wissensdatenbank: Unternehmensdokumente werden hochgeladen, und das System segmentiert und indexiert sie automatisch.
- 7.3.3 Datenbankabfrageintegration: Durch die Integration mit der internen Datenbank des Unternehmens kann der digitale Mensch Geschäftsdaten (wie Berichte, Arbeitsaufträge usw.) in Echtzeit abfragen.

VIII. Vorsichtsmaßnahmen
8.1 Zeitgesteuertes Ein-/Ausschalten
Um einen stabilen Betrieb zu gewährleisten und Energie zu sparen, können Sie Timer für das Ein- und Ausschalten über Tablet-Geräte einstellen, z. B. Ausschalten um 22 Uhr und Einschalten um 8 Uhr.

WeChat
WhatAPP