写真アルバム
I. 製品について
1.1 製品紹介
本製品は、企業におけるプライベート導入に適した音声対話型デジタルヒューマンシステムです。企業、学校、官公庁におけるインテリジェントな音声対話やデータ照会・質疑応答に適用可能です。大規模推論モデル、音声認識モデル、音声合成モデル、ワークフローエンジンに基づいて開発されており、企業の個別データ処理ニーズに合わせて、パブリックネットワークとローカル展開モデルを柔軟に切り替えることができます。ビジネス価値を重視し、軽量かつカスタマイズ性に優れ、迅速な導入が可能です。
1.2 キャラクター描写
独自のキャラクター画像をカスタマイズできるほか、画像ライブラリには10種類以上の画像が用意されています。
1.3 主な利点
当社と他のデジタルヒューマン製造業者との根本的な違いは以下のとおりです。
- マルチ端末での利用:オールインワン端末に限らず、Windowsパソコン、Androidタブレット(授業用サイン)、ウェブページ、公式アカウント、ミニプログラムなど、複数の端末で柔軟に利用できます。
- プライベートな質問応答:インターフェースやデータベースクエリなどを通じて社内データと柔軟に接続できるため、デジタルヒューマンが限定コンテンツに回答したり、レポート、ビデオ、その他のコンテンツを柔軟にクエリしたりすることが可能になります。
- ローカライズされた展開:企業内のイントラネット上で動作する、ローカライズされたプライベート展開をサポートします(すべての大規模モデルとデータはローカルに保存されます)。
1.4 ソフトウェア機能一覧
| シリアルナンバー | カテゴリ | サブアイテム | 例示する |
|---|---|---|---|
| 1 | キャラクターカスタマイズ | 1.1 キャラクターのクローン作成 | グリーンスクリーン撮影:対象者から提供されたグリーンスクリーン撮影動画に基づいてデジタル人間クローンを作成します。AI合成:人物の写真に基づいて人物の画像を生成します。待機、手を下ろして静止、両手を合わせて話す、片手で話す、両手で話すなど、さまざまな動作をサポートします。 |
| 1.2 キャラクターボイスのクローン作成 | 3秒間の高速複製に対応しており、3~10秒間の実際の人間の声の録音を提供することで、その人の声の特徴を素早く再現できます。 | ||
| 1.3 背景設定 | デジタルヒューマンの背景画像を設定および変更するためのオプションを提供します。 | ||
| 2 | 音声技術 | 2.1 音声起動 | デジタルヒューマンに名前を付けることができ、名前を呼ばれるとデジタルヒューマンは積極的に目を覚まし、会話に応じる。 |
| 2.2 音声認識 | 大規模な音声モデルに基づいたこのリアルタイム・エンドツーエンド音声認識フレームワークは、業界トップクラスの単語誤り率と同時推論速度を誇ります。方言認識に対応し、10以上の言語を識別できます。 | ||
| 2.3 音声合成 | 大規模な音声モデルに基づいた音声合成により、複数の音声オプションを提供します。音声アルゴリズム:AEC、ANC、AGC。 |
1.5 デジタルヒューマンオールインワンマシン
カメラとマイクを内蔵し、箱から出してすぐに使えるスマートな対話型端末デバイス。



II. アプリケーションシナリオ
2.1インチタッチスクリーン一体型PC
この縦型タッチスクリーン一体型端末は、ロビーや展示ホールなどの用途に適しており、ユーザーはタッチ操作や音声操作で直接やり取りすることができます。
2.2 電子フォトフレーム
額縁のような形状をしたデジタルヒューマン対話型スクリーンは、家庭やオフィス環境に組み込むことができ、ユーザーは音声認識による質疑応答を通じて、電子フレーム内のデジタルヒューマンと会話することができる。
2.3 展示ホールガイド
学校の歴史博物館、企業のショールーム、博物館などのシナリオに適した、デジタルによる人間中心の説明ソリューション。大型スクリーン一体型ディスプレイに対応。
2.4 産業データクエリ
産業用途向けに設計されたこのデジタルヒューマンは、音声による対話を通じて、生産データ、機器の状態、その他の情報をユーザーが照会することを可能にする。
2.5 Windows PC
| プロジェクト | 仕様 |
|---|---|
| インストール方法 | exeインストーラーを提供します |
| 適用可能な端末 | 演台用コンピュータ/タッチスクリーン一体型マシン |
| CPU | i3以上のプロセッサ |
| 典型的なシナリオ | 教室用演台コンピューター、デジタル人間学際的知識クイズ |
2.6 電子授業サイン
| プロジェクト | 仕様 |
|---|---|
| ディスプレイ画面 | IPS液晶ディスプレイ |
| サイズ | 18.5インチ |
| 解決 | 1920 × 1080 |
| チップ | RK3288 クアッドコア 1.8GHz |
| メモリ | 2GB |
| フラッシュメモリ | 16ギガバイト |
2.7 産業用ロボット犬
四足歩行型のバイオニックロボット犬。複雑な地形を移動でき、音声を通じてユーザーと対話できる、移動式のデジタル人間インタラクションプラットフォーム。
2.8 大規模会議
この特大インタラクティブスクリーンソリューションは、大規模な会議場や講義室などの場面における、デジタルヒューマンの表示とインタラクションに適しています。




III. キャラクタークローニング
3.1 グリーンスクリーン撮影
デジタルヒューマンクローニングは、対象者から提供されたグリーンスクリーン映像に基づいて行われます。撮影はプロ仕様のグリーンスクリーン環境で行う必要があります。高解像度映像の提出後、画像トレーニングは通常1~2営業日以内に完了します。
3.2 写真の組み合わせ
写真を基にAIが生成するアバターは、特殊な機器を必要とせずに、デジタル上の人間の外見を迅速に作成できる。
3.3 サウンドシンセシス
3秒で音声特徴を迅速に再現できます。デジタル音声合成で使用するために、人物の声の特徴を再現するには、わずか3~10秒の実際の音声録音が必要です。



IV. フロントエンドデジタルヒューマン
4.1 デジタルヒューマンに関するQ&A
4.1.1 テキスト応答
デジタルヒューマンは、ユーザーからの質問にプレーンテキスト形式で回答します。これは、一般的な知識に基づく質疑応答のシナリオに適しています。
4.1.2 写真と文章で答える
質問が明示的に「テキストと画像」による回答を求めている場合、デジタルヒューマンは回答にテキストと画像の両方を表示することができる。
4.1.3 動画による回答
質問で明示的に「動画による回答」が求められる場合、デジタルヒューマンはバックエンドに既に設定されている動画素材にアクセスして再生することができます(バックエンドのリソースには、対応する動画素材が存在する必要があります)。
4.2 インターフェースの切り替え
4.2.1 マルチモード切り替え
音声入力モードとテキスト入力モードを自由に切り替えることができます。
4.2.2 複数の背景切り替え
デジタルヒューマンの背景画像の切り替えに対応しています。
4.2.3 マルチ解像度切り替え
1K、2K、4Kなど複数の解像度に対応しており、通常のデバイスから大画面一体型PCまで幅広く対応します。
4.2.4 複数のデジタル人体モデル間の切り替え
Windowsの場合:デジタルヒューマンアプリケーションで実行したいデジタルヒューマンを選択します。Androidの場合:インターフェースの左上隅にあるドットをクリックして、デジタルヒューマン切り替えインターフェースを表示します。
4.2.5 横向きモードと縦向きモードの切り替え
横向きモードは、デジタルヒューマンによる講義や企業知識のプレゼンテーションに適しています。縦向きモードは、大型スクリーン搭載の複合機に適しています。右側のメニューをクリックして切り替えてください。
4.3 対話モードの切り替え
4.3.1 ウェイクアップモード
システムはデフォルトでウェイクアップモードになっており、デジタルヒューマンが誰かが自分の「名前」を呼ぶと自動的に起動して会話を開始する。
4.3.2 テキスト入力モード
「入力モード」メニューをクリックすると、テキスト入力ボックスが表示されます。デジタルヒューマンと会話するための内容を入力してください。
4.3.3 携帯電話の対話モード
「音声入力」メニューをクリックし、下のボタンを長押しすると、音声でデジタルヒューマンと会話できます。
4.4 アプリケーション管理
4.4.1 アプリのアップグレード
アプリを介したデジタルヒューマンクライアントのオンラインアップグレードをサポートします。
4.4.2 アプリ認証
アプリの認証管理をサポートしており、異なるユーザーの使用権限を制御できます。








V. バックエンド管理システム
5.1 システムの動作
5.1.1 クライアントのダウンロード
管理バックエンドから、各プラットフォーム用のクライアントインストールパッケージをダウンロードしてください。
5.1.2 多桁の人的資源管理
当社では、様々なクライアント向けに1体から数十体のデジタルアバターを提供しており、それらはアバター情報インターフェースを通じて一元的に管理されます。
5.1.3 デジタル上の人名変更
デジタルヒューマンの名前はウェイクワードであり、デジタルヒューマンはこの名前を聞くと会話を始める。
5.1.4 ダイアログログ照会
異なるデジタルユーザーで絞り込むことで、最近の会話履歴を表示できます。
5.1.5 ユーザーシステム認証
ユーザーの種類によって、異なるメニュー権限とデータ権限が付与されます。
5.2 文書知識ベース管理
📌 通常のユーザーはファイルをアップロードするだけでよく、セグメンテーション戦略の調整は必要ありません。
5.2.1 ファイル管理
ローカルファイルのアップロード(ドラッグアンドドロップ対応)を選択すると、システムはデフォルトの戦略に従ってファイルを分割します:chunk_size=500、chunk_overlap=50、separator=['\n\n']。
5.2.2 セグメント別管理
アップロードされたドキュメントの一部を表示したり、手動で調整したりすることができます。
5.3 QAナレッジベース管理
5.3.1 質疑応答ペアの管理
高頻度かつ正確な応答が求められるシナリオに適した、標準的な質問と回答のペアを手動で維持管理する。
5.3.2 正確な質疑応答への回答
特定の質問に対して、あらかじめ設定された標準的な回答が返されるように、正確なマッチングルールを設定する機能をサポートしています。
5.4 大規模モデル関連
5.4.1 モデルの選択
公共ネットワークの大規模モデルとローカル展開モデル間の柔軟な切り替えをサポートします。
5.4.2 モデルトレーニング
企業独自のプライベートデータに基づいたモデルの微調整とトレーニングをサポートします。
5.5 デジタルヒューマンワークフロー
5.5.1 ワークフロー管理
デジタルヒューマンの質疑応答プロセスを視覚的にオーケストレーションし、ドラッグ&ドロップによるノード設定をサポートします。
| ノード名 | 機能説明 |
|---|---|
| 5.5.2 ノードの開始 | ワークフロー開始ノード(自動作成され、コピーまたは削除できません)。設定:開始メッセージは空です。現在時刻(yyyy-mm-dd hh:mm)を自動的に取得します。最新の n 個のチャット記録を保存します。記録数はカスタマイズ可能です。 |
| 5.5.3 入力ノード | ユーザーがダイアログボックスに入力した内容を受け取り、user_input変数に格納します。追加の設定は不要です。 |
| 5.5.4 出力ノード | ユーザーに返される最終的なレスポンスコンテンツを定義します。 |
| 5.5.5 大規模モデルノード | LLMを呼び出して推論を実行し、応答を生成します。 |
| 5.5.6 アシスタントノード | システムレベルのプロンプトコマンドとアシスタントの動作を設定します。 |
| 5.5.7 QA知識ベース検索ノード | QAナレッジベースから、一致する質問と回答のペアを取得します。 |
| 5.5.8 ドキュメント知識ベースの質疑応答ノード | ドキュメントの知識ベースから関連コンテンツを取得し、質問に答えます。 |
| 5.5.9 条件分岐ノード | 複雑な対話ロジックを実装するための条件に基づいて、プロセスの流れを決定する。 |
5.6 システムツール
システムの運用および保守に関連する補助ツールと機能を提供します。











VI. SaaS側:新しいデジタルヒューマンの創造
| ステップ | 操作する | 例示する |
|---|---|---|
| 最初のステップ | 6.1 登録ユーザー | SaaSプラットフォームでアカウントを登録してください。 |
| ステップ2 | 6.2.1 新しいワークフローの作成 | デジタルヒューマンのための対話フローを作成する。 |
| 6.2.2 新しい知識ベースの作成 | ドキュメントをアップロードするか、QAの質疑応答ペアを設定します。 | |
| ステップ3 | 6.3.1 新しいキャラクター画像の作成 | デジタルヒューマンの外見を選択またはカスタマイズできます。 |
| 6.3.2 関連付けの設定 | この人物のワークフローとナレッジベースが適切に連携していることを確認してください。 | |
| ステップ4 | 6.4.1 シリアル番号の取得 | デバイスの左上隅にある小さな丸をクリックすると、デバイスのシリアル番号を確認できます。 |
| 6.4.2 デバイスバインディング | 管理システムの「デバイスのバインド」セクションにシリアル番号を入力してください。アプリを再起動すると、デバイスに新しく作成されたデジタルヒューマンが表示され、その回答は専用の知識ベースに基づいています。 |








VII. 民営化の展開
7.1 システムサーバー構成
| 案件 | 例示する |
|---|---|
| 7.1.1 デジタルヒューマン一体型マシン | タッチスクリーン、カメラ、マイクを統合したハードウェアデバイスで、箱から出してすぐに使用できます。 |
| 7.1.2 大規模モデル計算サーバー(オプション) | 大規模なモデルをローカルで実行する場合、同時実行数とモデルサイズに応じて、16GB以上のRAMと50GB以上のハードディスク空き容量を備えたGPUサーバー(NVIDIA RTX 3060以上)を推奨します。 |
7.2 プロジェクトデータのコンパイル
| データ型 | 例示する |
|---|---|
| 7.2.1 キャラクターの外見と声 | 対象人物のグリーンスクリーン動画または高解像度写真と、3~10秒の音声サンプルを提供してください。 |
| 7.2.2 QA 質疑応答集 | 企業でよく寄せられる質問とその標準的な回答をまとめ、QAナレッジベースにインポートする。 |
| 7.2.3 データ処理(RAG) | 企業文書(PDF、Word、TXT、Markdownなどの形式に対応)を整理すると、システムが自動的に解析し、高度なRAG検索結果を生成します。 |
7.3 データ統合
- 7.3.1 QAナレッジベースとの統合:コンパイル済みのQA質問と回答のペアをシステムにインポートします。
- 7.3.2 ドキュメント知識ベースとの統合:企業ドキュメントをアップロードすると、システムが自動的にそれらをセグメント化してインデックス化します。
- 7.3.3 データベースクエリ統合:デジタルヒューマンは、企業の内部データベースと統合することで、ビジネスデータ(レポート、作業指示書など)をリアルタイムでクエリできます。

VIII.注意事項
8.1 タイマーによる電源オン/オフ
タブレット端末を使って電源のオン/オフタイマーを設定することで、例えば午後10時に電源を切り、午前8時に電源を入れるなど、安定した動作を確保し、エネルギーを節約できます。

WeChat
WhatAPP