사진 앨범
I. 제품 소개
1.1 제품 소개
본 제품은 기업 내 구축에 적합한 음성 상호작용 디지털 휴먼 시스템입니다. 기업, 학교, 정부 기관 등에서 지능형 음성 상호작용 및 데이터 조회/질의응답에 활용할 수 있습니다. 대규모 추론 모델, 음성 인식 모델, 음성 합성 모델, 워크플로우 엔진을 기반으로 개발되었으며, 공용 네트워크와 로컬 구축 모드를 유연하게 전환하여 기업의 맞춤형 데이터 처리 요구사항을 충족할 수 있습니다. 비즈니스 가치에 중점을 두고 있으며, 경량화 및 맞춤 설정이 가능하고, 신속하게 구축할 수 있습니다.
1.2 인물 묘사
이 앱은 사용자가 직접 캐릭터 이미지를 만들 수 있도록 지원하며, 이미지 라이브러리에서 10개 이상의 이미지를 선택할 수 있도록 제공합니다.
1.3 핵심 장점
우리와 다른 디지털 휴먼 제조업체와의 핵심적인 차이점은 다음과 같습니다.
- 다중 단말기 사용: 올인원 기기에만 국한되지 않고 윈도우 컴퓨터, 안드로이드 태블릿(수업용), 웹페이지, 공식 계정, 미니 프로그램 등 다양한 단말기에서 유연하게 사용할 수 있습니다.
- 비공개 질문 답변: 인터페이스, 데이터베이스 쿼리 등을 통해 기업 내부 데이터와 유연하게 연결하여 디지털 휴먼이 특정 콘텐츠에 대한 답변을 제공하고 보고서, 비디오 및 기타 콘텐츠를 유연하게 검색할 수 있도록 지원합니다.
- 로컬 배포: 기업 내 인트라넷에서 실행되는 로컬 프라이빗 배포를 지원합니다(모든 대형 모델 및 데이터는 로컬에 저장됨).
1.4 소프트웨어 기능 목록
| 일련번호 | 범주 | 하위 항목 | 설명하다 |
|---|---|---|---|
| 1 | 캐릭터 커스터마이징 | 1.1 문자 복제 | 그린 스크린 촬영: 대상이 제공하는 그린 스크린 촬영 영상을 기반으로 디지털 인간 복제; AI 합성: 대상 사진을 기반으로 인물 이미지 생성; 대기, 손을 내리고 가만히 서 있기, 손을 모아 말하기, 한 손으로 말하기, 양손으로 말하기 등 다양한 동작 지원. |
| 1.2 캐릭터 음성 복제 | 이 기능은 3초 단위의 빠른 음성 복제를 지원하며, 3~10초 분량의 실제 사람 목소리 녹음을 제공하여 해당 인물의 음성 특징을 신속하게 복제할 수 있도록 합니다. | ||
| 1.3 배경 설정 | 디지털 휴먼의 배경 이미지를 설정하고 변경할 수 있는 옵션을 제공합니다. | ||
| 2 | 음성 기술 | 2.1 음성唤醒 기능 | 이 기능은 디지털 인간에게 이름을 지어줄 수 있도록 지원하며, 디지털 인간은 누군가 자신의 이름을 부르면 능동적으로 깨어나 대화에 참여합니다. |
| 2.2 음성 인식 | 대규모 음성 모델을 기반으로 하는 이 실시간 엔드투엔드 음성 인식 프레임워크는 업계 최고 수준의 단어 오류율과 동시 추론 속도를 자랑합니다. 방언 인식을 지원하며 10개 이상의 국가 언어를 식별할 수 있습니다. | ||
| 2.3 음성 합성 | 대규모 음성 모델 기반의 음성 합성으로 다양한 음성 옵션을 제공합니다. 오디오 알고리즘: AEC, ANC, AGC. |
1.5 디지털 휴먼 올인원 머신
카메라와 마이크가 내장된 스마트 인터랙티브 단말 장치로, 개봉 즉시 사용 가능합니다.



II. 적용 시나리오
2.1인치 터치스크린 올인원 PC
이 세로형 터치스크린 올인원 기기는 로비나 전시장 같은 공간에 적합하며, 사용자가 터치나 음성으로 직접 상호 작용할 수 있도록 설계되었습니다.
2.2 전자 액자
액자 모양의 디지털 휴먼 인터랙티브 스크린은 가정 및 사무실 환경에 통합될 수 있으며, 사용자는 음성 인식 질문 및 답변을 통해 전자 액자 안의 디지털 휴먼과 대화할 수 있습니다.
2.3 전시관 안내
학교 역사 박물관, 기업 쇼룸, 박물관 등과 같은 환경에 적합한 디지털 기반의 인간 중심 설명 솔루션으로, 대형 스크린 통합 디스플레이를 지원합니다.
2.4 산업 데이터 조회
산업 현장에 맞춰 설계된 이 디지털 휴먼은 음성 상호작용을 통해 사용자가 생산 데이터, 장비 상태 및 기타 정보를 조회할 수 있도록 해줍니다.
2.5 윈도우 PC
| 프로젝트 | 사양 |
|---|---|
| 설치 방법 | 실행 파일 설치 프로그램을 제공합니다. |
| 적용 가능한 단말기 | 포디움 컴퓨터/터치스크린 일체형 기기 |
| CPU | i3 이상 프로세서 |
| 일반적인 시나리오 | 교실 연단 컴퓨터, 디지털 인간, 학제간 지식 퀴즈 |
2.6 전자식 수업 안내판
| 프로젝트 | 사양 |
|---|---|
| 디스플레이 화면 | IPS LCD 디스플레이 |
| 크기 | 18.5인치 |
| 해결 | 1920 × 1080 |
| 칩 | RK3288 쿼드코어 1.8GHz |
| 메모리 | 2GB |
| 플래시 메모리 | 16GB |
2.7 산업용 로봇 개
네 발로 걷는 생체공학 로봇 개는 복잡한 지형을 이동할 수 있고 음성을 통해 사용자와 상호 작용할 수 있는 이동형 디지털 인간 상호 작용 플랫폼입니다.
2.8 대규모 컨퍼런스
초대형 인터랙티브 스크린 솔루션은 대규모 회의장이나 강당과 같은 환경에서 디지털 휴먼 디스플레이 및 상호 작용에 적합합니다.




III. 캐릭터 복제
3.1 그린 스크린 촬영
디지털 인간 복제는 대상자가 제공한 그린 스크린 영상을 기반으로 진행됩니다. 촬영은 전문적인 그린 스크린 환경에서 이루어져야 합니다. 고화질 영상 제출 후, 이미지 학습은 일반적으로 1~2일(영업일 기준) 내에 완료됩니다.
3.2 사진 조합
사진을 기반으로 AI가 생성한 아바타는 특수 장비 없이도 빠르게 디지털 인간의 모습을 만들어낼 수 있습니다.
3.3 사운드 합성
3초 만에 빠른 음성 특징 복제를 지원합니다. 실제 사람의 음성을 3~10초만 녹음하면 디지털 음성 합성에 사용할 수 있는 음성 특징을 복제할 수 있습니다.



IV. 프런트엔드 디지털 휴먼
4.1 디지털 휴먼 Q&A
4.1.1 텍스트 응답
디지털 휴먼은 사용자의 질문에 일반 텍스트 형식으로 답변하며, 이는 일반적인 지식 기반 질의응답 시나리오에 적합합니다.
4.1.2 그림과 글로 답하기
질문에서 "텍스트와 이미지" 답변을 명시적으로 요구하는 경우, 디지털 휴먼은 답변에 텍스트와 이미지를 모두 표시할 수 있습니다.
4.1.3 비디오 답변
질문에서 "영상 답변"을 명시적으로 요구하는 경우, 디지털 휴먼은 백엔드에 이미 구성된 영상 자료에 접근하여 재생할 수 있습니다(백엔드 리소스에는 해당 영상 자료가 있어야 합니다).
4.2 인터페이스 전환
4.2.1 멀티모드 스위칭
음성 입력 모드와 텍스트 입력 모드를 자유롭게 전환할 수 있습니다.
4.2.2 다중 백그라운드 전환
디지털 휴먼의 배경 이미지를 변경하는 기능을 지원합니다.
4.2.3 다중 해상도 전환
이 제품은 1K, 2K, 4K를 포함한 다양한 해상도를 제공하여 일반 기기는 물론 대형 화면의 올인원 기기에도 적합합니다.
4.2.4 여러 디지털 인체 형상 간 전환
Windows: 디지털 휴먼 애플리케이션을 실행할 디지털 휴먼을 선택하십시오. Android: 인터페이스 왼쪽 상단의 점을 클릭하여 디지털 휴먼 전환 인터페이스를 불러오십시오.
4.2.5 가로 모드와 세로 모드 전환
가로 모드는 디지털 휴먼 강의 및 회사 지식 프레젠테이션에 적합하고, 세로 모드는 대형 화면의 올인원 기기에 적합합니다. 오른쪽 메뉴를 클릭하여 모드를 전환하세요.
4.3 대화 모드 전환
4.3.1 절전 모드
이 시스템은 기본적으로 웨이크업 모드로 설정되어 있어, 디지털 휴먼이 누군가 자신의 "이름"을 부르는 소리를 들으면 자동으로 깨어나 대화를 시작합니다.
4.3.2 텍스트 입력 모드
"입력 모드" 메뉴를 클릭하면 텍스트 입력 상자가 나타납니다. 디지털 휴먼과 대화하려면 관련 내용을 입력하세요.
4.3.3 휴대폰 대화 모드
"음성 입력" 메뉴를 클릭한 다음 아래 버튼을 길게 눌러 음성으로 디지털 인간과 대화하세요.
4.4 앱 관리
4.4.1 앱 업그레이드
앱을 통해 디지털 휴먼 클라이언트의 온라인 업그레이드를 지원합니다.
4.4.2 앱 권한 부여
이 서비스는 앱 권한 관리를 지원하여 사용자별 사용 권한을 제어할 수 있도록 합니다.








V. 백엔드 관리 시스템
5.1 시스템 작동
5.1.1 클라이언트 다운로드
관리 백엔드에서 각 플랫폼용 클라이언트 설치 패키지를 다운로드하십시오.
5.1.2 다자릿수 인적 자원 관리
저희는 고객별로 하나에서 수십 개에 이르는 디지털 아바타를 제공하며, 이러한 아바타는 아바타 정보 인터페이스를 통해 통합적으로 관리됩니다.
5.1.3 디지털 휴먼 이름 변경
디지털 인간의 이름은 웨이크 워드(깨우는 단어)입니다. 디지털 인간은 이 이름을 들으면 대화를 시작합니다.
5.1.4 대화 로그 조회
다양한 디지털 사용자별로 필터링하여 최근 대화 기록을 볼 수 있습니다.
5.1.5 사용자 시스템 권한 부여
사용자 유형에 따라 서로 다른 메뉴 권한과 데이터 권한이 부여됩니다.
5.2 문서 지식 기반 관리
📌 일반 사용자는 파일을 간단히 업로드할 수 있으며, 세분화 전략을 조정할 필요가 없습니다.
5.2.1 파일 관리
로컬 파일 업로드(드래그 앤 드롭 지원)를 선택하면 시스템에서 기본 전략(chunk_size=500, chunk_overlap=50, separator=['\n\n'])에 따라 파일을 분할합니다.
5.2.2 분할 관리
이 기능은 업로드된 문서의 일부를 보고 수동으로 조정할 수 있도록 지원합니다.
5.3 QA 지식 기반 관리
5.3.1 질문-답변 쌍 관리
빈번하고 정확한 응답이 필요한 시나리오에 적합한 표준 질문-답변 쌍을 수동으로 관리합니다.
5.3.2 정확한 질의응답 답변
이 기능은 특정 질문에 대해 미리 설정된 표준 답변이 반환되도록 정확한 일치 규칙을 구성하는 것을 지원합니다.
5.4 대형 모델 관련
5.4.1 모델 선택
이 시스템은 공용 네트워크 대규모 모델과 로컬 배포 모델 간의 유연한 전환을 지원합니다.
5.4.2 모델 훈련
이 플랫폼은 기업 전용 데이터를 기반으로 모델을 미세 조정하고 학습시키는 기능을 지원합니다.
5.5 디지털 휴먼 워크플로우
5.5.1 워크플로우 관리
드래그 앤 드롭 방식으로 노드를 구성하여 디지털 휴먼의 질문 및 답변 프로세스를 시각적으로 구성합니다.
| 노드 이름 | 기능 설명 |
|---|---|
| 5.5.2 시작 노드 | 워크플로 시작 노드(자동 생성되며 복사 또는 삭제할 수 없음). 설정: 시작 메시지는 비어 있습니다. 현재 시간(yyyy-mm-dd hh:mm)을 자동으로 가져옵니다. 최근 n개의 채팅 기록을 저장하며, 저장할 기록 개수는 사용자 지정 가능합니다. |
| 5.5.3 입력 노드 | 이 함수는 사용자가 대화 상자에 입력한 내용을 받아 user_input 변수에 저장하며, 별도의 설정이 필요하지 않습니다. |
| 5.5.4 출력 노드 | 사용자에게 반환될 최종 응답 내용을 정의하십시오. |
| 5.5.5 대형 모델 노드 | LLM을 호출하여 추론을 수행하고 응답을 생성합니다. |
| 5.5.6 어시스턴트 노드 | 시스템 수준의 프롬프트 명령 및 어시스턴트 동작을 구성합니다. |
| 5.5.7 QA 지식 기반 검색 노드 | QA 지식 기반에서 일치하는 질문-답변 쌍을 검색합니다. |
| 5.5.8 문서 지식 기반 질문 및 답변 노드 | 문서 지식 기반에서 관련 콘텐츠를 검색하여 질문에 대한 답변을 찾으세요. |
| 5.5.9 조건 분기 노드 | 복잡한 대화 논리를 구현하기 위한 조건에 따라 프로세스 흐름을 결정합니다. |
5.6 시스템 도구
시스템 운영 및 유지 관리에 관련된 보조 도구와 기능을 제공합니다.











VI. SaaS 측면: 새로운 디지털 휴먼 창조
| 단계 | 작동하다 | 설명하다 |
|---|---|---|
| 첫 번째 단계 | 6.1 등록 사용자 | SaaS 플랫폼에 계정을 등록하세요. |
| 2단계 | 6.2.1 새 워크플로 생성 | 디지털 인간을 위한 대화 흐름을 만드세요. |
| 6.2.2 새로운 지식 기반 구축 | 문서를 업로드하거나 QA 질문-답변 쌍을 구성하세요. | |
| 3단계 | 6.3.1 새 캐릭터 이미지 생성 | 디지털 휴먼의 외형을 선택하거나 맞춤 설정하세요. |
| 6.3.2 연관 구성 | 이 담당자의 업무 흐름과 지식 기반이 제대로 연결되어 있는지 확인하십시오. | |
| 4단계 | 6.4.1 시리얼 번호 획득 | 기기 왼쪽 상단에 있는 작은 원을 클릭하여 기기 일련 번호를 확인하세요. |
| 6.4.2 장치 바인딩 | 관리 시스템의 "기기 연결" 섹션에 일련 번호를 입력하십시오. 앱을 다시 시작하면 기기에 새롭게 생성된 디지털 휴먼이 표시되며, 해당 휴먼의 답변은 전용 지식 기반을 바탕으로 합니다. |








VII. 민영화 배포
7.1 시스템 서버 구성
| 문제 | 설명하다 |
|---|---|
| 7.1.1 디지털 휴먼 올인원 머신 | 터치스크린, 카메라, 마이크가 통합되어 있어 별도의 설정 없이 바로 사용할 수 있는 하드웨어 장치. |
| 7.1.2 대형 모델 컴퓨팅 서버 (선택 사항) | 대규모 모델을 로컬에서 실행하려면 동시 접속자 수와 모델 크기에 따라 16GB 이상의 RAM과 50GB 이상의 하드 디스크 여유 공간을 갖춘 GPU 서버(NVIDIA RTX 3060 이상)를 권장합니다. |
7.2 프로젝트 데이터 수집
| 데이터 유형 | 설명하다 |
|---|---|
| 7.2.1 캐릭터 외형 및 목소리 | 대상 인물의 그린 스크린 영상 또는 고화질 사진과 3~10초 분량의 음성 샘플을 제공해 주세요. |
| 7.2.2 QA 질문 및 답변 모음 | 일반적인 기업 질문과 표준 답변을 수집하여 QA 지식 기반으로 가져옵니다. |
| 7.2.3 데이터 처리(RAG) | PDF, Word, TXT, Markdown 등 다양한 형식의 기업 문서를 정리하면 시스템이 자동으로 구문 분석하여 향상된 RAG 검색 결과를 생성합니다. |
7.3 데이터 통합
- 7.3.1 QA 지식 기반과의 통합: 컴파일된 QA 질문 및 답변 쌍을 시스템으로 가져옵니다.
- 7.3.2 문서 지식 기반과의 통합: 기업 문서를 업로드하면 시스템이 자동으로 문서를 분류하고 색인을 생성합니다.
- 7.3.3 데이터베이스 쿼리 통합: 디지털 휴먼은 기업의 내부 데이터베이스와 통합하여 보고서, 작업 지시서 등과 같은 비즈니스 데이터를 실시간으로 조회할 수 있습니다.

VIII. 주의사항
8.1 타이머를 이용한 전원 켜짐/꺼짐
태블릿 기기를 통해 전원 켜짐/꺼짐 타이머를 설정하세요. 예를 들어 오후 10시에 끄고 오전 8시에 켜도록 설정하면 안정적인 작동을 보장하고 에너지를 절약할 수 있습니다.

WeChat
WhatAPP