1. 기술로드맵
[ AI 기반 시각 인식 및 생성 솔루션 기술개발 로드맵 ]
|
핵심기술
| 이미지 자동 생성에 필요한 다양한 AI 시각 인식 솔루션 기술의 고도화
|
`23년
| `24년
| `25년
| 최종 목표
|
AI 기반 실시간 영상 인식 및 추출 기술
|
 | 해외 인식 엔진 대비 성능 우위
|
AI 기반 이미지 자동 생성 기술
|
 | 해외 인식 엔진 대비 성능 우위
|
MR환경 제어 및 실시간 공간 영상 가시화 기술
|
 | 해외 인식 엔진 대비 성능 우위
|
플렌옵틱 영상처리 및 가시화 기술
|
 | 해외 인식 엔진 대비 성능 우위
|
엣지 AI 기반 영상처리 시각화 기술
|
 | 해외 인식 엔진 대비 성능 우위
|
* 출처: 자체작성
|
2. 개요
가. 정의 및 필요성
□ AI 기반 시각 인식 및 생성 솔루션은 디지털콘텐츠 저작활동을 수행과 관련하여 AI 기반 이미지 및 영상 등을 인식 및 자동 생성하는 기술로, 생성모델과 판별모델이 경쟁하면서 실제와 가까운 이미지, 동영상, 음성 등을 자동으로 만들어 내는 기계학습의 하나인 인공지능 알고리즘인 GAN(Genarative Adversarial Network)등을 활용함
□ 대표적인 AI 기반 시각 인식 및 생성 솔루션 기술로는 AI 기반 실시간 영상 인식 및 추출 기술, AI 기반 이미지 자동 생성 기술, MR환경 제어 및 실시간 공간 영상 가시화 기술, 플렌옵틱 영상처리 및 가시화 기술, 엣지 AI 기반 영상처리 시각화 기술 등이 있음
▪ AI 기반 실시간 영상 인식 및 추출 기술: 머신러닝에 필요한 대규모의 데이터 처리를 위해 CILP (Connecting Text and Images)와 같은 초거대 모델을 이용해 객체, 얼굴을 인식하고, 이미지, 영상 제작에 필요한 데이터를 인공지능(AI)이 추출해서 분류(Classfication)하고 감지(Detection)하는 기술
▪ AI 기반 이미지 자동 생성 기술: text-to-image 생성을 위한 인공지능 모델(Stable Diffusion 등)로 Fine-tuning을 통해 기존에 학습된 모델 기반 새로운 아키텍처를 이용해 이미지를 자동으로 생성하는 기술
□ AI 기반 시각 인식 및 생성 솔루션은 디지털콘텐츠 분야 내 디지털콘텐츠 저작을 위한 전략품목으로, 초거대 인공지능 모델, 엣지 인공지능 기술로 데이터 용량을 경량화하고 이미지, 영상 생성 및 플렌옵틱 영상처리, 3D 모델링 View 가시화 기술 개발을 통해 품질을 향상시키고 AI 기반 이미지/영상 자동 생성 및 가시화 부문에서 경쟁력을 갖도록 전략적인 스텝을 가지는 것이 중요함
[ 디지털콘텐츠 품목로드맵 내 AI 기반 시각 인식 및 생성 솔루션 ]
|
 |
* 출처: 자체작성
|
□ 4차 산업분야에서 활용되던 AI 기술의 급격한 성장으로 텍스트, 영상, 이미지, 미술, 음악, 방송 등의 분야에서 기존의 콘텐츠를 소비자의 수요가 높은 부문에서 응용하고, 재생산할 수 있도록 기술 개발이 지속되고 있음
▪ OpenAI(미)의 DALL-E2, 카카오브레인(한)의 RQ-Transformer 및 구글(미) 인공지능 딥드림은 사용자가 희망하는 이미지에 대해 텍스트 등 저작을 수행하면 AI가 입력을 해석하고 자동으로 이미지를 제공하는 그림 인공지능 소프트웨어 서비스를 제공하고 있음
□ 인공지능(AI)을 활용해 이미지, 영상, 3D 모델링 View 자동 생성이 미디어, 엔터테인먼트, 게임, 애니메이션, 교육, 관광 산업 등에서 활용할 수 있도록 초거대 인공지능 모델에 대한 핵심 기술 개발을 통해 기업 경쟁력을 강화해야함
▪ Stable Diffusion은 독일 뮌휀대학교 Machine Vision & Learning Group (CompVis) 연구실에서 개발한 text-to-image 인공지능 모델로 잠재 확산 모델을 이용한 고해상도 이미지 합성 연구를 기반으로 컴퓨터 사용 리소스를 대폭 줄인 그림 인공지능으로 오픈소스로 서비스를 제공하고 있으며, 한국형 CNN/ Transformer 기반 분류, 감지 기술 및 객체 인식 기술 개발을 통해 경쟁력을 확보해야함
나. 범위 및 분류
□ AI 기반 시각 인식 및 생성 솔루션의 전방산업은 미디어&광고, 애니메이션, 게임, 엔터테인먼트, 교육, 의료. IT& 통신, 우주항공& 방위산업 등을 들 수 있음
□ AI 기반 시각 인식 및 생성 솔루션의 후방산업은 대규모 데이터 저장, 영상처리/분석 프로그램, 카메라 제어, 병렬 분산 컴퓨팅, 인공지능, 빅데이터, IoT, 통신기술/인프라, MR 소프트웨어 프로그램, 플렌옵틱 카메라 산업 등을 들 수 있음
[ AI 기반 시각 인식 및 생성 솔루션 품목 산업구조 ]
|
후방산업
| AI 기반 시각 인식 및 생성 솔루션
| 전방산업
|
대규모 데이터 저장, 영상처리/ 분석 프로그램, 카메라 제어, 병렬 분산 컴퓨팅, 인공지능, 빅데이터, IoT, 통신기술/ 인프라, MR 소프트웨어 프로그램, 플렌옵틱 카메라
| AI 기반 실시간 영상 인식 및 추출 기술, AI 기반 이미지 자동 생성 기술, MR환경 제어 및 실시간 공간 영상 가시화 기술, 플렌옵틱 영상처리 및 가시화 기술, 엣지 AI 기반 영상처리 시각화 기술
| 미디어& 광고, 애니메이션, 게임, 엔터테인먼트, 교육, 의료.
IT& 통신, 우주항공& 방위
|
* 출처: 자체작성
|
□ AI 기반 시각 인식 및 생성 솔루션은 텍스트 등 사용자 입력에 기반해 인식 AI, 생성 AI가 영상을 추출하는 기술과, 이미지를 자동으로 생성하는 기술, Realistic Rendering 등 MR 환경을 제어를 위한 환경 인식 기술, 플렌옵틱 영상처리 및 가시화 기술, AI가 IoT 기기의 정보를 해석하고 영상처리를 간소화할 수 있는 기술로, 전체적으로는 다음과 같이 분류할 수 있음
▪ AI 기반 실시간 영상 인식 및 추출 기술
▪ AI 기반 이미지 자동 생성 기술
▪ MR환경 제어 및 실시간 공간 영상 가시화 기술
▪ 플렌옵틱 영상처리 및 가시화 기술
▪ 엣지 AI 기반 영상처리 시각화 기술
3. 산업 및 시장분석
가. 산업분석
◎ 컴퓨터 비전 3D 가상화 콘텐츠
□ 컴퓨터 비전은 사람의 시각과 관련된 시스템 구조를 모방해 컴퓨터가 물체나 상황을 식별하고 해석할 수 있는 연구 분야로 이미지와 이미지 속 텍스트를 인지하는 영역, 비디오와 3D 영역에 대한 데이터를 다루고 있으며 관련 분야에서 사용자의 수요가 상승하고 있음
▪ 스마트폰 시대가 도래하면서 이미지뿐만 아니라 영상 콘텐츠 수요가 증가하고 있으며, 이에 따라 컴퓨터 비전의 필요성이 강조됨
[ AI 기반 시각 인식 및 생성 솔루션 관련 컴퓨터 비전 기술 ]
|
객체분류(Object Classification)
| ▶ 이미지 속 객체를 인지하고 클래스를 분류하는 기술
|
객체 탐지 및 위치 식별(Object Detection & Localization)
| ▶ 이미지, 비디오 영상에서 객체를 식별해내는 기술
|
객체 분할(Object Segmentation)
| ▶ 이미지 및 비디오 영상 프레임 내에서 객체를 따로 분할하여 지정 범위 부분만 분석하는 기술
|
이미지 캡셔닝(Image captioning)
| ▶ 이미지의 상황을 텍스트로 설명하는 기술
|
객체 추적(Object Tracking)
| ▶ 비디오 영상 내의 객체의 위치를 추적하는 기술
|
행동 분류(Action Classification)
| ▶ 비디오 영상 내의 객체의 행동(action)을 인식하여 분류하는 기술
|
□ 3차원 공간에서 이동이 자유롭고, 제작된 3D 모델을 대상으로 확대, 축소, 그리고 회전 변환이 가능한 디지털 콘텐츠에 대한 사용자의 수요가 상승하고 있음
▪ 영화, 애니메이션 산업에서 단편적인 측면으로 3D 콘텐츠를 사용했으나, AR/VR/XR/MR 플랫폼 상에서 360도 멀티뷰가 가능하며 가상 환경 구성도 확대/축소가 용이하기 때문에 기업, 제작자 또한 3D 가상화 콘텐츠에 관심을 보이고 있음
◎ GAN 계열 알고리즘을 활용한 생성모델의 등장으로 이미지 자동 생성 시장의 활성화
□ 4차 산업분야가 활발해지면서 AI 기술을 활용한 문화, 예술, 방송, 엔터테인먼트 분야에서 기존의 콘텐츠, 사용자의 텍스트, 이미지 등 새로운 이미지, 영상 생성에 대한 수요가 증가하고 있음
▪ DALL-E 공급을 기점으로 본격적으로 대중화가 시작되어 2022년 DALL-E2을 선보였으며, 홈페이지에서 키워드를 입력해 그림을 제작하는 방식, 그림을 입력해 또 다른 그림을 만드는 서비스를 사용자에게 제공하고 있음
▪ Stable Diffusion은 디퓨전 모델을 통해 텍스트, 이미지 특징을 매핑, 학습하고 이미지 특징을 디코딩해 최종 이미지를 생성하는 소프트웨어로 해당 분야의 Fine-tuning을 고도화하면서 사용자에게 영상 생성 서비스를 위한 연구개발을 지속하고 있음
나. 시장분석
◎ 세계시장
□ 전 세계 AI 기반 시각 인식 및 생성 솔루션 시장은 연평균 22.40%의 성장률로 2021년에 약 20억 달러에서 2026년에는 약 56억 달러 규모까지 성장할 것으로 전망
[ AI 기반 시각 인식 및 생성 솔루션 세계 시장규모 및 전망 ]
|
(단위: 십억 달러, %)
|
구분
| `20
| `21
| `22
| `23
| `24
| `25
| `26
| CAGR
(`20~`26)
|
세계시장
| 1.67
| 2.05
| 2.48
| 3.02
| 3.7
| 4.54
| 5.61
| 22.40
|
*출처: AI Image Recognition Market Forecast and Analysis 2022-2026, Technavio, (윕스재가공)
|
◎ 국내시장
□ 국내 AI 기반 시각 인식 및 생성 솔루션 시장은 연평균 22.40%의 성장률로 2021년에 약 798억 원에서 2026년에는 약 2,189억 원 규모까지 성장할 것으로 전망
[ AI 기반 시각 인식 및 생성 솔루션 국내 시장규모 및 전망 ]
|
(단위 : 억 원, %)
|
구분
| `20
| `21
| `22
| `23
| `24
| `25
| `26
| CAGR
(`20~`26)
|
국내시장
| 651.95
| 797.99
| 967.72
| 1,179.56
| 1,443.31
| 1,771.81
| 2,189.25
| 22.40
|
*출처: AI Image Recognition Market Forecast and Analysis 2022-2026, Technavio, (윕스재가공)
*세계 시장규모 기준 국내 3% 점유율 적용 (1달러=1,306원, 2022.12.13.기준)
|
4. 기술개발 동향
가. 기술개발 이슈
□ 기술경쟁력
▪ AI 기반 시각 인식 및 생성 솔루션은 미국이 최고기술국으로 평가되었으며, 우리나라는 최고기술국 대비 73.2%의 기술 수준을 보유하고 있으며, 최고기술국과의 기술격차는 2.1년으로 분석
▪ 중소기업의 기술경쟁력은 최고기술국 대비 62.4%, 기술격차는 2.8년으로 평가
▪ 미국>한국>EU(72.3%)>중국(68.9%)>일본(66.2%) 순으로 평가
□ 기술수명주기(TCT)
▪ AI 기반 시각 인식 생성 및 솔루션은 4.91의 기술수명주기를 가진 것으로 파악
나. 생태계 기술동향
□ (기술동향) 이미지, 영상 생성을 위해서는 컴퓨터 비전, 인공지능, 영상 가시화, 플렌옵틱 영상처리 등의 소프트웨어 기술이 필수적이며, 인공지능 Fine-tuning, 인공지능 기반 이미지, 영상 추출, 이미지, 영상 인식 등의 소프트웨어 기술개발이 지속적으로 수행 중
□ (플레이어) Google(미), IBM(미), Microsoft(미), ADOBE(미), RICOH(일), Oracle(미), Amazon(미), Qualcomm(미), Micron(미), 삼성전자(한), SK Telecom(한), LG전자(한), KT(한)
□ (중소기업) KEC, RFHIC, 에이프로, 아이에이, 에스티아이
다. 국내 연구개발 기관 및 동향
[ AI 기반 시각 인식 및 생성 솔루션 주요 연구조직 현황 ]
|
기관
| 연구분야
|
한국전자통신연구원
| ▶ 인공지능, 시각지능 기술 분야 연구
▶ 대규모 인공 지능 학습과 실시간 추론에 필요한 초성능 컴퓨팅 기술 분야 연구
▶ 인공지능 프로세서 기술 분야 연구
|
한국전자기술연구원
| ▶ 영상 기반 인식 기술 분야 연구 (객체, 표정, 제스처, 감정, 보행자, 장면 등)
▶ 다중 객체 추적 기술 연구
▶ 깊이정보추정 및 영상 세그먼테이션 기술 연구
|
5. 전략품목 기술로드맵
가. 핵심기술 리스트
[ AI 기반 시각 인식 및 생성 솔루션 핵심기술 ]
|
핵심기술
| 개요
|
AI 기반 실시간 영상 인식 및 추출 기술
| ▶ 머신러닝에 필요한 대규모의 데이터 처리를 위해 CILP(Connecting Text and Images)와 같은 초거대 모델을 이용해 객체, 얼굴을 인식하고, 이미지, 영상 제작에 필요한 데이터를 인공지능(AI)이 추출해서 분류(Classfication)하고 감지(Detection)하는 기술
|
AI 기반 이미지 자동 생성 기술
| ▶ text-to-image 생성을 위한 인공지능 모델(Stable Diffusion 등)로 Fine-tuning을 통해 기존에 학습된 모델 기반 새로운 아키텍처를 이용해 이미지를 자동으로 생성하는 기술
|
MR환경 제어 및 실시간 공간 영상 가시화 기술
| ▶ 객체 인식 기술 기반 3D 모델링을 가시화하는 기술로 혼합 현실(Mixed Reality) 서비스를 제공하기 위한 환경 인식 기술
|
플렌옵틱 영상처리 및 가시화 기술
| ▶ 모든 점에서 반사되는 빛의 모든 방향과 세기를 인식해 카메라에서 평면 정보가 아닌 공간 정보를 획득하는 기술로 여러 대의 플렌옵틱 카메라에서 영상 정보를 획득하고 3차원 공간 이미지로 변형 및 가시화하는 기술
|
엣지 AI 기반 영상처리 시각화 기술
| ▶ 인공지능(AI)이 IoT 네트워크와 실시간으로 네트워킹을 실행하면서 영상을 제작하는 기술로, TensorFlow(keras)와 같은 모델 최적화 라이브러리, 영상 데이터 양자화, Model Distillation으로 경량화 엔진을 확보한 영상처리 소프트웨어키트(SDK)를 사용자에게 제공하는 기술
|
나. 중소기업 기술개발 전략
□ AI 영상 인식, 추출 시 적은 수량의 GPU와 적은 수량의 DB를 기반으로 이미지, 영상을 인식하고 추출하는 기술력 확보에 집중 필요
□ 자동영상 생성을 위해 대규모의 데이터 처리 및 인공지능 기술 개발 집중 필요. 특히 Stable Diffusion 기술인 text-to-image 모델화 기술 집중 필요
□ 플렌옵틱 영상 처리 기술 개발로 자연스러운 이미지, 영상 가시화 구현 기술을 바탕으로 멀티뷰 이미지를 기반으로 3D 렌더링 성능 향상 기술에 대한 지원이 필요함
□ 가상현실, 증강현실, 홀로그램 등의 입체영상의 촬영 및 제작을 위해 카메라의 위치와 형태를 자유롭게 조절할 수 있는 비정형 플렌옵틱 기술의 응용 집중
□ CILP (Connecting Text and Images)과 같은 한국형 초거대 모델 개발, 얼굴 인식 개발을 바탕으로 Multimodal Recognition 기술을 구현하기 위한 기술 개발 지원
□ 인공지능 Fine-tuning으로 이미지, 영상을 분류, 감지 기술을 고도화하고 AI를 기반으로 실시간으로 영상을 인식하고 추출할 수 있도록 연구 인력 지원이 필요함
□ 엣지 AI를 기반으로 경량화 엔진 확보하고 양자화(Quantization), 모델 증류(Model Distillation) 기술을 접목해 복잡한 머신러닝 모델이 학습한 내용을 단순한 머신러닝 모델로 전달해서 구현 과정을 간소화할 수 있도록 기술 개발 지원
다. 기술개발 로드맵
[ AI 기반 시각 인식 및 생성 솔루션 핵심기술 연구목표 ]
|
핵심기술
| 기술
요구사항
| 연차별 개발목표
| 최종목표
| 연계
R&D
유형
|
1년차
| 2년차
| 3년차
|
AI 기반 실시간 영상 인식 및 추출 기술
| 인식 성능 고도화
| ▶ Transformer 기반 Classification/Detection 상용수준 확보
▶ 초거대모델의 Fine-tuning 등 상용수준 확보
| ▶ Transformer기반 Classification/Detection 상용수준 및 한국형 DB기반 모델확보, 성능 개선
▶ 초거대모델의 한국형 DB기반 Fine-tuning 및 성능 개선
| ▶ Transformer기반 Classification/Detection 상용수준 및 한국형 DB기반 모델확보, 성능 우위
▶ 초거대모델의 한국형 DB기반 Fine-tuning 및 성능 우위
| 해외 인식 엔진 대비 성능 우위
| 기술혁신
및
상용화
|
AI 기반 이미지 자동 생성 기술
| 자동 생성된 이미지의 소비자 만족도
| 초거대모델
초거대모델(Stable Diffusion 등)의 Fine-tuning등 상용수준 확보
| 초거대모델
초거대모델(Stable Diffusion 등)의 Fine-tuning등 성능 개선
| 초거대모델
초거대모델(Stable Diffusion 등)의 Fine-tuning등 성능 우위
| 해외 인식 엔진 대비 성능 우위
| 기술혁신
및
상용화
|
MR환경 제어 및 실시간 공간 영상 가시화 기술
| 환경 인식 정확도 및 자연스러운 가시화
| 환경인식
기반 기술 확보
및 Prototype 확보
| 인식 결과 기반
Rendering 기술확보
| 상용화 및 상용제품으로부터 지속적인 데이터 확보로 성능 개선
| 해외 인식 엔진 대비 성능 우위
| 기술혁신
및
상용화
|
플렌옵틱 영상처리 및 가시화 기술
| 자연스러운 가시화 기술
| Plenoptic Camera 설계 및 Multiview 이미지 확보
&
Multi-focus 결과 확보
| Multi-focus 결과 개선 및 해상력 개선
&
3D Rendering Prototype 확보
| Multiview 이미지기반 3D Rendering 성능 개선
| 해외 기술 대비 성능 우위
| 기술혁신
및
상용화
|
엣지 AI 기반 영상처리 시각화 기술
| 엣지 향상
AI 인식 성능 확보
| 경량화 엔진 확보 기술
(Tensorflow Lite 활용)
Quantization 기술
Model Distillation 기술 기반 경량화
| 경량화 엔진 고도화 및
SDK 확보
| 지속적인 DB 확보로 인식 성능 고도화
| 해외 기술 대비 성능 우위
| 기술혁신
및
상용화
|