반복영역 바로가기
주메뉴로 바로가기
본문으로 바로가기

디지털콘텐츠

AI 기반 시각 인식 및 생성 솔루션

의견등록

의견등록하기 X

통합보고서다운로드 PDF파일 다운로드

품목보고서다운로드 HWP파일 다운로드 PDF파일 다운로드

1. 기술로드맵


[ AI 기반 시각 인식 및 생성 솔루션 기술개발 로드맵 ]


핵심기술

이미지 자동 생성에 필요한 다양한 AI 시각 인식 솔루션 기술의 고도화

`23년

`24년

`25년

최종 목표

AI 기반 실시간 영상 인식 및 추출 기술


해외 인식 엔진 대비 성능 우위

AI 기반 이미지 자동 생성 기술


해외 인식 엔진 대비 성능 우위

MR환경 제어 및 실시간 공간 영상 가시화 기술


해외 인식 엔진 대비 성능 우위

플렌옵틱 영상처리 및 가시화 기술


해외 인식 엔진 대비 성능 우위

엣지 AI 기반 영상처리 시각화 기술


해외 인식 엔진 대비 성능 우위

* 출처: 자체작성



2. 개요


가. 정의 및 필요성

□ AI 기반 시각 인식 및 생성 솔루션은 디지털콘텐츠 저작활동을 수행과 관련하여 AI 기반 이미지 및 영상 등을 인식 및 자동 생성하는 기술로, 생성모델과 판별모델이 경쟁하면서 실제와 가까운 이미지, 동영상, 음성 등을 자동으로 만들어 내는 기계학습의 하나인 인공지능 알고리즘인 GAN(Genarative Adversarial Network)등을 활용함

□ 대표적인 AI 기반 시각 인식 및 생성 솔루션 기술로는 AI 기반 실시간 영상 인식 및 추출 기술, AI 기반 이미지 자동 생성 기술, MR환경 제어 및 실시간 공간 영상 가시화 기술, 플렌옵틱 영상처리 및 가시화 기술, 엣지 AI 기반 영상처리 시각화 기술 등이 있음

▪ AI 기반 실시간 영상 인식 및 추출 기술: 머신러닝에 필요한 대규모의 데이터 처리를 위해 CILP (Connecting Text and Images)와 같은 초거대 모델을 이용해 객체, 얼굴을 인식하고, 이미지, 영상 제작에 필요한 데이터를 인공지능(AI)이 추출해서 분류(Classfication)하고 감지(Detection)하는 기술

▪ AI 기반 이미지 자동 생성 기술: text-to-image 생성을 위한 인공지능 모델(Stable Diffusion 등)로 Fine-tuning을 통해 기존에 학습된 모델 기반 새로운 아키텍처를 이용해 이미지를 자동으로 생성하는 기술

□ AI 기반 시각 인식 및 생성 솔루션은 디지털콘텐츠 분야 내 디지털콘텐츠 저작을 위한 전략품목으로, 초거대 인공지능 모델, 엣지 인공지능 기술로 데이터 용량을 경량화하고 이미지, 영상 생성 및 플렌옵틱 영상처리, 3D 모델링 View 가시화 기술 개발을 통해 품질을 향상시키고 AI 기반 이미지/영상 자동 생성 및 가시화 부문에서 경쟁력을 갖도록 전략적인 스텝을 가지는 것이 중요함


[ 디지털콘텐츠 품목로드맵 내 AI 기반 시각 인식 및 생성 솔루션 ]


* 출처: 자체작성


□ 4차 산업분야에서 활용되던 AI 기술의 급격한 성장으로 텍스트, 영상, 이미지, 미술, 음악, 방송 등의 분야에서 기존의 콘텐츠를 소비자의 수요가 높은 부문에서 응용하고, 재생산할 수 있도록 기술 개발이 지속되고 있음

▪ OpenAI(미)의 DALL-E2, 카카오브레인(한)의 RQ-Transformer 및 구글(미) 인공지능 딥드림은 사용자가 희망하는 이미지에 대해 텍스트 등 저작을 수행하면 AI가 입력을 해석하고 자동으로 이미지를 제공하는 그림 인공지능 소프트웨어 서비스를 제공하고 있음

□ 인공지능(AI)을 활용해 이미지, 영상, 3D 모델링 View 자동 생성이 미디어, 엔터테인먼트, 게임, 애니메이션, 교육, 관광 산업 등에서 활용할 수 있도록 초거대 인공지능 모델에 대한 핵심 기술 개발을 통해 기업 경쟁력을 강화해야함

▪ Stable Diffusion은 독일 뮌휀대학교 Machine Vision & Learning Group (CompVis) 연구실에서 개발한 text-to-image 인공지능 모델로 잠재 확산 모델을 이용한 고해상도 이미지 합성 연구를 기반으로 컴퓨터 사용 리소스를 대폭 줄인 그림 인공지능으로 오픈소스로 서비스를 제공하고 있으며, 한국형 CNN/ Transformer 기반 분류, 감지 기술 및 객체 인식 기술 개발을 통해 경쟁력을 확보해야함


나. 범위 및 분류

□ AI 기반 시각 인식 및 생성 솔루션의 전방산업은 미디어&광고, 애니메이션, 게임, 엔터테인먼트, 교육, 의료. IT& 통신, 우주항공& 방위산업 등을 들 수 있음

□ AI 기반 시각 인식 및 생성 솔루션의 후방산업은 대규모 데이터 저장, 영상처리/분석 프로그램, 카메라 제어, 병렬 분산 컴퓨팅, 인공지능, 빅데이터, IoT, 통신기술/인프라, MR 소프트웨어 프로그램, 플렌옵틱 카메라 산업 등을 들 수 있음


[ AI 기반 시각 인식 및 생성 솔루션 품목 산업구조 ]


후방산업

AI 기반 시각 인식 및 생성 솔루션

전방산업

대규모 데이터 저장, 영상처리/ 분석 프로그램, 카메라 제어, 병렬 분산 컴퓨팅, 인공지능, 빅데이터, IoT, 통신기술/ 인프라, MR 소프트웨어 프로그램, 플렌옵틱 카메라

AI 기반 실시간 영상 인식 및 추출 기술, AI 기반 이미지 자동 생성 기술, MR환경 제어 및 실시간 공간 영상 가시화 기술, 플렌옵틱 영상처리 및 가시화 기술, 엣지 AI 기반 영상처리 시각화 기술

미디어& 광고, 애니메이션, 게임, 엔터테인먼트, 교육, 의료.

IT& 통신, 우주항공& 방위

* 출처: 자체작성

□ AI 기반 시각 인식 및 생성 솔루션은 텍스트 등 사용자 입력에 기반해 인식 AI, 생성 AI가 영상을 추출하는 기술과, 이미지를 자동으로 생성하는 기술, Realistic Rendering 등 MR 환경을 제어를 위한 환경 인식 기술, 플렌옵틱 영상처리 및 가시화 기술, AI가 IoT 기기의 정보를 해석하고 영상처리를 간소화할 수 있는 기술로, 전체적으로는 다음과 같이 분류할 수 있음

▪ AI 기반 실시간 영상 인식 및 추출 기술

▪ AI 기반 이미지 자동 생성 기술

▪ MR환경 제어 및 실시간 공간 영상 가시화 기술

▪ 플렌옵틱 영상처리 및 가시화 기술

▪ 엣지 AI 기반 영상처리 시각화 기술




3. 산업 및 시장분석


가. 산업분석

◎ 컴퓨터 비전 3D 가상화 콘텐츠

□ 컴퓨터 비전은 사람의 시각과 관련된 시스템 구조를 모방해 컴퓨터가 물체나 상황을 식별하고 해석할 수 있는 연구 분야로 이미지와 이미지 속 텍스트를 인지하는 영역, 비디오와 3D 영역에 대한 데이터를 다루고 있으며 관련 분야에서 사용자의 수요가 상승하고 있음

▪ 스마트폰 시대가 도래하면서 이미지뿐만 아니라 영상 콘텐츠 수요가 증가하고 있으며, 이에 따라 컴퓨터 비전의 필요성이 강조됨


[ AI 기반 시각 인식 및 생성 솔루션 관련 컴퓨터 비전 기술 ]


객체분류(Object Classification)

이미지 속 객체를 인지하고 클래스를 분류하는 기술

객체 탐지 및 위치 식별(Object Detection & Localization)

이미지, 비디오 영상에서 객체를 식별해내는 기술

객체 분할(Object Segmentation)

이미지 및 비디오 영상 프레임 내에서 객체를 따로 분할하여 지정 범위 부분만 분석하는 기술

이미지 캡셔닝(Image captioning)

이미지의 상황을 텍스트로 설명하는 기술

객체 추적(Object Tracking)

비디오 영상 내의 객체의 위치를 추적하는 기술

행동 분류(Action Classification)

비디오 영상 내의 객체의 행동(action)을 인식하여 분류하는 기술

□ 3차원 공간에서 이동이 자유롭고, 제작된 3D 모델을 대상으로 확대, 축소, 그리고 회전 변환이 가능한 디지털 콘텐츠에 대한 사용자의 수요가 상승하고 있음

▪ 영화, 애니메이션 산업에서 단편적인 측면으로 3D 콘텐츠를 사용했으나, AR/VR/XR/MR 플랫폼 상에서 360도 멀티뷰가 가능하며 가상 환경 구성도 확대/축소가 용이하기 때문에 기업, 제작자 또한 3D 가상화 콘텐츠에 관심을 보이고 있음

◎ GAN 계열 알고리즘을 활용한 생성모델의 등장으로 이미지 자동 생성 시장의 활성화

□ 4차 산업분야가 활발해지면서 AI 기술을 활용한 문화, 예술, 방송, 엔터테인먼트 분야에서 기존의 콘텐츠, 사용자의 텍스트, 이미지 등 새로운 이미지, 영상 생성에 대한 수요가 증가하고 있음

▪ DALL-E 공급을 기점으로 본격적으로 대중화가 시작되어 2022년 DALL-E2을 선보였으며, 홈페이지에서 키워드를 입력해 그림을 제작하는 방식, 그림을 입력해 또 다른 그림을 만드는 서비스를 사용자에게 제공하고 있음

▪ Stable Diffusion은 디퓨전 모델을 통해 텍스트, 이미지 특징을 매핑, 학습하고 이미지 특징을 디코딩해 최종 이미지를 생성하는 소프트웨어로 해당 분야의 Fine-tuning을 고도화하면서 사용자에게 영상 생성 서비스를 위한 연구개발을 지속하고 있음

나. 시장분석

◎ 세계시장

□ 전 세계 AI 기반 시각 인식 및 생성 솔루션 시장은 연평균 22.40%의 성장률로 2021년에 약 20억 달러에서 2026년에는 약 56억 달러 규모까지 성장할 것으로 전망


[ AI 기반 시각 인식 및 생성 솔루션 세계 시장규모 및 전망 ]

(단위: 십억 달러, %)

구분

`20

`21

`22

`23

`24

`25

`26

CAGR

(`20~`26)

세계시장

1.67

2.05

2.48

3.02

3.7

4.54

5.61

22.40

*출처: AI Image Recognition Market Forecast and Analysis 2022-2026, Technavio, (윕스재가공)

◎ 국내시장

□ 국내 AI 기반 시각 인식 및 생성 솔루션 시장은 연평균 22.40%의 성장률로 2021년에 약 798억 원에서 2026년에는 약 2,189억 원 규모까지 성장할 것으로 전망


[ AI 기반 시각 인식 및 생성 솔루션 국내 시장규모 및 전망 ]

(단위 : 억 원, %)

구분

`20

`21

`22

`23

`24

`25

`26

CAGR

(`20~`26)

국내시장

651.95

797.99

967.72

1,179.56

1,443.31

1,771.81

2,189.25

22.40

*출처: AI Image Recognition Market Forecast and Analysis 2022-2026, Technavio, (윕스재가공)

*세계 시장규모 기준 국내 3% 점유율 적용 (1달러=1,306원, 2022.12.13.기준)


4. 기술개발 동향


가. 기술개발 이슈

□ 기술경쟁력

▪ AI 기반 시각 인식 및 생성 솔루션은 미국이 최고기술국으로 평가되었으며, 우리나라는 최고기술국 대비 73.2%의 기술 수준을 보유하고 있으며, 최고기술국과의 기술격차는 2.1년으로 분석

▪ 중소기업의 기술경쟁력은 최고기술국 대비 62.4%, 기술격차는 2.8년으로 평가

▪ 미국>한국>EU(72.3%)>중국(68.9%)>일본(66.2%) 순으로 평가


□ 기술수명주기(TCT)

▪ AI 기반 시각 인식 생성 및 솔루션은 4.91의 기술수명주기를 가진 것으로 파악


나. 생태계 기술동향

□ (기술동향) 이미지, 영상 생성을 위해서는 컴퓨터 비전, 인공지능, 영상 가시화, 플렌옵틱 영상처리 등의 소프트웨어 기술이 필수적이며, 인공지능 Fine-tuning, 인공지능 기반 이미지, 영상 추출, 이미지, 영상 인식 등의 소프트웨어 기술개발이 지속적으로 수행 중

□ (플레이어) Google(미), IBM(미), Microsoft(미), ADOBE(미), RICOH(일), Oracle(미), Amazon(미), Qualcomm(미), Micron(미), 삼성전자(한), SK Telecom(한), LG전자(한), KT(한)

□ (중소기업) KEC, RFHIC, 에이프로, 아이에이, 에스티아이


다. 국내 연구개발 기관 및 동향


[ AI 기반 시각 인식 및 생성 솔루션 주요 연구조직 현황 ]


기관

연구분야

한국전자통신연구원

인공지능, 시각지능 기술 분야 연구

대규모 인공 지능 학습과 실시간 추론에 필요한 초성능 컴퓨팅 기술 분야 연구

인공지능 프로세서 기술 분야 연구

한국전자기술연구원

영상 기반 인식 기술 분야 연구 (객체, 표정, 제스처, 감정, 보행자, 장면 등)

다중 객체 추적 기술 연구

깊이정보추정 및 영상 세그먼테이션 기술 연구


5. 전략품목 기술로드맵


가. 핵심기술 리스트


[ AI 기반 시각 인식 및 생성 솔루션 핵심기술 ]


핵심기술

개요

AI 기반 실시간 영상 인식 및 추출 기술

머신러닝에 필요한 대규모의 데이터 처리를 위해 CILP(Connecting Text and Images)와 같은 초거대 모델을 이용해 객체, 얼굴을 인식하고, 이미지, 영상 제작에 필요한 데이터를 인공지능(AI)이 추출해서 분류(Classfication)하고 감지(Detection)하는 기술

AI 기반 이미지 자동 생성 기술

text-to-image 생성을 위한 인공지능 모델(Stable Diffusion 등)로 Fine-tuning을 통해 기존에 학습된 모델 기반 새로운 아키텍처를 이용해 이미지를 자동으로 생성하는 기술

MR환경 제어 및 실시간 공간 영상 가시화 기술

객체 인식 기술 기반 3D 모델링을 가시화하는 기술로 혼합 현실(Mixed Reality) 서비스를 제공하기 위한 환경 인식 기술

플렌옵틱 영상처리 및 가시화 기술

모든 점에서 반사되는 빛의 모든 방향과 세기를 인식해 카메라에서 평면 정보가 아닌 공간 정보를 획득하는 기술로 여러 대의 플렌옵틱 카메라에서 영상 정보를 획득하고 3차원 공간 이미지로 변형 및 가시화하는 기술

엣지 AI 기반 영상처리 시각화 기술

인공지능(AI)이 IoT 네트워크와 실시간으로 네트워킹을 실행하면서 영상을 제작하는 기술로, TensorFlow(keras)와 같은 모델 최적화 라이브러리, 영상 데이터 양자화, Model Distillation으로 경량화 엔진을 확보한 영상처리 소프트웨어키트(SDK)를 사용자에게 제공하는 기술


나. 중소기업 기술개발 전략

□ AI 영상 인식, 추출 시 적은 수량의 GPU와 적은 수량의 DB를 기반으로 이미지, 영상을 인식하고 추출하는 기술력 확보에 집중 필요

□ 자동영상 생성을 위해 대규모의 데이터 처리 및 인공지능 기술 개발 집중 필요. 특히 Stable Diffusion 기술인 text-to-image 모델화 기술 집중 필요

□ 플렌옵틱 영상 처리 기술 개발로 자연스러운 이미지, 영상 가시화 구현 기술을 바탕으로 멀티뷰 이미지를 기반으로 3D 렌더링 성능 향상 기술에 대한 지원이 필요함

□ 가상현실, 증강현실, 홀로그램 등의 입체영상의 촬영 및 제작을 위해 카메라의 위치와 형태를 자유롭게 조절할 수 있는 비정형 플렌옵틱 기술의 응용 집중

□ CILP (Connecting Text and Images)과 같은 한국형 초거대 모델 개발, 얼굴 인식 개발을 바탕으로 Multimodal Recognition 기술을 구현하기 위한 기술 개발 지원

□ 인공지능 Fine-tuning으로 이미지, 영상을 분류, 감지 기술을 고도화하고 AI를 기반으로 실시간으로 영상을 인식하고 추출할 수 있도록 연구 인력 지원이 필요함

□ 엣지 AI를 기반으로 경량화 엔진 확보하고 양자화(Quantization), 모델 증류(Model Distillation) 기술을 접목해 복잡한 머신러닝 모델이 학습한 내용을 단순한 머신러닝 모델로 전달해서 구현 과정을 간소화할 수 있도록 기술 개발 지원


다. 기술개발 로드맵


[ AI 기반 시각 인식 및 생성 솔루션 핵심기술 연구목표 ]


핵심기술

기술

요구사항

연차별 개발목표

최종목표

연계

R&D

유형

1년차

2년차

3년차

AI 기반 실시간 영상 인식 및 추출 기술

인식 성능 고도화

Transformer 기반 Classification/Detection 상용수준 확보

초거대모델의 Fine-tuning 등 상용수준 확보

Transformer기반 Classification/Detection 상용수준 및 한국형 DB기반 모델확보, 성능 개선

초거대모델의 한국형 DB기반 Fine-tuning 및 성능 개선

Transformer기반 Classification/Detection 상용수준 및 한국형 DB기반 모델확보, 성능 우위

초거대모델의 한국형 DB기반 Fine-tuning 및 성능 우위

해외 인식 엔진 대비 성능 우위

기술혁신

상용화

AI 기반 이미지 자동 생성 기술

자동 생성된 이미지의 소비자 만족도

초거대모델 초거대모델(Stable Diffusion 등)의 Fine-tuning등 상용수준 확보

초거대모델 초거대모델(Stable Diffusion 등)의 Fine-tuning등 성능 개선

초거대모델 초거대모델(Stable Diffusion 등)의 Fine-tuning등 성능 우위

해외 인식 엔진 대비 성능 우위

기술혁신

상용화

MR환경 제어 및 실시간 공간 영상 가시화 기술

환경 인식 정확도 및 자연스러운 가시화

환경인식

기반 기술 확보

및 Prototype 확보

인식 결과 기반

Rendering 기술확보

상용화 및 상용제품으로부터 지속적인 데이터 확보로 성능 개선

해외 인식 엔진 대비 성능 우위

기술혁신

상용화

플렌옵틱 영상처리 및 가시화 기술

자연스러운 가시화 기술

Plenoptic Camera 설계 및 Multiview 이미지 확보

&

Multi-focus 결과 확보

Multi-focus 결과 개선 및 해상력 개선

&

3D Rendering Prototype 확보

Multiview 이미지기반 3D Rendering 성능 개선

해외 기술 대비 성능 우위

기술혁신

상용화

엣지 AI 기반 영상처리 시각화 기술

엣지 향상

AI 인식 성능 확보

경량화 엔진 확보 기술

(Tensorflow Lite 활용)

Quantization 기술

Model Distillation 기술 기반 경량화

경량화 엔진 고도화 및

SDK 확보

지속적인 DB 확보로 인식 성능 고도화

해외 기술 대비 성능 우위

기술혁신

상용화


처음 페이지로