KAIST, 사람처럼 텍스트·이미지 등 동시에 이해하는 멀티모달 AI 개발

전기및전자공학부 최소영 석사과정, 황성현 박사과정, 황의종 교수(오른쪽위). [사진=KAIST]

[이뉴스투데이 백연식 기자] 국내 연구진이 그림과 글자를 모두 고르게 인식하여 훨씬 더 정확한 예측을 가능케 하는 멀티모달 인공지능 학습 기술을 개발했다.

KAIST는 황의종 전기및전자공학부 교수 연구팀이 다양한 데이터 유형을 한 번에 처리해야 하는 멀티모달 인공지능이 모든 데이터를 고르게 활용할 수 있도록 돕는 새로운 학습 데이터 증강 기술을 개발했다고 14일 밝혔다.

멀티모달 인공지능은 텍스트, 영상 등 여러 데이터를 동시에 활용해 판단하고 있다. 하지만 인공지능은 여러 정보를 받아들일 때, 한쪽 데이터에 치우쳐 판단하는 경향을 보여 예측 성능이 떨어지는 문제가 있었다.

연구팀은 이 문제를 해결하기 위해, 일부러 서로 어울리지 않는 데이터를 섞어서 학습에 사용했다. 그러면 인공지능은 어떤 경우에도 한쪽 데이터에만 의존하지 않고, 글과 그림, 소리 등 모든 데이터를 균형 있게 활용하는 방법을 배우게 된다.

품질이 낮은 데이터는 보완하고, 어려운 데이터는 더 강조해서 훈련하는 방식까지 더해 다양한 상황에서도 안정적으로 성능을 높일 수 있음을 보여줬다. 이 방법은 특별한 모델 구조에 묶이지 않고, 어떤 종류의 데이터에도 쉽게 적용할 수 있어 확장성과 실용성이 크다는 점에서 의미가 있다.

황 교수는 “AI 성능을 높이려면 모델 구조(알고리즘)만 바꾸는 것보다, 어떤 데이터를 어떻게 학습에 쓰느냐가 훨씬 중요하다”며 “이번 연구는 멀티모달 인공지능이 특정 데이터(예: 영상, 텍스트)에 치우치지 않고 균형 있게 정보를 활용할 수 있도록 데이터 자체를 설계하고 가공하는 접근법이 효과적일 수 있음을 보여줬다”고 말했다.

이번 연구에는 전기및전자공학부 황성현 박사과정, 최소영 석사과정이 공동 제1저자로 참여했으며, 황 교수가 교신저자로 참여했다. 연구 결과는 오는 12월 미국 샌디에이고와 멕시코 멕시코시티에서 열리는 AI 분야 최고 권위 국제학술대회 NeurIPS(Conference on Neural Information Processing Systems)에서 발표될 예정이다.

본 콘텐츠는 뉴스픽 파트너스에서 공유된 콘텐츠입니다.

다음 내용이 궁금하다면?

광고 보고 계속 읽기

원치 않을 경우 뒤로가기를 눌러주세요

실시간 키워드

2022.08.01 00:00 기준

실시간 키워드