고려대, 생성형 AI 서버 비용 절감 기술 개발

이 기사 AI가 핵심만 딱!
애니메이션 이미지
GPU 활용 효율 높이는 ‘스케줄링’ 기술 제시
  • 등록 2026-07-13 오후 3:10:49

    수정 2026-07-13 오후 3:10:49

[이데일리 김응열 기자] 챗GPT·제미나이와 같은 대규모언어모델(LLM)을 운영할 때 필요한 서버 비용을 크게 낮추면서도 처리 성능은 오히려 높일 수 있는 기술이 개발됐다.

(왼쪽부터)고려대 전기전자공학부의 안정섭 교수(교신저자), 황순재 박사과정(제1저자). (사진=고려대)
(왼쪽부터)고려대 전기전자공학부의 안정섭 교수(교신저자), 황순재 박사과정(제1저자). (사진=고려대)
고려대는 안정섭 전기전자공학부 교수 연구팀이 LLM 서비스의 GPU(그래픽처리장치) 활용 효율을 높이고 병목 현상을 줄이는 스케줄링(작업 분배) 기술을 개발했다고 13일 밝혔다. 이번 연구 성과는 이달 13~15일 미국 시애틀에서 열리는 컴퓨터 시스템 분야 국제 학술대회인 ‘OSDI(USENIX Symposium on Operating Systems Design and Implementation) 2026’에 채택됐다.

챗GPT와 같은 LLM은 크기가 커 모델을 여러 대의 GPU에 나눠 작업을 처리하는 ‘병렬화’가 필수적이다. 현재 업계에서 널리 쓰이는 ‘텐서 병렬화’는 여러 GPU들이 쉴 새 없이 데이터를 주고받으며 동시에 작업을 처리하는 방식이다. NV링크(NVLink)와 같은 값비싼 고속 연결망이 필수적이다.

반면 여러 GPU를 층(layer) 단위로 나누고 이를 순차 처리하는 ‘파이프라인 병렬화’는 GPU 간 통신량이 적어 고속 연결망 없이 일반 표준 서버(PCIe 기반)로도 이론적으로 더 높은 처리량을 낼 수 있다. 하지만 이전 GPU의 작업이 끝나기를 기다리느라 다른 GPU가 일시적으로 쉬고 있는 ‘파이프라인 버블’ 문제 때문에 실제 온라인 서비스에서는 잘 쓰이지 않았다.

이에 연구팀은 작업의 길이와 양이 제각각인 실제 사용자 요청 환경에서도 높은 성능을 구현하는 스케줄링 기술을 고안했다. 연구팀은 시스템이 응답 속도 목표(SLO)를 실시간으로 감시하며 긴 입력 문장을 가장 최적의 크기로 나눠 처리하는 기술을 고안했다. 더불어 단계별 부하를 점검해 특정 GPU에 과도하게 작업이 몰리거나 유휴 시간이 발생하지 않도록 분배하는 방식도 함께 제안했다.

연구팀은 개발한 두 기술을 LLM을 구동하는 핵심 추론 엔진 중 하나인 SG랭(SGLang)에 구현해 실제 서비스 환경과 유사한 조건에서 성능을 평가했다. 그 결과 연구팀의 기술을 적용한 파이프라인 병렬화 방식이 업계 표준인 텐서 병렬화보다 더 높은 처리 성능을 달성했다.

안정섭 교수는 “고가의 전용 고속 연결망인 NV링크 없이 일반 GPU 서버만으로도 현재 업계 표준인 텐서 병렬화 보다 더 높은 처리 성능을 달성했다”며 “LLM 서비스의 운영 비용을 낮추고 자원 효율을 높일 수 있는 길을 열었다”고 설명했다.

이 기사 AI가 핵심만 딱!
애니메이션 이미지

이데일리
추천 뉴스by Taboola

당신을 위한
맞춤 뉴스by Dable

소셜 댓글

많이 본 뉴스

바이오 투자 길라잡이 팜이데일리

왼쪽 오른쪽

MICE 최신정보를 한눈에 TheBeLT

왼쪽 오른쪽

재미에 지식을 더하다 영상+

왼쪽 오른쪽

두근두근 핫포토

  • 알레띠-맨시티 야호~
  • 멋찜 폭발!
  • 독보적 비주얼
  • 현무·윤아 팔짱
왼쪽 오른쪽
  • 04517 서울시 중구 통일로 92 케이지타워 18F, 19F 이데일리
  • 대표전화 02-3772-0114
  • 이메일 webmaster@edaily.co.kr
  • 사업자번호 107-81-75795
  • 등록번호 서울 아 00090
  • 등록일자 2005.10.25
  • 회장 곽재선
  • 발행·편집인 이익원
  • 청소년보호책임자 임경진