클라우드 접속 없이 내 PC에서 AI 코딩을? 엔비디아, RTX GPU 기반 ‘큐원3.8-27B’ 로컬 에이전트 지원

엔비디아는 CUDA 생태계와 MTP(다중 토큰 예측) 최적화를 바탕으로 단일 RTX 5090 GPU에서 초당 131토큰의 추론 성능을 달성하며, 로컬 PC 및 엣지(Jetson) 환경에 최적화된 Qwen3.8-27B 에이전틱 코딩 인프라를 구현했다.

클라우드 의존 없는 강력한 보안과 고성능 추론… 지포스 RTX 5090 등 다양한 폼팩터에서 빠른 코딩 생태계 구축

클라우드 접속 없이 내 PC에서 AI 코딩을? 엔비디아, RTX GPU 기반 ‘큐원3.8-27B’ 로컬 에이전트 지원
지포스 RTX 5090, 인텔 코어 울트라 9(Intel Core Ultra 9) 285K, 64GB RAM, 윈도우 11(Windows 11), 엔비디아 드라이버 610.43 환경 테스트 결과. 라마.cpp에서 Q4_K_M 체크포인트와 스피드벤치(speedbench) 벤치마크를 사용했다. MTP n_max = 3. (이미지. 엔비디아)

인공지능(AI) 컴퓨팅 분야의 글로벌 선두주자인 엔비디아(NVIDIA)가 엔비디아 RTX GPU에서 최신 오픈소스 모델인 ‘큐원3.8-27B(Qwen3.8-27B)’를 공식 지원한다고 밝혔다. 이번 발표는 개발자가 클라우드 서버에 의존하지 않고 자신의 개인용 컴퓨터(PC)나 워크스테이션에서 직접 최고 수준의 AI 코딩 에이전트를 가동할 수 있게 되었다는 점에서 큰 의미를 가진다.

민감한 데이터 유출 걱정 없는 강력한 ‘로컬 AI 에이전트’의 등장

큐원3.8-27B는 큐원3.8-맥스(Qwen3.8-Max)의 로컬 동반 모델로 개발되었으며, 총 270억 개의 파라미터(매개변수)를 갖춘 거대언어모델이다. 단일 GPU 환경에서도 원활하게 구동되도록 설계되어 개인 개발자나 기업의 내부 엔지니어가 손쉽게 접근할 수 있다.

특히 개발자는 외부 네트워크나 클라우드 서버로 데이터를 송신할 필요 없이, 자신의 로컬 시스템 안에서 프로젝트 문맥과 코드를 안전하게 분석할 수 있다. 이는 기업의 독점 자산이나 민감한 소스코드 유출에 대한 우려를 근본적으로 해소해 준다. 보안성을 확보함과 동시에 빠른 반응성을 갖춘 로컬 코딩 워크플로우를 완성할 수 있는 기반이 마련된 셈이다.

초당 131토큰의 압도적 속도와 광범위한 생태계 호환성

이번 기술 지원의 핵심은 강력한 추론 속도에 있다. 엔비디아 지포스(GeForce) RTX 5090과 엔비디아 RTX PRO GPU 등 최신 인프라에서 이 모델이 가동된다. 여기에 다중 토큰 예측(Multi-Token Prediction, MTP) 기술이 적용되어, 단일 지포스 RTX 5090 시스템 기준으로 초당 131개의 토큰을 처리하는 고성능을 발휘한다.

이러한 높은 연산 속도는 복잡한 도구 사용이나 장시간 이어지는 코딩 작업에서 대기 시간을 대폭 줄여준다. 또한, 개발자들에게 친숙한 라마.cpp(llama.cpp), 올라마(Ollama), 언슬로스(Unsloth), LM 스튜디오 바이오닉(LM Studio Bionic) 등 대표적인 오픈소스 도구들과 즉시 연동된다.

아울러 이 모델은 개인용 디바이스인 DGX 스파크(DGX Spark)와 DGX 스테이션(DGX Station)은 물론, 산업 현장의 엣지 디바이스인 엔비디아 젯슨(Jetson) 모듈까지 지원 범위를 확장한다. 이로써 엔비디아는 PC부터 산업용 엣지 장비에 이르기까지 전방위적인 로컬 AI 에이전트 생태계를 구축하게 되었다.


용어해설

  • 파라미터 (Parameter): AI 모델이 학습을 통해 데이터의 패턴을 기억하고 판단하는 데 사용하는 ‘매개변수’이다. 숫자가 많을수록 복잡하고 정밀한 연산이 가능하다.
  • 다중 토큰 예측 (Multi-Token Prediction, MTP): AI가 단어를 생성할 때 한 번에 하나의 토큰(단어 조각)만 예측하는 것이 아니라, 여러 개의 토큰을 동시에 예측하여 처리 속도를 대폭 향상시키는 기술이다.
  • 로컬 AI 에이전트 (Local AI Agent): 인터넷이나 외부 클라우드 서버에 연결하지 않고, 사용자의 기기(PC, 워크스테이션) 내부 자원만 활용하여 스스로 작업을 수행하는 인공지능 프로그램이다.
  • 엣지 컴퓨팅 (Edge Computing): 중앙 데이터센터나 클라우드가 아닌, 데이터가 발생되는 현장 주변의 단말 디바이스(엣지 장비)에서 직접 데이터를 처리하고 연산하는 방식이다.

뉴스레터 구독하기

아이씨엔매거진은 AIoT, IIoT 및 피지컬 AI, 디지털트윈을 통한 제조업 디지털전환 애널리틱스를 제공합니다.
테크리포트: 자율제조, 전력전자, 모빌리티, 로보틱스, 스마트농업

AW2026 expo
ACHEMA 2027
전시회 세미나 선물 준비는 기프트랩스
오승모 기자
오승모 기자http://icnweb.kr
기술로 이야기를 만드는 "테크 스토리텔러". 아이씨엔 미래기술센터 수석연구위원이며, 아이씨엔매거진 편집장을 맡고 있습니다. 디지털 전환을 위한 데이터에 기반한 혁신 기술들을 국내 엔지니어들에게 쉽게 전파하는데 노력하는 중입니다.
fastech EtherCAT
as-interface
GiftLabs

Related Articles

Stay Connected

440FansLike
407FollowersFollow
224FollowersFollow
120FollowersFollow
372FollowersFollow
152SubscribersSubscribe
GiftLabs
spot_img
InterPACK
spot_img
SPS 2026
automotion
Power Electronics Mag

Latest Articles

Related Articles

PENGUIN Solutions
WindEnergy
InterPACK

Related Articles

fastech EtherCAT
as-interface
생성형 AI가 홈 자동화 속으로… 마우저, 미디어텍 6nm 기반 ‘지니오 420’ 공급 개시

생성형 AI가 홈 자동화 속으로… 마우저, 미디어텍 6nm 기반 ‘지니오 420’...

0
마우저가 미디어텍의 6nm 기반 '지니오 420' 플랫폼 공급을 시작하며 인터넷 연결 없이 가정 및 상업용 기기 자체에서 생성형 AI를 가동할 수 있는 환경을 제공하고 있다
TI, 업계 최초 상용 CAN XL 트랜시버 출시로 산업 네트워크 대역폭 한계 깬다

TI, 업계 최초 상용 CAN XL 트랜시버 출시로 산업 네트워크 대역폭...

0
텍사스 인스트루먼트(TI)가 업계 최초로 상용 CAN XL 트랜시버를 출시하여 로봇과 산업 장비의 데이터 전송 속도를 대폭 향상시켰다
노르딕, 스카일로 인증 nRF9151로 위성 및 셀룰러 통신 전격 지원

노르딕, 스카일로 인증 nRF9151로 위성 및 셀룰러 통신 전격 지원

0
노르딕 세미컨덕터가 지상 기지국이 없는 오지에서도 위성과 지상 이동통신망을 자동으로 오가며 연결을 유지하는 초소형 사물인터넷 통신 모듈을 공개했다
콩가텍, 별도 가속기 없는 초고성능 AI 모듈 ‘conga-HPC/cRX1’ 출시

콩가텍, 별도 가속기 없는 초고성능 AI 모듈 ‘conga-HPC/cRX1’ 출시

0
콩가텍이 별도의 인공지능 가속기 카드를 추가하지 않고도 로봇과 자율주행 장비의 복잡한 인공지능 연산을 단일 보드로 처리하는 고성능 임베디드 컴퓨터 모듈을 상용화했다
AI가 반도체 직접 설계 엔비디아 신기술 공개

AI가 반도체 직접 설계 엔비디아 신기술 공개

0
엔비디아가 AI 물리학과 가속 수학 라이브러리를 결합한 에이전트 툴킷을 출시하여 반도체와 복잡한 기계 설계를 AI가 스스로 수행하는 자율형 엔지니어링 시대를 열었다
마우저 일렉트로닉스, 차세대 모빌리티 혁신 가속하는 온라인 운송 리소스 센터 공개

마우저 일렉트로닉스, 차세대 모빌리티 혁신 가속하는 온라인 운송 리소스 센터 공개

0
글로벌 전자부품 유통기업 마우저 일렉트로닉스가 전기차, 로보택시 등 미래 교통수단을 개발하는 기술자들을 돕기 위해 전문적인 기술 정보와 부품 자료를 한곳에 모은 '온라인 정보 센터'를 열었다
- Our Youtube Channel -Engineers Youtube Channel

Latest Articles