“국내 AI 반도체 회사가 많다는데 서로 뭐가 다른가요?”, “NPU 회사에 지원하려면 어디를 봐야 하나요?” 주변 엔지니어와 취업 준비생에게 반복해서 듣는 질문입니다. 특정 사람이나 회사 내부 이야기는 쓰지 않고, 익명으로 공통된 고민만 뽑아 공개 제품 자료로 다시 정리했습니다.
한 줄 답: 한국 AI 반도체 회사는 TOPS 순위로 보면 안 됩니다. 목표 workload, memory 구조, software stack, 제품을 전달하는 방식의 네 축으로 봐야 합니다.
데이터센터 LLM 가속기, 엣지 NPU 카드, SoC에 들어가는 licensable IP, 서버와 rack까지 묶는 full-stack 사업은 고객도 경쟁자도 다릅니다. TOPS만 나열하면 더 헷갈립니다. 정밀도가 다르면 같은 TOPS가 아니고, 모델이 메모리에 들어가지 않거나 compiler가 연산을 지원하지 못하면 peak compute는 서비스 성능이 되지 못합니다.
한국 AI 반도체를 나누는 네 가지 제품 유형
1. 데이터센터 LLM 가속기: 퓨리오사AI RNGD
RNGD는 대형 언어모델과 멀티모달 추론을 겨냥한 PCIe 가속기입니다. 공개 개발자 문서는 TSMC 5nm, HBM3 48GB, 1.5TB/s memory bandwidth, PCIe Gen5 x16, multi-instance와 SR-IOV 지원을 명시합니다.
이 제품을 볼 때 핵심은 512 TOPS 같은 한 숫자보다 세 가지입니다.
- 48GB HBM3에 모델과 KV cache가 얼마나 들어가는가
- 1.5TB/s bandwidth를 실제 serving workload가 얼마나 활용하는가
- 한 카드를 여러 tenant가 나눠 쓰는 virtualization이 운영 환경에서 어떻게 동작하는가
퓨리오사는 RNGD에 HBM3를 적용하면서 2.5D packaging, thermal, interposer signal/power integrity 검증이 중요했다고 설명합니다. NPU core만의 경쟁이 아니라 HBM, advanced packaging, system verification까지 포함된다는 뜻입니다.
2. chiplet과 rack-scale 플랫폼: 리벨리온
리벨리온은 초기 ATOM에서 REBEL-Quad와 rack-scale 플랫폼으로 사업 경계를 넓히고 있습니다. 회사 발표에 따르면 REBEL-Quad는 chiplet 구조와 144GB HBM3E를 사용해 대규모 inference를 목표로 합니다. 공개 white paper는 mixed-precision compute, on-chip mesh, custom die-to-die protocol을 핵심으로 제시합니다.
더 중요한 변화는 “더 큰 NPU”가 아니라 공급 범위입니다. 리벨리온은 RebelRack과 RebelPOD를 공개했고, 2026년 6월에는 inference optimization 회사 SqueezeBits 인수를 발표했습니다. 칩에서 compiler와 serving, server와 rack 구성으로 확장하는 방향입니다.
실제 고객은 가속기 연산 성능만 사지 않습니다.
- 지원 model과 framework
- quantization과 kernel optimization
- multi-card communication
- scheduler와 serving software
- server/rack qualification
- 장애 대응과 장기 software support
3. 엣지·온디바이스 가속기: DEEPX
DEEPX 공개 자료는 DX-M1, DX-M1M, DX-H1과 함께 runtime, compiler, streaming, application package를 제공합니다. 제품 brochure에서 DX-M1은 M.2 형태, DX-H1은 PCIe card 형태로 제시됩니다.
엣지 시장에서는 데이터센터와 평가식이 다릅니다.
- absolute throughput보다 watt당 처리량이 중요한가
- camera·codec pipeline과 zero-copy가 가능한가
- fanless enclosure의 thermal limit를 버티는가
- 고객의 custom model과 operator가 compile되는가
- 여러 camera stream을 latency 목표 안에서 처리하는가
엣지 NPU의 경쟁력은 데모 한 개의 FPS보다 고객 모델을 제품 수명 동안 계속 올릴 수 있는 software release discipline에 가깝습니다. DEEPX 개발자 페이지에 runtime, compiler, application package가 지속적으로 업데이트되는 이유도 여기에 있습니다.
4. SoC에 통합하는 NPU IP: 오픈엣지테크놀로지 ENLIGHT
오픈엣지는 완성된 PCIe card 회사와 사업 모델이 다릅니다. ENLIGHT NPU IP와 memory subsystem IP를 SoC 회사가 자신의 chip에 통합하는 형태입니다.
회사 자료는 ENLIGHT를 4/8-bit mixed-precision inference IP로 설명하고, compiler가 floating-point network를 integer network로 변환해 NPU command와 parameter를 생성한다고 밝힙니다.
IP 사업의 고객 질문은 board 제품과 다릅니다.
- target process에서 PPA가 어떻게 변하는가
- interconnect, memory controller, PHY와 검증된 조합이 있는가
- 고객 model과 operator를 compiler가 지원하는가
- safety·security 요구가 있는 SoC에 통합 가능한가
- integration과 verification support 범위가 어디까지인가
같은 표에 놓기 전에 물어야 할 일곱 가지
| 질문 | 왜 중요한가 |
|---|---|
| 어떤 workload인가 | LLM serving, vision, recommendation, codec 결합은 병목이 다릅니다. |
| 모델과 KV cache 크기는 얼마인가 | memory capacity를 넘으면 partition과 offload 비용이 생깁니다. |
| latency와 throughput 중 무엇이 우선인가 | 큰 batch의 peak throughput이 실시간 서비스에는 맞지 않을 수 있습니다. |
| 어떤 precision을 실제로 쓰는가 | INT4, INT8, FP8, BF16 수치를 직접 비교하면 안 됩니다. |
| memory와 interconnect는 무엇인가 | compute보다 data movement가 병목일 수 있습니다. |
| compiler와 serving stack이 준비됐는가 | 미지원 operator와 fallback은 성능을 무너뜨립니다. |
| 제품을 어떻게 사는가 | IP, card, server, rack, cloud access는 구매·운영 책임이 다릅니다. |
취업 준비생은 회사를 어떻게 골라야 하나
회사 이름보다 자신이 쌓고 싶은 문제를 먼저 고르세요.
데이터센터 가속기가 맞는 사람
HBM, NoC, PCIe/CXL, virtualization, compiler, LLM serving, thermal과 power delivery에 관심이 있다면 데이터센터 가속기와 rack-scale 회사가 맞습니다.
엣지 NPU가 맞는 사람
computer vision, low-power architecture, camera pipeline, embedded Linux, quantization, real-time latency, field deployment가 흥미롭다면 엣지 제품이 잘 맞습니다.
IP 회사가 맞는 사람
microarchitecture, RTL, verification, PPA, bus·memory subsystem, 고객 SoC integration을 깊게 파고 싶다면 IP 사업이 좋은 학교가 될 수 있습니다.
full-stack 회사가 맞는 사람
칩 하나보다 compiler, runtime, serving, server, cluster 운영까지 연결하고 싶다면 full-stack 전략을 가진 회사를 보세요. 이 경우 hardware와 software 사이를 번역하는 능력이 중요합니다.
자주 묻는 질문
Q. TOPS가 높은 NPU가 무조건 좋은가요?
아닙니다. precision, memory capacity, bandwidth, model support, batch size, latency 조건이 같아야 의미 있는 비교가 됩니다. peak TOPS보다 실제 workload benchmark가 중요합니다.
Q. GPU를 NPU가 곧 대체하나요?
모든 workload에서 대체하지는 않습니다. GPU는 software ecosystem과 범용성이 강하고, NPU는 목표 workload에서 전력·비용 효율을 노립니다. 실제 시장은 대체보다 workload별 분화에 가깝습니다.
Q. 하드웨어 전공자도 compiler를 알아야 하나요?
점점 더 중요합니다. 연산 core가 좋아도 graph partition, quantization, kernel mapping, memory scheduling이 나쁘면 성능이 나오지 않습니다. 최소한 model이 hardware까지 내려오는 경로를 설명할 수 있어야 합니다.
Q. 국내 AI 반도체 회사의 가장 큰 리스크는 무엇인가요?
공통적으로 software ecosystem, 고객 workload 확보, 양산과 공급망, 장기 지원이 중요합니다. 다만 제품 유형마다 위험의 위치가 다르므로 한 문장으로 순위를 매기면 안 됩니다.
마무리
한국 AI 반도체 회사들은 더 이상 “NPU chip을 만든다”는 한 문장으로 묶이지 않습니다. 데이터센터에서는 HBM과 chiplet, virtualization, rack-scale deployment가 중요하고, 엣지에서는 thermal envelope와 compiler update가, IP에서는 integration과 memory subsystem이 핵심입니다.
앞으로의 지도는 회사 로고 지도가 아니라 workload × memory × software × delivery model 지도가 되어야 합니다.
공개 출처
- FuriosaAI RNGD developer documentation
- FuriosaAI HBM3 engineering note
- Rebellions REBEL-Quad white paper
- Rebellions–SqueezeBits acquisition announcement
- DEEPX developer documents
- OPENEDGES ENLIGHT NPU IP
편집 원칙: 이 글은 주변에서 반복해서 들은 익명 고민을 일반화하고 공개 제품 자료로 다시 검증해 작성했습니다. 개별 인물이나 비공개 회사 사례를 특정할 수 있는 정보는 사용하지 않았으며, 성능 우열이나 투자 추천을 목적으로 하지 않습니다.