반도체 스타트업 내러티브 ⑤ · AI 추론 실리콘
이 그룹은 모두 “GPU보다 빠르고 효율적인 추론”을 말한다. 그러나 Groq는 chip보다 cloud token service를, d-Matrix는 memory-centric accelerator와 heterogeneous pipeline을, Tenstorrent는 networked general-purpose system을 판다. Rebellions·FuriosaAI는 data center NPU와 sovereign AI를, DEEPX·Axelera AI·Syntiant는 edge와 physical AI를 겨냥한다. 같은 benchmark로 비교할 시장이 아니다.
투자자 포트폴리오 지도에서 AI inference는 가장 큰 후기 수표가 들어간 그룹이었다. Groq, Tenstorrent, d-Matrix, Rebellions, Axelera AI가 각각 수백 million 달러를 조달했다. 이제 질문은 “칩이 동작하는가”보다 “SDK·server·cloud·고객 workload가 반복 매출을 만드는가”다.
AI 추론 칩의 진짜 제품은 TOPS가 아니다. 지원 모델, compiler, serving software, memory capacity, network, rack power, SLA가 결합된 ‘token 생산 시스템’이다.
먼저 시장을 네 개로 분리한다
| 시장 | 대표 회사 | 핵심 최적화 | 구매자가 보는 단위 |
|---|---|---|---|
| cloud inference service | Groq | 결정적 streaming architecture, 낮은 latency, global cloud | token/s, time-to-first-token, SLA, API 가격 |
| data center accelerator·rack | d-Matrix, Tenstorrent, Rebellions, FuriosaAI | memory locality, chiplet·HBM, network, air-cooled density | server·rack throughput, power, model coverage, TCO |
| sovereign·enterprise appliance | Rebellions, FuriosaAI | 국내 공급망, private model, turnkey server·NPUaaS | 배포 시간, data sovereignty, 운영 지원 |
| edge·physical AI | DEEPX, Axelera AI, Syntiant | low-power vision·sensor AI, on-device privacy | W 또는 mW당 성능, latency, BOM, OEM volume |
LLM용 HBM accelerator와 wake-word용 sub-mW NPU를 TOPS/W 하나로 놓으면 의미가 없다. 정밀도, sparsity, batch, sequence length, model size, memory, accuracy threshold가 다르다. 이 글은 architecture 주장보다 2026년 현재의 생산·배포 증거를 중심으로 비교한다.
내러티브 1: 추론은 compute보다 memory·scheduling 문제다
autoregressive LLM은 token마다 weight와 KV cache를 읽고, prefill과 decode의 계산·memory 특성이 다르다. agentic AI와 reasoning model은 sequence가 길고 tool call·speculative decoding·MoE routing이 섞인다. 피크 FLOPS를 높이는 것만으로 GPU utilization과 latency tail을 해결하기 어렵다.
d-Matrix는 digital in-memory compute와 memory-centric architecture로 이 문제를 푼다. Corsair는 TSMC N6와 Alchip 협업으로 생산되며 회사는 2026년 6월 full production과 여름 volume shipment를 발표했다. GPU와 Corsair를 분리해 feed-forward network나 speculative decoding의 일부를 맡기는 heterogeneous pipeline도 강조한다.
핵심은 “GPU를 전부 대체”하는 서사에서 벗어났다는 점이다. 고객은 이미 GPU cluster와 software를 갖고 있다. 특정 stage를 가속해 latency나 cost를 낮추는 drop-in 경로가 full replacement보다 빠를 수 있다.
내러티브 2: Groq는 chip 회사에서 cloud operator로 변했다
Groq의 Language Processing Unit은 compiler가 정한 deterministic dataflow와 대규모 on-chip SRAM을 강조해 왔다. 그러나 2026년의 사업 핵심은 chip 판매보다 GroqCloud다. 회사는 13개 data center, 5 million 이상의 developer, 주당 trillion 단위 token 처리를 공개했다.
2025년 12월 Groq는 NVIDIA와 비독점 inference technology licensing agreement를 맺었고, 2026년 6월 $650 million growth capital을 추가 조달했다. 자금은 cloud를 2027년 200 MW로 확장하는 데 쓰인다. 이는 fabless chip startup이 data center capex와 운영 조직을 가진 service company로 변한 사례다.
이 모델의 upside는 hardware margin보다 반복 API revenue와 직접적인 workload feedback이다. downside는 silicon뿐 아니라 전력 계약, data center utilization, 고객 지원, model onboarding, 가격 경쟁을 모두 감당해야 한다는 점이다.
내러티브 3: Tenstorrent는 network를 architecture의 일부로 본다
Tenstorrent는 Tensix core, RISC-V CPU, Ethernet 기반 scale-out을 묶는다. 2026년 4월 Galaxy Blackhole의 general availability를 발표했고 32개 Blackhole chip, on-chip SRAM, DRAM, 다수 800G port를 갖춘 system을 제시했다.
회사는 video generation, prefill, decode를 모두 처리하는 general-purpose Networked AI를 강조한다. specialized inference ASIC과 달리 workload 변화에 software와 network topology로 대응하겠다는 전략이다. 자체 chip·board·system을 팔면서 RISC-V와 AI IP도 license한다.
2024년 $693 million 이상 Series D는 Samsung Securities와 AFW Partners가 주도했다. 자금 규모는 tapeout보다 system·software·global deployment에 필요한 비용을 반영한다. 앞으로는 demo benchmark가 아니라 설치된 Galaxy cluster의 utilization과 고객 갱신이 중요하다.
내러티브 4: 한국 NPU는 mass production과 sovereign AI를 판다
Rebellions는 REBEL100 chiplet에 HBM3E와 UCIe를 결합하고 RebelCard·RebelServer로 올라간다. 회사 공개 사양은 4개 compute chiplet, 144GB HBM3E, 2 PFLOPS FP8, server당 8 card다. 2026년 SK Telecom·Arm과 sovereign AI·통신 data center validation을 발표했고 SqueezeBits를 인수해 serving optimization을 내재화했다.
이 움직임은 한국 NPU의 제품 경계가 chip에서 full stack으로 넓어지는 과정이다. Rebellions는 2026년 $400 million pre-IPO를 조달했고 국민성장펀드 첫 직접투자 사례가 됐다. 그러나 대규모 자금은 상장보다 먼저 REBEL100 양산, SDK model coverage, 해외 반복 매출로 정당화돼야 한다.
FuriosaAI는 RNGD의 mass production을 더 구체적으로 공개했다. 2026년 1월 TSMC·ASUS에서 첫 4,000개를 수령했다고 밝혔고, 180W PCIe card와 turnkey server를 제공한다. 7월 Samsung SDS가 RNGD 기반 NPUaaS를 정식 출시했다. “칩 공급”에서 “cloud portal에서 주문 가능한 service”로 넘어간 중요한 신호다.
내러티브 5: edge AI는 data center의 축소판이 아니다
DEEPX는 smart camera, robotics, industrial computer, gateway 같은 physical AI를 겨냥한다. 2026년 AAEON과 3년 mass-production cooperation을 발표했고, Ultralytics와 YOLO pipeline을 연결했다. edge 고객에게 중요한 것은 큰 LLM 하나보다 camera·codec·sensor pipeline, long-term supply, SDK와 OEM certification이다.
Axelera AI의 Metis는 digital in-memory compute를 edge server·industrial system에 제공한다. 2026년 2월 Innovation Industries가 주도한 라운드로 누적 $250 million 이상을 확보했고 여러 OEM partnership을 발표했다. 자본은 next-generation chip뿐 아니라 sales·support·board 공급망 확장에 쓰인다.
Syntiant는 항상 켜진 audio·sensor·vision NDP와 model toolchain을 판다. 회사는 100 million개 이상의 Neural Decision Processor 출하를 공개한다. data center unicorn과 비교하면 라운드 headline은 작아 보여도 volume shipment와 ultra-low-power design-in은 다른 종류의 방어력이다.
상용화 단계로 다시 배열하면
| 회사 | 2026년 공개 증거 | 다음 증명 |
|---|---|---|
| Groq | 13개 data center, 대규모 developer·token usage, $650 million growth capital | 200 MW 확장의 utilization·unit economics |
| d-Matrix | Corsair full production, volume shipment 계획 | 우선 고객의 이름·반복 주문·heterogeneous deployment 성과 |
| Tenstorrent | Galaxy Blackhole GA와 system 가격·사양 | 설치 cluster·software coverage·customer renewal |
| Rebellions | RebelServer·SKT validation·SqueezeBits 인수·대규모 자금 | REBEL100 volume shipment와 해외 commercial revenue |
| FuriosaAI | RNGD 4,000개 수령, mass production, Samsung SDS NPUaaS live | service utilization과 추가 wafer·server 반복 주문 |
| DEEPX | AAEON·Ultralytics 등 OEM·software partnership | pre-order에서 실제 OEM shipment·현장 유지율로 전환 |
| Axelera AI | $250 million 이상 자금, Metis board·OEM partner | 고객별 volume과 다음 세대 silicon의 software continuity |
투자자들은 chip이 아니라 go-to-market을 고른다
Groq의 cloud expansion에는 growth capital이, Tenstorrent의 system·IP 전략에는 Samsung·Fidelity·자동차 CVC가, d-Matrix의 production ramp에는 Temasek·QIA·EDBI·M12가 붙었다. Rebellions와 FuriosaAI에는 한국 정책금융·통신·대기업이 고객 역할까지 함께 한다.
후기 투자자가 보는 것은 architecture novelty보다 세 가지다. 이미 작동하는 silicon, 안정적인 supply, 고객이 바꾸기 어려운 software·service다. AI chip은 tapeout 뒤에 model support와 serving optimization 비용이 계속 발생하므로 gross margin만 보고 software 인력을 비용으로 취급하면 경쟁력이 무너진다.
benchmark 발표를 읽는 아홉 가지 질문
- model과 parameter 수, dense·MoE 여부가 무엇인가.
- prefill과 decode를 분리했고 input·output sequence를 공개했는가.
- batch, concurrency, latency SLA가 실제 service와 같은가.
- 정밀도·quantization과 accuracy 검증 기준이 무엇인가.
- chip, card, server, rack 중 어느 전력과 가격을 비교하는가.
- HBM·DRAM capacity와 network·host 비용을 포함했는가.
- compiler에서 지원하지 않는 operator의 fallback은 어디서 실행되는가.
- 공급사 자체 수치인지 MLPerf 같은 공개 규칙 submission인지 구분한다.
- peak demo인지 cloud·customer production에서 반복되는 수치인지 확인한다.
MLPerf Inference v6.0은 2026년 reasoning·speculative decoding과 새로운 LLM test를 추가했다. 그러나 benchmark submission이 없다고 제품이 나쁘다는 뜻도, 한 workload의 1등이 모든 서비스의 TCO 우위라는 뜻도 아니다. 가장 신뢰할 수 있는 증거는 재현 가능한 공개 benchmark와 실제 고객 deployment가 함께 있는 경우다.
앞으로 12개월의 판별 신호
- Groq의 200 MW 확장이 token 가격 하락 속에서도 높은 utilization과 service margin을 유지하는가.
- d-Matrix Corsair의 volume shipment가 공개 고객과 repeat order로 이어지는가.
- Tenstorrent Galaxy가 demo를 넘어 설치된 cluster와 software release cadence를 보여 주는가.
- Rebellions의 2027년 I/O die 일정과 REBEL100 양산이 SKT validation 뒤 commercial service로 연결되는가.
- FuriosaAI Samsung SDS NPUaaS의 사용량·고객 사례와 추가 silicon order가 공개되는가.
- DEEPX·Axelera AI가 partnership 수보다 실제 OEM unit shipment를 공개하는가.
이 그룹의 강세 판단을 뒤집는 신호는 GPU vendor가 inference-specific silicon·software를 빠르게 개선해 startup의 TCO 격차를 닫는 경우다. 또 model architecture가 너무 빨리 바뀌어 신규 operator 지원이 늦어지면 고정 architecture의 효율 이점이 software lag로 사라질 수 있다.
원문 링크
- Groq 2026년 $650 million growth capital, GroqCloud·NVIDIA licensing 업데이트
- d-Matrix Corsair full production, d-Matrix $275 million Series C
- Tenstorrent Galaxy Blackhole GA, Tenstorrent $693 million 이상 Series D
- Rebellions REBEL100·server 사양, SKT·Arm validation, SqueezeBits 인수
- FuriosaAI RNGD 4,000개·mass production, Samsung SDS NPUaaS 출시
- DEEPX·AAEON mass-production cooperation, DEEPX·Ultralytics 협업
- Axelera AI $250 million 이상 조달·OEM 업데이트, Syntiant edge AI product·shipment 현황
- MLPerf Inference v6.0 공식 결과
반도체 스타트업 내러티브 시리즈
- 1. 광 I/O 스타트업 지도: Ayar Labs·Lightmatter가 AI 데이터 이동을 다시 설계하는 법
- 2. 칩렛 스타트업 지도: Eliyan·Chipletz가 패키지를 시스템으로 바꾸는 법
- 3. AI 전력반도체 스타트업 지도: 킬로와트 프로세서 아래에서 벌어지는 경쟁
- 4. RISC-V 스타트업 지도: 개방형 ISA 위에서 SiFive·Ventana가 파는 것은 무엇인가
- 5. AI 추론 반도체 스타트업 지도: Groq·d-Matrix·한국 NPU의 서로 다른 승부
- 6. 반도체 공정 스타트업 지도: Nearfield·EUV Tech가 수율의 숨은 병목을 찾는 법
자료 기준일: 2026년 7월 28일. 회사별 benchmark와 성능 주장은 조건이 달라 직접 순위를 만들지 않았다. 필자는 Synopsys 재직자이며 공개 자료 기반 산업 분석이다. 특정 기업에 대한 투자 권유가 아니다.