← 목록으로
RTX 5090으로 Qwen3.5-35B-A3B 서빙 성능 실측 — OpenRouter 경쟁사 8곳과 비교해봤다
gcube · hands-on

RTX 5090으로 Qwen3.5-35B-A3B 서빙 성능 실측 — OpenRouter 경쟁사 8곳과 비교해봤다

on this page

RTX 5090(gcube) 서빙. 경쟁사 값은 OpenRouter 모델 페이지 공개값, 당사 값은 자체 측정.

측정 기준

수치의 비교 가능성을 위해, 모든 지표를 OpenRouter가 쓰는 것과 같은 기준으로 측정했다.

지표측정 기준
처리량 (Throughput)OpenRouter 정의 그대로 — 스트리밍 응답에서 첫 토큰 도착 이후의 생성 구간만으로 초당 토큰 수를 계산한다. 첫 토큰 대기 시간은 제외한다.
지연 (Latency, TTFT)요청 전송부터 첫 토큰 도착까지. 처리량과 분리해 별도 기록한다.
E2E Latency요청부터 응답 완료까지 총 시간.
GPQA · Tau-Bench (AutoExacto 벤치)모델 페이지의 “AutoExacto Benchmarks” 점수를 산출하는 바로 그 도구(benchmark-harness)를 그대로 사용. 문제 데이터셋·채점 로직·온도 설정 모두 공식값.
가동률 (Uptime)서버 외부에서 5분 간격으로 상시 점검해 산출.
오류율 계열OpenRouter 공식 정의 확인 완료(요청 단위 집계, 오류 3종: 깨진 JSON·없는 툴 이름·스키마 불일치). 실트래픽 기반 지표이므로 등록 후 집계.

AutoExacto는 OpenRouter가 툴콜 요청의 라우팅 순위를 정하는 시스템으로, 각 프로바이더에 GPQA Diamond와 Tau2-Bench를 정기적으로 돌려 점수를 매기고 이를 모델 페이지에 공개한다. 그 벤치마크 도구가 오픈소스로 공개되어 있어 우리도 동일하게 사용했다.


1. 지표 커버리지 — 공개 지표 8개 측정 현황

지표상태당사 값 / 비고
Throughput측정 완료무부하 194 / 부하 104 / 포화 58 tok/s
Latency (TTFT)측정 완료무부하 0.7 / 부하 1.1초
E2E Latency측정 완료약 2.2초 (출력 300토큰 기준)
AutoExacto 벤치측정 완료GPQA 74.7% / Tau-Bench 70.0%
Uptime측정 완료99% 이상
Tool Call Error Rate해당 없음공식 정의 파악 완료. 프록시 보완 시 자동 집계, 정본은 등록 후 실트래픽
Structured Output Error Rate해당 없음
Cache Hit Rate해당 없음본 모델은 prefix caching 미지원

공개 지표 중 등록 전에 측정 가능한 것은 모두 측정 완료(5개). 오류율 2종은 실제 트래픽이 필요해 등록 후 자동으로 집계되며, 캐시 적중률은 모델 특성상 해당 없음이다.


2. 경쟁사 대비 위치

Qwen3.5-35B-A3B를 서빙하는 프로바이더 8곳과 대조했다.

처리량 (tok/s) — 높을수록 좋음

순위프로바이더tok/s
1CoreWeave215
gcube (무부하)194
2DeepInfra89
3Alibaba76
gcube (부하 동시8)104
4~8Parasail 55 / SiliconFlow 44 / Venice 39 / AtlasCloud 31 / Darkbloom 2121~55

경쟁사 값은 실트래픽 상태이므로 당사 부하값(104)과 비교하는 것이 공정하다. 그 기준으로도 상위권이다.

가동률 · 지연 — 경쟁권

지표당사경쟁사 범위위치
가동률 (Uptime)99%+97.4 ~ 100%경쟁권
지연 (TTFT)0.7 ~ 1.1초0.25 ~ 3.59초중위권

GPQA 품질 (%) — 높을수록 좋음

순위프로바이더GPQA
1CoreWeave82.8%
2~4SiliconFlow 82.1 / DeepInfra 81.9 / Venice 81.881~82%
5Darkbloom79.0%
6gcube (당사)74.7%

4bit 양자화(32GB 카드 1장에 올리기 위한 압축)이며, 저원가와의 트레이드오프다. 실무에는 충분한 수준이다.

Tau-Bench 툴콜 성공률 (%) — 높을수록 좋음

순위프로바이더Tau-Bench
1Darkbloom74.0%
2CoreWeave73.3%
3Venice71.4%
4gcube (당사)70.0%

공개된 경쟁사와 거의 동급이다.

종합

처리량은 상위권, 가동률·지연·툴콜은 경쟁권이며, 품질(GPQA)만 4bit 양자화로 다소 낮다(실무엔 충분). 4bit 압축으로 원가가 낮아 가격 경쟁력을 낼 여지가 있다.


3. 벤치마크 측정 방법 (GPQA · Tau-Bench)

품질(GPQA)과 툴콜(Tau-Bench) 벤치는 OpenRouter가 GitHub에 공개한 공식 벤치마크 도구(OpenRouterTeam/benchmark-harness)를 우리 서버에 직접 연결해 측정했다.

GPQA 74.7% — 세 측정 수렴, 확정

측정 방식점수문항
OpenRouter 공식 harness74.7%198
OpenRouter 공식 harness75.0%60
llama-stack-evals (자체)74.7%198

공식·자체 도구, 60/198문항 세 측정이 모두 74.7~75.0%로 수렴해 확정적이다.

측정을 위해 조정한 사항

공식 도구는 OpenRouter 본사 경유를 전제로 설계돼 있어, 우리 서버 직결을 위해 일부 조정했다. 각 조정이 점수에 미치는 영향을 명시한다.

조정내용점수 영향
연결 주소·응답 형식시험지 전송 경로와 응답 읽기 형식만 우리 서버에 맞춤없음
미지원 부가기능 제거우리 서버가 지원하지 않는 부가기능(추론 암호화 반환 등) 제거없음
사고(thinking) 활성화추론 문제는 사고를 켜야 정확. 끄면 65%로 부당하게 낮음있음 (정확도 정상화). 명시함
Tau-Bench 손님 모델 대체손님 역할 AI를 외부 모델(Gemini) 대신 우리 모델로 대체 (등록 전이라 외부 모델 호출 불가)있음 (손님 모델 다름). Tau 값을 참고 측정으로 표기

GPQA는 연결·형식 조정만 있어 공식과 사실상 동일한 조건이다. Tau-Bench는 공식 코드·시나리오·채점은 동일하나 손님 모델이 다르므로 참고 측정으로 본다.

유의사항

본 측정은 등록 전 자체 검증이다. 정본 수치는 등록 후 OpenRouter가 자사 서버·공식 조건으로 재산출하므로, 측정을 위한 조정 사항이 최종 공개 점수에 영향을 주지 않는다. 오류율 계열은 실제 손님 트래픽이 있어야 의미 있는 값이 나온다.