RTX 5090으로 Qwen3.5-35B-A3B 서빙 성능 실측 — OpenRouter 경쟁사 8곳과 비교해봤다
on this page
RTX 5090(gcube) 서빙. 경쟁사 값은 OpenRouter 모델 페이지 공개값, 당사 값은 자체 측정.
측정 기준
수치의 비교 가능성을 위해, 모든 지표를 OpenRouter가 쓰는 것과 같은 기준으로 측정했다.
| 지표 | 측정 기준 |
|---|---|
| 처리량 (Throughput) | OpenRouter 정의 그대로 — 스트리밍 응답에서 첫 토큰 도착 이후의 생성 구간만으로 초당 토큰 수를 계산한다. 첫 토큰 대기 시간은 제외한다. |
| 지연 (Latency, TTFT) | 요청 전송부터 첫 토큰 도착까지. 처리량과 분리해 별도 기록한다. |
| E2E Latency | 요청부터 응답 완료까지 총 시간. |
| GPQA · Tau-Bench (AutoExacto 벤치) | 모델 페이지의 “AutoExacto Benchmarks” 점수를 산출하는 바로 그 도구(benchmark-harness)를 그대로 사용. 문제 데이터셋·채점 로직·온도 설정 모두 공식값. |
| 가동률 (Uptime) | 서버 외부에서 5분 간격으로 상시 점검해 산출. |
| 오류율 계열 | OpenRouter 공식 정의 확인 완료(요청 단위 집계, 오류 3종: 깨진 JSON·없는 툴 이름·스키마 불일치). 실트래픽 기반 지표이므로 등록 후 집계. |
AutoExacto는 OpenRouter가 툴콜 요청의 라우팅 순위를 정하는 시스템으로, 각 프로바이더에 GPQA Diamond와 Tau2-Bench를 정기적으로 돌려 점수를 매기고 이를 모델 페이지에 공개한다. 그 벤치마크 도구가 오픈소스로 공개되어 있어 우리도 동일하게 사용했다.
1. 지표 커버리지 — 공개 지표 8개 측정 현황
| 지표 | 상태 | 당사 값 / 비고 |
|---|---|---|
| Throughput | 측정 완료 | 무부하 194 / 부하 104 / 포화 58 tok/s |
| Latency (TTFT) | 측정 완료 | 무부하 0.7 / 부하 1.1초 |
| E2E Latency | 측정 완료 | 약 2.2초 (출력 300토큰 기준) |
| AutoExacto 벤치 | 측정 완료 | GPQA 74.7% / Tau-Bench 70.0% |
| Uptime | 측정 완료 | 99% 이상 |
| Tool Call Error Rate | 해당 없음 | 공식 정의 파악 완료. 프록시 보완 시 자동 집계, 정본은 등록 후 실트래픽 |
| Structured Output Error Rate | 해당 없음 | 〃 |
| Cache Hit Rate | 해당 없음 | 본 모델은 prefix caching 미지원 |
공개 지표 중 등록 전에 측정 가능한 것은 모두 측정 완료(5개). 오류율 2종은 실제 트래픽이 필요해 등록 후 자동으로 집계되며, 캐시 적중률은 모델 특성상 해당 없음이다.
2. 경쟁사 대비 위치
Qwen3.5-35B-A3B를 서빙하는 프로바이더 8곳과 대조했다.
처리량 (tok/s) — 높을수록 좋음
| 순위 | 프로바이더 | tok/s |
|---|---|---|
| 1 | CoreWeave | 215 |
| – | gcube (무부하) | 194 |
| 2 | DeepInfra | 89 |
| 3 | Alibaba | 76 |
| – | gcube (부하 동시8) | 104 |
| 4~8 | Parasail 55 / SiliconFlow 44 / Venice 39 / AtlasCloud 31 / Darkbloom 21 | 21~55 |
경쟁사 값은 실트래픽 상태이므로 당사 부하값(104)과 비교하는 것이 공정하다. 그 기준으로도 상위권이다.
가동률 · 지연 — 경쟁권
| 지표 | 당사 | 경쟁사 범위 | 위치 |
|---|---|---|---|
| 가동률 (Uptime) | 99%+ | 97.4 ~ 100% | 경쟁권 |
| 지연 (TTFT) | 0.7 ~ 1.1초 | 0.25 ~ 3.59초 | 중위권 |
GPQA 품질 (%) — 높을수록 좋음
| 순위 | 프로바이더 | GPQA |
|---|---|---|
| 1 | CoreWeave | 82.8% |
| 2~4 | SiliconFlow 82.1 / DeepInfra 81.9 / Venice 81.8 | 81~82% |
| 5 | Darkbloom | 79.0% |
| 6 | gcube (당사) | 74.7% |
4bit 양자화(32GB 카드 1장에 올리기 위한 압축)이며, 저원가와의 트레이드오프다. 실무에는 충분한 수준이다.
Tau-Bench 툴콜 성공률 (%) — 높을수록 좋음
| 순위 | 프로바이더 | Tau-Bench |
|---|---|---|
| 1 | Darkbloom | 74.0% |
| 2 | CoreWeave | 73.3% |
| 3 | Venice | 71.4% |
| 4 | gcube (당사) | 70.0% |
공개된 경쟁사와 거의 동급이다.
종합
처리량은 상위권, 가동률·지연·툴콜은 경쟁권이며, 품질(GPQA)만 4bit 양자화로 다소 낮다(실무엔 충분). 4bit 압축으로 원가가 낮아 가격 경쟁력을 낼 여지가 있다.
3. 벤치마크 측정 방법 (GPQA · Tau-Bench)
품질(GPQA)과 툴콜(Tau-Bench) 벤치는 OpenRouter가 GitHub에 공개한 공식 벤치마크 도구(OpenRouterTeam/benchmark-harness)를 우리 서버에 직접 연결해 측정했다.
GPQA 74.7% — 세 측정 수렴, 확정
| 측정 방식 | 점수 | 문항 |
|---|---|---|
| OpenRouter 공식 harness | 74.7% | 198 |
| OpenRouter 공식 harness | 75.0% | 60 |
| llama-stack-evals (자체) | 74.7% | 198 |
공식·자체 도구, 60/198문항 세 측정이 모두 74.7~75.0%로 수렴해 확정적이다.
측정을 위해 조정한 사항
공식 도구는 OpenRouter 본사 경유를 전제로 설계돼 있어, 우리 서버 직결을 위해 일부 조정했다. 각 조정이 점수에 미치는 영향을 명시한다.
| 조정 | 내용 | 점수 영향 |
|---|---|---|
| 연결 주소·응답 형식 | 시험지 전송 경로와 응답 읽기 형식만 우리 서버에 맞춤 | 없음 |
| 미지원 부가기능 제거 | 우리 서버가 지원하지 않는 부가기능(추론 암호화 반환 등) 제거 | 없음 |
| 사고(thinking) 활성화 | 추론 문제는 사고를 켜야 정확. 끄면 65%로 부당하게 낮음 | 있음 (정확도 정상화). 명시함 |
| Tau-Bench 손님 모델 대체 | 손님 역할 AI를 외부 모델(Gemini) 대신 우리 모델로 대체 (등록 전이라 외부 모델 호출 불가) | 있음 (손님 모델 다름). Tau 값을 참고 측정으로 표기 |
GPQA는 연결·형식 조정만 있어 공식과 사실상 동일한 조건이다. Tau-Bench는 공식 코드·시나리오·채점은 동일하나 손님 모델이 다르므로 참고 측정으로 본다.
유의사항
본 측정은 등록 전 자체 검증이다. 정본 수치는 등록 후 OpenRouter가 자사 서버·공식 조건으로 재산출하므로, 측정을 위한 조정 사항이 최종 공개 점수에 영향을 주지 않는다. 오류율 계열은 실제 손님 트래픽이 있어야 의미 있는 값이 나온다.