모델 파인튜닝, 추론 서버, 워크플로 자동화 — gcube 위에서 직접 돌려보고 남긴 GPU 클라우드 실습 기록입니다. 벤치마크와 코드는 전부 재현 가능합니다.
2026년 8월 기준 AI 에이전트 플랫폼 20개를 오케스트레이션·멀티에이전트·코딩·브라우저·노코드·런타임 인프라 6개 계층으로 정리한 가이드
LLM 오픈소스 30선을 gcube GPU 클라우드 관점으로 재구성. 모델·서빙·파인튜닝은 깊게, RAG·문서파싱·에이전트는 표로 간단히 정리했습니다.
FP8 온라인 양자화가 항상 빠른 건 아니다 — RTX 5090에서 BF16과 정면 비교하고 두 번의 독립 실행으로 재현성까지 검증했다.
파인튜닝한 LoRA 어댑터 여러 개를 병합 없이 vLLM으로 한 GPU에서 동시 서빙하는 방법을 gcube RTX5090에서 직접 검증했습니다.
4비트 양자화한 Z-Image-Turbo를 gcube 워크로드로 배포하고, conditions.json 기반 자동 대량 생성과 웹 모니터링까지 운영하는 방법을 정리했습니다. 8GB GPU에서도 돌아갑니다.
RTX 5090 한 장에서 Qwen3-8B를 세 엔진으로 서빙하며 동시성 8/32/64 구간별 처리량과 TTFT를 직접 측정했습니다. vLLM, LMDeploy, Ollama, 언제 뭘 써야 할지 데이터로 정리합니다.
gcube RTX5090 레플리카 2대로 Axolotl + DeepSpeed 멀티노드 분산 파인튜닝을 실제로 검증했습니다. NCCL hang 진단부터 launcher·config 이슈 해결, 519 step 완주와 Before/After 비교까지 담은 트러블슈팅 로그입니다.
gcube 공식 문서를 BGE-M3로 임베딩하고 Chroma에 인덱싱해, vLLM으로 서빙한 Qwen2.5-7B와 연결했습니다. RTX 5090 한 장, 외부 API 없이 전 과정을 노트북에서 재현합니다.
gcube 서버에 n8n을 올려 PDF 요약, AI 뉴스 브리핑, 회의록 자동화 등 직장인의 반복 업무를 자동화하는 워크플로우 3가지를 단계별로 구성합니다.
gcube RTX 5090에서 Tri-7B sLLM을 자체 호스팅하고 vLLM + n8n으로 회의록 → 액션아이템 자동화 파이프라인을 구축합니다. Jupyter 노트북 기반 실습, 파인튜닝까지 포함.
외부 AI API 소비를 넘어 Private AI Runtime 운영으로. 5대 병목과 7-Layer 스택으로 기업 AI 실행권을 되찾는 방법.
gcube의 RTX 5090 환경에서 Unsloth로 Llama 3.1 8B를 한국어 데이터셋으로 파인튜닝한 실습 기록.