> For the complete documentation index, see [llms.txt](https://genos-docs.gitbook.io/default/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://genos-docs.gitbook.io/default/v1.9.2/dashboard/overview/service.md).

# 서비스

대시보드의 서비스 메뉴는 통계 및 활성된 주요 서비스를 실시간으로 모니터링하여 서비스의 안정성과 가용성을 점검할 수 있는 화면입니다.

<figure><img src="/files/3Y2DfgnOvXdrafJZpHQa" alt=""><figcaption></figcaption></figure>

### 통계

* **LLM 서빙 (대표 리비전):** LLM 대표 리비전 수 및 사용 수 정보.
* **임베딩 서빙 (대표 리비전):** 임베딩 대표 리비전 수 및 사용 수 정보.
* **워크플로우 (배포됨):** 전체 워크플로우 수 및 배포 수 정보.
* **LLM 서빙 리비전 (배포됨):** LLM 리비전 수 및 사용수 정보.
* **임베딩 서빙 리비전 (배포됨):** 임베딩 리비전 수 및 사용수 정보.

### 활성 채팅

* 목록
  * **ID:** 채팅 ID
  * **제목:** 채팅 제목
  * **사용자 수:** 채팅을 사용한 사용자 수
  * **요청 수:** 채팅 요청 수
  * **긍정 피드백:** 일일, 좋아요 체크 정보
  * **부정 피드백:** 일일, 싫어요 체크 정보
  * **제작자:** 채팅을 생성한 제작자 정보
* **파일 다운로드:** 기간을 선택하여 파일 다운로드가 가능합니다.

<figure><img src="/files/3Y2DfgnOvXdrafJZpHQa" alt=""><figcaption></figcaption></figure>

### 활성 워크플로우

* 목록
  * **ID:** 워크플로우 ID
  * **제목:** 워크플로우 제목
  * **배포일시:** 워크플로우 배포 날짜 및 시간
  * **요청 수:** 워크플로우 요청 수
  * **제작자:** 워크플로우 생성한 제작자 정보
* **파일 다운로드:** 기간을 선택하여 파일 다운로드가 가능합니다.

<figure><img src="/files/r5zjAJiCVAnq3PEZwdyV" alt=""><figcaption></figcaption></figure>

### 활성 서빙

* 목록
  * **ID:** 서빙ID
  * **유형:** 서빙의 유형
  * **제목:** 서빙 제목
  * **배포일시:** 서빙배포 날짜 및 시간
  * **요청 수:** 서빙 요청 수
  * **제작자:** 서빙 생성한 제작자 정보
* **파일 다운로드:** 기간을 선택하여 파일 다운로드가 가능합니다.

<figure><img src="/files/ObBVZvwqW12i96X0A7Gx" alt=""><figcaption></figcaption></figure>

### 서빙 부하 현황 (Capacity & Efficiency)

서빙 부하 현황 탭은 GPU를 점유하는 내부 서빙별로 admission 한도(max\_concurrency) 대비 지속 동시 부하와 포화 상태를 보여주어, 각 서빙의 여유를 여유, 주의, 부족으로 판정하는 화면입니다. 서빙 증설이나 축소를 판단하는 근거로 사용합니다. 화면 상단의 부하 현황과 설정 토글로 두 화면을 전환합니다.

#### 부하 현황

GPU를 점유하는 내부 서빙을 모델별 카드로 보여줍니다. 외부 API로 배포된 서빙은 표시하지 않습니다. 각 카드는 다음을 표시합니다.

* **모델명과 서빙 유형:** 대상 서빙의 이름과 유형(LLM, VLM, 임베딩 등).
* **판정 배지:** 여유, 주의, 부족. headroom(여유율)이 여유 기준 이상이면 여유, 주의 기준 이상이면 주의, 미만이면 부족입니다. headroom이 높더라도 포화 신호(KV cache, Queue, Preemption, SLO)가 있으면 주의나 부족으로 표시됩니다.
* **사용량 수식과 사용률 바:** 지속 동시 부하(p95)를 admission 한도로 나눈 사용률과 headroom을 수식과 막대로 표시합니다.
* **추이 차트:** 선택한 기간의 동시 부하 추이와 용량 천장 기준선을 함께 표시합니다.
* **성능 메트릭:** vLLM 기반 서빙은 KV cache 활용률(p95), 토큰 처리량, TTFT(p95), ITL(p95), preemption 횟수를 표시합니다.
* **근거:** 노드, 레플리카 수, GPU 수, 리비전, 요청수와 기준값(max\_concurrency).

조회 기간은 24h, 3d, 7d, 30d 프리셋에서 선택하거나, 1시간에서 30일 범위로 직접 입력해 적용합니다. 범위를 벗어나면 안내가 표시되고 기존 기간이 유지됩니다.

표시할 내부 GPU 서빙이 없으면 "표시할 내부 GPU 서빙이 없습니다." 안내와 함께 빈 상태로 표시됩니다.

<figure><img src="/files/Tb4YXHcA4iIqzzQ0wlwP" alt=""><figcaption></figcaption></figure>

#### 설정

판정 임계값을 조정합니다. 값을 바꾸고 저장하면 카드 판정에 반영되고, 새로고침 후에도 유지됩니다(현재 사용하는 브라우저에 저장). 기본값 복원으로 되돌릴 수 있습니다.

* **여유 기준(0\~1):** headroom이 이 값 이상이면 여유로 판정합니다. 기본값은 0.3입니다.
* **주의 기준(0\~1):** headroom이 이 값 이상이면 주의로 판정합니다. 기본값은 0.1입니다. 여유 기준은 주의 기준보다 커야 합니다.
* **KV cache 한계(0\~1):** KV cache 활용률이 이 값을 넘으면 포화 신호로 봅니다. 기본값은 0.9입니다.

0에서 1 범위를 벗어난 값은 안내와 함께 저장이 차단됩니다. 부하테스트 기능은 후속 단계에서 연동될 예정으로 현재 화면에는 노출되지 않습니다.

<figure><img src="/files/kWlIoqLgnLz4x8puQwyi" alt=""><figcaption></figcaption></figure>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://genos-docs.gitbook.io/default/v1.9.2/dashboard/overview/service.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
