주식회사 로넥트
English
Lawnect TokenBouncer

조직의 AI 사용을,
정책과 비용으로 통제합니다.

TokenBouncer는 사내에서 쓰는 AI의 사용량과 비용을 회사 정책으로 통제하는 시스템입니다. 기존 AI 서비스와 이용 방식은 그대로 두고, 구성원 관리 체계와 연동해 이용자·그룹별 한도와 세부 정책을 집행합니다. 보고용 통계와 요청 이력을 남기며 장애 시 동작과 fallback 순서까지 설정할 수 있습니다.

도입 문의

AI 사용량을 운영 가능한 정책으로 바꿉니다.

누가 어떤 모델을 얼마나 사용하는지 확인하는 데서 그치지 않고, 조직 구조와 예산에 맞는 한도를 실제 요청 경로에서 집행합니다.

단일 호환 제어 계층

기존 OpenAI 호환 클라이언트와 사내 AI 서비스의 연결 방식을 유지하면서 요청을 통합합니다.

조직 단위 정책 집행

전체·그룹·이용자와 모델 범위를 조합해 요청·토큰·예산 한도를 상속하거나 개별 조정합니다.

요청 단위 운영 기록

모델·이용자·비용·응답시간·차단·fallback과 오류 보정 이력을 개별 이벤트로 추적합니다.

예산과 모델 정책을 조직 구조에 맞게

고정된 단일 한도가 아니라 이용자와 그룹의 상속 관계, 모델별 정책과 실제 사용 분포를 함께 반영합니다.

요청·토큰·예산 한도

월별 요청 수, 토큰 수와 비용을 이용자별 또는 그룹 전체 합산 기준으로 제한합니다.

모델별 세부 정책

모델 이름과 패턴별로 전체·그룹·이용자 범위의 별도 한도와 우선순위를 설정합니다.

상속과 개별 조정

기본 그룹 정책을 상속하되 필요한 이용자만 한도를 덮어쓰거나 사용을 비활성화합니다.

사용 분포 기반 제안

기존 사용 분포와 예산을 기준으로 정책 후보를 검토한 뒤 운영자가 선택해 적용합니다.

우선순위와 범위를 조합해 실제 적용 정책을 결정합니다.

숫자가 낮은 정책부터 평가하고, 같은 우선순위에서는 정확한 모델명과 더 긴 패턴을 먼저 적용합니다. 전체 기본값 위에 그룹 정책과 이용자 예외를 겹쳐도 최종 적용 결과를 한눈에 확인할 수 있습니다.

  • 전체 기본 정책P100 · 모든 모델 · 인당 월 75,000원
  • 법무팀 그룹 정책P50 · claude-opus-* · 그룹 월 3,000,000원
  • 개별 이용자 예외P10 · 특정 이용자 · 월 300,000 토큰
TokenBouncer 이용자·그룹·모델별 정책 목록
TokenBouncer 모델 fallback 순서 설정

개별 이용자의 사용량부터 그룹 전체 예산까지 추적합니다.

Active Directory(Microsoft Entra ID), Keycloak 등 사내 계정 관리 시스템의 그룹과 실제 요청 이용자를 연결하고, 각 이용자에게 상속된 정책·개별 예외·그룹 공유 예산을 한 화면에서 확인합니다. 일반 이용자도 자신의 사용률과 초기화 시점을 별도 화면에서 확인할 수 있습니다.

이용자별 사용량

요청·토큰·예산의 확정 사용량과 처리 중인 예약분, 잔여 한도와 사용률을 함께 계산합니다.

그룹 공유 예산

개인 한도와 별개로 부서 전체가 공유하는 예산을 집행해 조직 단위 초과 사용을 막습니다.

셀프서비스 사용 현황

관리자 권한이 없는 이용자도 자신의 한도, 사용률과 다음 초기화 시점을 확인할 수 있습니다.

TokenBouncer 개별 이용자 정책과 사용량 상세 화면

측정에서 그치지 않고,
비용 최적화를 제안합니다.

제공자 가격표와 실제 입력·출력 토큰, 캐시 적중과 이용자별 사용 패턴을 하나의 비용 기준으로 묶습니다. 현재 비용을 파악하는 데서 끝내지 않고 절감 목표별 모델 조합을 비교하고, 선택한 안을 실제 한도와 fallback 정책으로 적용한 뒤 절감 효과까지 계속 검증합니다.

목표 절감률마다 모델 예산 조합과 예상 총비용, 영향을 받는 이용자 비율을 비교합니다. 선택한 안은 그 자리에서 이용자·그룹·모델별 정책으로 만듭니다.

TokenBouncer 비용 절감 목표별 모델 예산 정책 제안
실제 비용 기준선 계산

제공자·모델별 가격표에 실제 입력·출력 토큰과 캐시 사용량을 결합합니다. 호출 횟수만으로는 보이지 않던 모델별 확정 비용과 캐시 절감액을 같은 기준으로 계산합니다.

절감 목표별 시나리오 비교

10%부터 90%까지 목표 절감률마다 고성능·중간·경량 모델의 예산 조합을 계산합니다. 예상 총비용과 인당 비용, 영향을 받는 이용자 비율을 함께 비교합니다.

분석 결과를 운영 정책으로 전환

선택한 시나리오를 이용자·그룹·모델별 예산과 fallback 순서로 바로 생성합니다. 중요한 업무에는 고성능 모델을 남기고 반복 업무부터 효율적인 모델로 전환할 수 있습니다.

적용 이후 절감 효과 검증

정책 적용 전후의 비용, 모델 사용 분포와 캐시 절감액을 계속 비교합니다. 절감이 품질 저하나 차단 증가로 이어지지 않는지도 응답시간·상태 이벤트와 함께 확인합니다. 주기 중에는 현재 추세와 지난 주기 평균으로 주기 말 예상 비용을 확인합니다.

업무 단위 원가 배분

요청에 업무·프로젝트 태그를 붙이면 같은 이용자의 사용량도 태그별로 나누어 집계합니다. 태그는 미리 등록할 필요 없이 실제로 쓰인 값을 그대로 모아, 업무·프로젝트별 비용을 바로 확인합니다.

프롬프트 캐시 자동 적용

Anthropic 모델 요청에 캐시 지시자를 자동으로 추가해 반복되는 프롬프트 앞부분을 재사용합니다. 관리자는 자동 적용을 켜거나 끄고, 대시보드에서 캐시 적중률과 절감액을 확인합니다.

비용부터 장애 원인까지,
한 흐름에서 봅니다.

대시보드의 집계 수치와 요청별 이벤트가 연결되어, 비용 변화와 이용자 문의를 같은 데이터로 확인할 수 있습니다.

요청·토큰·비용·캐시 절감액

모델 가격표와 실제 입력·출력 토큰을 결합해 확정 비용을 계산합니다. 캐시 적중으로 사용하지 않은 토큰과 절감액은 별도로 집계해 최적화 효과를 확인합니다.

제공자·모델·이용자·그룹별 분석

전체 비용만 보는 대신 어느 부서와 이용자가 어떤 모델을 주로 쓰는지 비교합니다. 사용 집중도와 예산 소진 속도를 함께 확인해 정책 조정 대상을 찾습니다.

응답시간·상태·차단과 fallback 추적

요청마다 응답시간과 상태, 차단 사유를 남깁니다. fallback이 실행되면 원래 모델과 실제 처리 모델, 적용 규칙·사유·시도 순서를 함께 기록합니다.

이벤트 CSV와 관리자 변경 감사 로그

이용자에게 event ID를 안내해 문의 한 건을 정확한 요청 기록으로 찾습니다. 이벤트는 CSV로 내보내고 정책·키·설정 변경은 관리자 감사 로그로 분리해 보관합니다.

한도를 넘는 순간과 모델 장애까지 대응합니다.

요청을 단순 차단하는 데서 끝내지 않고, 허용된 범위 안에서 대체 모델로 전환하거나 재시도 정책을 적용하고 결과를 기록합니다.

모델 fallback

원본 모델의 한도가 소진되면 같은 제공자 안에서 승인된 대체 모델을 순서대로 다시 평가합니다.

재시도와 오류 보정

업스트림 5xx·전송 오류가 나면 요청을 다시 보내고, 알려진 요청 형식 오류는 안전한 범위에서 보정해 한 번 더 처리합니다.

접근 키와 이용자 식별

Virtual Key와 신뢰 헤더, Active Directory(Microsoft Entra ID)·Keycloak 등 사내 계정 동기화를 조합해 요청 자격과 실제 이용자를 연결합니다.

MCP 연결과 감사

AI 에이전트가 접근할 MCP 서버와 토큰을 관리하고 연결·사용 기록을 감사할 수 있습니다.

한도를 임시로 올리는 대신, 기록이 남는 우회 토큰을 발급합니다.

마감 직전의 처리, 장애 대응, 시연처럼 지금은 통과시켜야 하는 요청이 있습니다. 한도를 올렸다 내리는 것으로 대응하면 되돌리는 것을 잊고, 무엇을 왜 올렸는지도 남지 않습니다. 정책 우회 토큰이 실린 요청은 한도 판정만 건너뜁니다. 사용량은 평소대로 집계되고 비용·이벤트 기록도 남습니다.

만료·대상·대역·횟수 제한

토큰마다 만료 시각, 허용 이용자·그룹, 접속 대역(CIDR), 사용 횟수 상한을 지정합니다. 토큰 사용 중지와 폐기는 즉시 모든 서버에 반영됩니다.

클라이언트 수정 없이 사용

헤더, 요청 본문 필드, 대화 메시지 속 매직 워드 세 가지 경로로 토큰을 싣습니다. 어느 경로든 업스트림으로 나가기 전에 토큰을 제거해 외부 로그에 남기지 않습니다.

용량 한도만 우회

우회 대상은 용량 한도뿐입니다. 토큰으로 비활성 계정을 되살리거나 Virtual Key의 유효성 검사·모델 허용 목록을 넘을 수는 없습니다.

우회 요청의 감사 기록

우회된 요청의 이벤트에는 우회 배지·토큰 정보·적용에서 제외된 한도 내역이 남습니다. 실패한 우회도 사유와 함께 기록하며, 토큰을 폐기해도 지난 기록은 사라지지 않습니다.

만료 시각, 허용 대상, 접속 대역, 사용 횟수를 정해 토큰을 발급합니다. 토큰별 우회 사용액과 한도 포함 여부, 마지막 사용 시각을 한 화면에서 관리합니다.

TokenBouncer 정책 우회 토큰 발급·관리 화면

운영 환경에 맞게 세부 동작까지 조정합니다.

정책뿐 아니라 요청 처리, 장애 대응, 가격 데이터와 감사 범위까지 관리자 화면에서 설정합니다. 외부 연결이 제한된 환경에서는 가격표 원격 동기화를 끄고 내장 스냅샷만 사용할 수 있습니다.

재시도·오류 보정

업스트림 재시도 횟수와 간격을 정하고, 알려진 요청 형식 오류를 안전한 범위에서 자동 보정합니다.

상황별 커스텀 오류 메시지

한도 초과·정책 차단·인증 실패·업스트림 장애 등 상황별 안내 문구를 조직의 용어와 지원 절차에 맞게 바꿉니다. 이용자에게는 문의 가능한 event ID를 보여주고, 관리자는 같은 ID로 원본 오류와 재시도·fallback 이력을 확인합니다.

가격표·폐쇄망 운영

내장 모델 가격표를 사용하거나 정기 원격 갱신을 켭니다. 폐쇄망에서는 외부 동기화 없이 동일한 비용 계산을 유지합니다.

감사·내보내기

요청 이벤트를 CSV로 내보내고 관리자 설정 변경, 키와 MCP 연결 이력을 감사 로그로 남깁니다.

기존 업무공간과 인증 체계를 그대로 연결합니다.

OpenAI 호환 API를 유지하면서 사내 AI 애플리케이션과 OpenWebUI 같은 업무공간을 연결합니다. Active Directory(Microsoft Entra ID), Keycloak 등 사내 계정 관리 시스템의 OIDC·그룹 동기화와 신뢰 헤더를 조합해 현재 계정 체계를 AI 정책의 기준으로 삼습니다. 프록시·관리자 화면·데이터베이스는 귀사 인프라에 배치해 기존 운영 구조를 유지합니다.

기존 AI 애플리케이션 호환

커스텀 이용자 헤더를 인식해 로그인 이용자를 식별하고 정책과 이벤트에 연결합니다. 헤더 이름은 환경에 맞게 지정하며 OpenWebUI의 X-OpenWebUI-User-Email처럼 이미 보내고 있는 값을 그대로 쓸 수 있습니다.

사내 계정 관리 시스템

Active Directory(Microsoft Entra ID), Keycloak 등과 OIDC·서비스 계정 동기화로 이용자와 그룹, 소속 관계를 가져오고 관리자 권한도 조직 그룹으로 통제합니다.

용도별 Virtual Key

업무공간·배치 작업·서비스별 키를 분리하고 허용 모델, 예산, 만료와 마지막 사용 시점을 관리합니다.

필요한 API만 공개

chat completions, responses, embeddings, image, audio 등 OpenAI 호환 경로를 환경별로 선택해 활성화합니다.

민감한 본문은 남기지 않고, 필요한 기록은 지우지 않습니다.

요청 본문 저장은 기본으로 꺼져 있습니다. 정산과 한도 판정에는 프롬프트 내용이 필요하지 않기 때문입니다. 사용 이벤트·감사 로그·재산정 전 원본은 자동으로 삭제하지 않고 보존해 청구와 감사에 필요한 기록을 유지합니다.

본문을 남기지 않는 기본값

한도 판정과 비용 계산에는 사용량 수치만 사용합니다. 관리자는 검증이 필요한 환경에서만 본문 저장을 명시적으로 켭니다.

수평 확장과 back-pressure

replica 수를 늘려 처리량을 확장하고, 커넥션 풀·유입 상한·저장 큐의 back-pressure로 폭주 상황에서도 사용 기록의 유실을 막습니다.

재산정 전 원본 백업

저장된 비용을 새 가격표로 다시 계산하기 전에 기존 값을 append-only 백업으로 남깁니다. 백업이 실패하면 재산정은 시작하지 않습니다.

재시작 없는 운영 변경

정책·한도·식별 설정 변경은 재시작 없이 모든 서버에 전파됩니다. 스키마 마이그레이션도 부팅할 때 자동으로 수행하므로 별도 유지보수 시간이 필요하지 않습니다.

통제는 더하고,
속도는 그대로입니다.

모든 요청을 검사해도 더해지는 지연은 0.2ms 안팎으로, 이용자는 차이를 느낄 수 없습니다.

+0.16ms

요청당 추가 지연 (중앙값)

직접 호출 대비 프록시 경유의 왕복 차이입니다. 예산 한도가 걸린 이용자도 기본 통과 우선 판정에서는 같은 지연을 보입니다.

20,000+ RPS

단일 프로세스 지속 처리량

동시 50 연결로 20초 동안 약 40만 건을 오류 없이 처리했습니다. 이때 p99 지연은 4ms였습니다.

유실 0건

폭주 중 사용 기록

유입 상한을 넘는 폭주에서는 초과 요청만 429로 거절합니다. 처리된 요청의 사용 이벤트는 한 건도 버려지지 않았습니다.

Apple Silicon 로컬 환경에서 OpenAI 호환 로컬 업스트림을 두고 측정된 값입니다. 절대값은 환경과 사양에 따라 달라질 수 있습니다.

대형 로펌이 이미 TokenBouncer를 전사 규모로 사용합니다.

법무법인(유한) 화우는 TokenBouncer를 전사 규모로 도입해 구성원 전체의 AI 사용량을 통제하고 비용을 절감하고 있습니다. 로넥트는 파트너와 함께 법률 업무에 맞는 AI 운영 방식을 만들어 갑니다.

AI 사용량과 비용을, 운영 가능한 정책으로 만들겠습니다.

현재 사용 중인 AI 서비스, 모델 제공자와 조직 구조를 알려주시면 연결 방식과 정책 범위, 구축·운영 방안을 제안합니다.