외부 LLM으로 첫 봇 준비하기
외부 LLM API를 사용하는 구성이라면 GPU 없이 시작할 수 있습니다. 먼저 지원되는 CPU 환경과 메모리, 저장공간을 확인하고, 현재 설치 안내서에 따라 Podman과 제품 라이선스를 설정합니다. 이후 BYOK 토큰을 등록하고 연결을 시험합니다. 설치 시간은 이미지 다운로드와 환경 설정, 네트워크 상태에 따라 달라집니다.
AI를 한번 도입해 보고 싶은데 처음부터 무거운 인프라가 부담스러운 1인 사업자, 스타트업 초기 멤버, 사이드 프로젝트 개발자를 위한 글입니다.
1단계. 작은 환경 준비하기
설치 안내서의 운영체제, 메모리, 저장공간 요구사항을 만족하는 노트북이나 CPU 서버를 선택합니다. 혼자 시험할 환경인지, 여러 동료가 공유할 환경인지에 따라 필요한 자원이 달라집니다. 인원수만으로 사양을 정하기보다 동시 실행할 에이전트와 실제 업무 부하를 기준으로 확인합니다.
외부 LLM API를 연결하는 구성에서는 추론을 제공자가 처리하므로 로컬 GPU 없이 시작할 수 있습니다. 다만 함께 사용할 도구와 로컬 모델이 있다면 각각의 자원 요구사항을 확인해야 합니다.
2단계. Podman과 제품 라이선스 설정하기
현재 설치 도구는 Podman을 준비하고 제품 컨테이너를 실행합니다. 소스 보호 대상 제품은 OCIcrypt로 암호화한 OCI 이미지를 사용하므로, 안내된 라이선스와 이미지 복호화 설정이 필요합니다. 이미지 암호화는 제품 이미지 보호이며, 업무 데이터의 저장 암호화나 접근 권한 설정을 대신하지 않습니다.
설치 후에는 컨테이너 상태와 안내된 접속 주소를 확인하고, 첫 실행에서 관리자 계정을 만듭니다. 도메인과 인증서, 네트워크 접근, 저장공간 설정은 설치 환경에 맞춰 확인합니다. 화면이 열린 뒤에도 외부 LLM 연결과 첫 응답을 시험해야 합니다.
3단계. BYOK 토큰 등록과 사용 한도
본인 OpenAI나 Anthropic 계정에서 토큰을 발급해 콘솔에 등록합니다. 제공자의 사용량과 한도 설정을 함께 확인하면 API 비용을 관리하는 데 도움이 됩니다. BYOK만으로 전체 운영비가 고정되는 것은 아닙니다.
OpenAI는 Platform 콘솔의 API keys 메뉴에서, Anthropic은 Console의 API Keys 메뉴에서 새 키를 만듭니다. 발급 직후 한 번만 노출되니 그 자리에서 안전한 곳에 복사해 둡니다. AICLUDE 콘솔 에이전트 상세 화면 Access 탭에 등록하면 평문이 디스크에 남지 않게 안전 보관함에 봉인합니다.
토큰을 만들 때 발급처에서 사용 한도를 같이 거는 게 중요합니다. OpenAI에는 monthly hard limit, Anthropic에는 monthly spending cap이 있습니다. 발급처에서 한도를 걸어 두면 그 선에 닿는 순간 호출이 자동으로 거부됩니다. 모르고 켜 둔 채 과금이 불어나는 상황을 처음부터 차단합니다.
4단계. 첫 봇 띄우고 확인하기
관리자 계정으로 들어가 첫 에이전트의 페르소나를 만듭니다. 콘솔에서 이름과 말투, 역할을 잡고 BYOK로 연결한 모델을 지정하면 끝납니다. 채팅 화면에서 직접 말을 걸어 응답이 돌아오는지 확인합니다.
지식 검색도 CPU 환경으로 구성할 수 있습니다. 임베딩을 로컬에서 실행할 경우에는 모델과 문서량에 따른 메모리 사용량과 처리 시간을 확인합니다. 에이전트 상세 화면의 Learning 탭에서 PDF, 텍스트, 마크다운 파일을 올리고 색인 완료를 확인한 뒤 검색을 시험합니다. 동료 한 명을 초대해 첫 대화를 시켜 보고, 사내 문서 하나를 올려 검색 정확도를 직접 확인하면 감이 옵니다.
5단계. 무엇이 필요하고 무엇은 안 해도 되나
출발선에서 챙길 것과 미뤄도 되는 것을 정리합니다.
필요한 것
- 설치 요구사항을 만족하는 CPU 환경과 메모리, 저장공간
- 현재 설치 도구가 준비하는 Podman 실행 환경
- 제품 라이선스와 보호 대상 이미지의 복호화 설정
- 외부 LLM API 토큰과 제공자별 사용 한도 설정
- 외부 API에 접속할 수 있는 네트워크
안 해도 되는 것
- 외부 LLM을 사용하는 구성에서의 로컬 추론용 GPU 임대
- 외부 LLM을 사용하는 구성에서의 로컬 LLM 가중치 다운로드와 워밍업
- 실제 부하를 확인하기 전의 전용 서버 선구매
음성이나 영상 기능이 있다는 이유만으로 로컬 GPU가 반드시 필요한 것은 아닙니다. STTS와 이미지·영상 생성은 외부 API를 이용하는 구성도 가능합니다. 로컬 LLM, 음성·미디어 모델, 임베딩 모델을 직접 운영한다면 모델별 CPU·메모리·GPU 요구사항과 처리량을 확인합니다. 폐쇄망에서는 필요한 모델과 의존 구성요소를 내부에 준비한 뒤 연결 없이 동작하는지 검증해야 합니다.
다음 단계
처음부터 GPU나 전용 서버를 사들이지 마세요. 가벼운 환경에서 몇 달 돌려 보고, 사용자가 실제로 에이전트를 부르는지 확인한 다음에 키워도 늦지 않습니다. 사용량 그래프를 한 주에 한 번 들여다보면서 한도 안에서 운영하면, 다음 결정을 여유 있게 내릴 수 있습니다.
블로그 목록으로