- FreeToken 로컬 API 워크플로는 공식 데스크톱 앱 또는 CLI 설치로 시작합니다.
- 지원 경로: 현재 릴리스에서 공식적으로 문서화된 데스크톱 환경은 Windows와 Linux입니다.
- 핵심 목적: GPU, CPU, 호스트 메모리에 걸쳐 대규모 Mixture-of-Experts 모델을 실행합니다.
- 권장 사항: 클라이언트 통합을 작성하기 전에 공식 API 또는 서빙 명령을 확인하세요.
- 주요 제한 사항: macOS, 구형 NVIDIA 카드 및 일부 요청된 백엔드는 향후 지원이 필요할 수 있습니다.
FreeToken 로컬 API 개요
FreeToken 로컬 API는 호스팅된 모델 엔드포인트에 의존하는 대신 FreeToken을 로컬 추론 서비스로 사용하는 것을 의미합니다. FreeToken은 소비자용 하드웨어에서 프런티어급 오픈 웨이트 모델을 실행하도록 설계된 엣지 네이티브 Mixture-of-Experts 서빙 엔진입니다. 문서화된 아키텍처는 GPU 메모리, CPU 리소스, 호스트 메모리 및 사용 가능한 인터커넥트를 하나의 추론 플랫폼으로 결합합니다.
실질적인 장점은 유연성입니다. MoE 모델은 수천억 개의 파라미터를 포함하면서도 각 토큰마다 더 적은 수의 전문가만 활성화할 수 있습니다. FreeToken은 모든 모델 가중치가 항상 GPU 메모리에 남아 있어야 한다고 가정하는 대신, 이러한 전문가를 효율적으로 이동하고 캐시하는 데 중점을 둡니다.
영상 주요 내용:
- FreeToken은 개인 하드웨어에서 대규모 MoE 모델을 로컬로 서빙하는 것을 목표로 합니다.
- 엔진은 라우팅을 인식하는 전문가 캐싱과 CPU–GPU 협업을 강조합니다.
- 보고된 벤치마크는 독립적으로 재현될 때까지 프로젝트 자체 벤치마크로 간주해야 합니다.
- 하드웨어 호환성은 기존의 멀티 백엔드 런타임보다 여전히 제한적입니다.
공식 FreeToken GitHub 저장소는 이 프로젝트를 Apache License 2.0 소프트웨어로 명시합니다. 또한 Windows와 Linux용 데스크톱 애플리케이션 및 uv 또는 pip를 통한 CLI 설치 방법을 제공합니다. 따라서 이 프로젝트는 로컬 실험, 연구 및 에이전트 워크플로에 적합하지만, 사용자는 추론 엔진과 보장된 HTTP API를 구분해야 합니다.
| 영역 | FreeToken이 제공하는 것 | 실질적인 의미 |
|---|---|---|
| 모델 아키텍처 | Mixture-of-Experts 서빙 | 대규모 모델이 사용 가능한 리소스에 작업을 분산할 수 있음 |
| 메모리 전략 | 전역 LRU 전문가 캐싱 | 자주 사용되는 전문가를 이후 토큰을 위해 유지할 수 있음 |
| 실행 | CPU–GPU 공동 실행 | 대역폭과 하드웨어 균형에 맞춰 작업을 조정할 수 있음 |
| 상태 처리 | 시맨틱 앵커 체크포인트 | 에이전트 편집 중 반복적인 컨텍스트 작업을 줄일 수 있음 |
| 라이선스 | Apache License 2.0 | 라이선스 조건에 따라 검토, 수정 및 연구에 적합 |
“로컬 API”를 특정 엔드포인트의 증명이 아니라 통합 목표로 간주하세요. 현재 릴리스에서 지원되는 인터페이스를 확인하려면 프로젝트의 최신 설치 및 서빙 문서를 사용하세요.
데스크톱 앱
모델 선택, 채팅 및 엔진 튜닝을 하나의 인터페이스에서 처리하려는 Windows와 Linux 사용자를 위한 그래픽 설정 경로입니다.
CLI 워크플로
문서화된 Python 패키지 설치 또는 소스 체크아웃을 사용하는 터미널 기반 경로입니다.
MoE 런타임
핵심 엔진이 GPU, CPU, 호스트 메모리 및 인터커넥트 리소스 전반에서 전문가 배치를 조정합니다.
연구 계층
FTW 가중치, 시맨틱 캐싱 및 그래프 호환 실행을 통해 고급 로컬 추론 사용 사례를 지원합니다.
설치 및 첫 실행
가장 깔끔한 설정 방법은 그래픽 워크플로를 원하는지, 반복 가능한 개발 환경을 원하는지에 따라 달라집니다. 저장소는 데스크톱 앱 경로와 CLI 경로를 모두 문서화합니다. 현재 프로젝트 정보에서 macOS 지원 빌드는 지원 환경으로 명시되어 있지 않으며, 현재 초점은 Windows와 Linux입니다.
설치하기 전에 운영 체제, NVIDIA 또는 기타 지원되는 가속기 구성, 시스템 메모리 및 모델 형식을 확인하세요. 다른 런타임에서 지원되는 모델이 FreeToken에서도 수정 없이 작동할 것이라고 가정하지 마세요.
설치 경로 선택
안내에 따른 Windows 또는 Linux 설정을 원한다면 공식 데스크톱 다운로드를 사용하세요. 스크립트, 가상 환경, 소스 변경 또는 반복 가능한 개발 명령이 필요할 때는 CLI를 선택하세요.
런타임 설치
문서화된 패키지 경로를 사용하려면 Python 환경을 생성하거나 기존 환경을 사용한 뒤 uv pip install "freetoken[accel]"로 가속기 추가 기능을 설치하세요. 명령은 현재 저장소의 지침에 맞게 유지해야 합니다.
모델 준비
FreeToken이 지원하는 서빙 경로에 맞는 오픈 웨이트 모델을 선택하세요. 대규모 MoE 모델은 각 토큰에서 일부 전문가만 활성화되더라도 상당한 호스트 메모리를 필요로 할 수 있습니다.
로컬 세션 시작
데스크톱 애플리케이션 또는 프로젝트에 문서화된 CLI 명령을 시작하세요. 외부 클라이언트를 구축하기 전에 모델이 로드되고, 가속기가 감지되며, 짧은 프롬프트에서 출력이 생성되는지 확인하세요.
작동 구성 기록
모델 이름, 양자화 또는 가중치 형식, 메모리 설정, 운영 체제 및 런타임 버전을 저장하세요. 이러한 세부 정보는 이후 성능 비교를 더 쉽게 재현할 수 있도록 해줍니다.
저장소는 소스 설치 경로도 제공합니다.
git clone <repository-url>
cd FreeToken
uv venv
source .venv/bin/activate
uv pip install -e ".[accel]"
이 워크플로를 적용할 때는 공식 문서에서 안내하는 정확한 저장소 URL과 플랫폼별 활성화 명령을 사용하세요. 제공된 소스 내용만으로는 범용 HTTP 서버 명령이 확립되어 있지 않으므로, 검증되지 않은 엔드포인트를 프로덕션 스크립트에 삽입하지 마세요.
| 설정 방식 | 적합한 대상 | 주요 요구 사항 | 주의할 점 |
|---|---|---|---|
| 데스크톱 앱 | 처음 사용하는 사용자 | Windows 또는 Linux 시스템 | 개발 세부 사항에 대한 제어가 적음 |
uv 패키지 설치 | 반복 가능한 CLI 사용 | Python 환경 및 가속기 지원 | 패키지 버전을 문서화해야 함 |
| 수정 가능한 소스 설치 | 개발자 및 연구자 | Git, Python 도구 및 빌드 종속성 | 소스 변경이 안정성에 영향을 줄 수 있음 |
| 외부 클라이언트 통합 | 에이전트 및 애플리케이션 | 문서화된 로컬 서빙 인터페이스 | 릴리스에 따라 엔드포인트 세부 사항이 변경될 수 있음 |
현재 프로젝트 정보에는 Windows와 Linux 데스크톱 지원 및 NVIDIA CUDA 중심 환경이 명시되어 있습니다. 최신 공식 문서를 확인하지 않은 상태에서 macOS, 구형 NVIDIA 세대, Apple Silicon 또는 듀얼 GPU Docker 구성이 지원된다고 가정하지 마세요.
안정적인 로컬 워크플로 구축
FreeToken이 성공적으로 실행되면 로컬 API 워크플로를 단계적으로 구축하세요. 먼저 직접 생성을 검증하고, 다음으로 반복 가능한 모델 로딩을 확인하세요. 그 후에야 에이전트, 편집기 또는 사용자 지정 클라이언트를 연결해야 합니다. 이러한 순서는 모델 문제와 통합 문제를 분리해 줍니다.
로컬 서비스는 코딩 에이전트에 유용할 수 있습니다. 요청이 사용자의 하드웨어에 남아 호스팅 제공업체의 속도 제한이나 모델 서비스 종료 일정의 영향을 받지 않기 때문입니다. 그렇더라도 메모리, 지연 시간, 컨텍스트 크기 및 프로세스 안정성을 모니터링해야 합니다.
다음 워크플로를 사용하세요.
- 짧은 프롬프트와 적당한 컨텍스트로 시작합니다.
- 선택한 모델이 여러 요청에 걸쳐 일관되게 응답하는지 확인합니다.
- 처음부터 가장 큰 프롬프트로 테스트하지 말고 컨텍스트 길이를 점진적으로 늘립니다.
- GPU 메모리, 호스트 메모리 및 시스템 응답성을 관찰합니다.
- 단일 턴 추론이 안정된 후에만 도구 호출이나 에이전트 루프를 추가합니다.
- 더 작은 모델 또는 축소된 컨텍스트를 위한 대체 구성을 유지합니다.
| 워크플로 단계 | 검증 대상 | 권장 조치 |
|---|---|---|
| 직접 생성 | 모델이 일관된 출력을 반환하는지 여부 | 먼저 짧은 프롬프트를 테스트 |
| 반복 요청 | 프로세스가 계속 응답하는지 여부 | 설정을 변경하지 않고 여러 턴 실행 |
| 컨텍스트 증가 | 메모리 사용량이 허용 가능한 수준으로 증가하는지 여부 | 측정된 단계로 프롬프트 길이 증가 |
| 에이전트 연결 | 클라이언트가 유효한 응답을 수신하는지 여부 | 설치된 릴리스에 문서화된 인터페이스 사용 |
| 장시간 세션 | 캐시와 상태가 안정적으로 유지되는지 여부 | 후반부 지연 시간, 메모리 압박 및 프로세스 종료 모니터링 |
FreeToken의 시맨틱 인식 캐싱은 도구 호출과 사고 블록을 포함한 에이전트 컨텍스트 편집을 위해 설계되었습니다. 세션이 구조적인 방식으로 변경될 때 불필요한 컨텍스트 재계산을 피하는 것이 의도된 이점입니다. 실제 캐시 동작은 모델, 컨텍스트 패턴, 사용 가능한 메모리 및 런타임 구성에 따라 달라집니다.
첫 번째 통합은 작게 유지하세요. 하나의 모델, 하나의 클라이언트, 하나의 프롬프트 형식 및 하나의 로컬 머신으로 시작합니다. 기본 요청 경로가 반복적으로 안정된 후에만 도구, 병렬 요청 또는 장시간 실행되는 에이전트로 확장하세요.
성능을 테스트할 때는 초당 토큰 수 이상의 항목을 측정하세요. 다음을 기록합니다.
- 첫 토큰까지 걸리는 시간
- 생성 시작 후 디코딩 처리량
- 단일 턴의 최악 지연 시간
- 프리필 중 메모리 사용량
- 디코딩 중 메모리 사용량
- 클라이언트 또는 감시 프로세스가 느린 요청을 종료하는지 여부
빠른 평균값은 허용할 수 없는 후반부 지연을 숨길 수 있습니다. 에이전트의 경우 가끔 타임아웃을 초과하는 요청은 느리더라도 안정적으로 완료되는 구성보다 유용성이 떨어질 수 있습니다.
성능, 캐싱 및 하드웨어 선택
FreeToken의 차별화된 설계는 서로 다른 하드웨어가 탄력적인 추론 플랫폼처럼 작동하도록 만드는 데 있습니다. 저장소에는 대역폭 적응형 CPU–GPU 공동 실행, 더블 버퍼링 프리필 스트리밍, 전역 LRU 전문가 캐싱, 그래프 호환 실행 및 FTW 고속 가중치 형식이 명시되어 있습니다.
가장 중요한 개념은 전문가 배치입니다. MoE 모델에서는 선택된 전문가만 각 토큰의 계산에 참여하지만, 라우팅이 변경될 때 사용 가능한 전문가에 계속 접근할 수 있어야 합니다. 캐시는 자주 선택되는 전문가의 반복 전송을 줄일 수 있으며, CPU–GPU 실행은 특정 머신에서 사용 가능한 대역폭에 맞춰 조정될 수 있습니다.
| 기능 | 서빙에서의 역할 | 사용자에게 미치는 효과 |
|---|---|---|
| 전역 LRU 전문가 캐시 | 최근 사용된 전문가를 유지 | 전문가의 반복 이동을 줄일 수 있음 |
| 대역폭 적응형 실행 | 리소스에 따라 CPU–GPU 협업을 선택 | 계산과 전송 비용의 균형을 맞추는 데 도움 |
| 더블 버퍼링 프리필 | 프롬프트 처리 중 전체 레이어를 스트리밍 | 더 원활한 프롬프트 입력을 목표로 함 |
| FTW 형식 | 빠른 가중치 표현 제공 | 지원되는 모델의 로딩 또는 실행을 향상할 수 있음 |
| 시맨틱 체크포인트 | 유용한 반복 및 KV 상태 보존 | 중복된 컨텍스트 작업을 줄일 수 있음 |
하드웨어 선택은 이미 보유한 장비에서 시작해야 합니다. 현재 프로젝트 자료에서 가장 명확한 대상은 충분한 호스트 메모리를 갖춘 최신 NVIDIA 시스템입니다. 이 엔진은 모든 운영 체제와 가속기에서 성숙한 런타임을 대체하는 범용 솔루션이 아닙니다.
최신 NVIDIA 데스크톱
문서화된 CUDA 중심 워크플로와 대규모 MoE 모델을 테스트하는 데 가장 적합합니다.
제한된 GPU 메모리
신중하게 모델을 선택하고 호스트 메모리 또는 CPU 참여가 더 중요해질 수 있음을 예상하세요.
지원되지 않는 플랫폼
프로덕션 배포를 계획하기 전에 공식 이슈 트래커와 릴리스 노트를 확인하세요.
FreeToken을 다른 로컬 런타임과 비교할 때는 테스트 조건을 공정하게 유지하세요.
- 동일한 모델 가중치와 비교 가능한 양자화를 사용합니다.
- 프롬프트 길이, 출력 제한 및 샘플링 설정을 동일하게 유지합니다.
- 프리필 속도와 디코딩 속도를 분리합니다.
- 중앙값 지연 시간과 최악 지연 시간을 모두 기록합니다.
- 캐시를 예열한 후 테스트를 반복합니다.
- 정확한 소프트웨어 및 드라이버 버전을 기록합니다.
현재 확인 가능한 벤치마크 논의에서는 일부 MoE 워크로드에서 프로젝트 측의 강력한 결과를 보고하지만, 검토 당시 독립적인 벤치마크는 아직 이용 가능하지 않았다는 점도 강조합니다. 이러한 수치는 보편적인 보장이 아니라 유용한 방향성 자료로 간주하세요.
의미 있는 FreeToken 비교에는 후반부 지연 시간과 하드웨어 호환성이 포함되어야 합니다. 처리량만으로는 장시간 실행되는 코딩 에이전트가 제한 시간 내에 완료될 수 있는지 알 수 없습니다.
문제 해결 및 준비 상태 체크리스트
첫 실행 문제는 대부분 네 가지 영역 중 하나에서 발생합니다. 지원되지 않는 하드웨어, 불완전한 가속기 설치, 적합하지 않은 모델 파일 또는 문서화되지 않은 엔드포인트를 전제로 하는 통합입니다. 이 순서대로 해결하세요.
설치에 실패하면 공식 저장소의 지침으로 돌아가 환경을 확인하세요. 애플리케이션은 실행되지만 생성에 실패한다면 여러 변수를 동시에 변경하기 전에 더 작거나 알려진 지원 모델을 테스트하세요. 생성은 작동하지만 클라이언트가 연결되지 않는다면 URL 경로, 포트 또는 요청 스키마를 추측하지 말고 최신 서빙 문서를 확인하세요.
| 증상 | 가능성이 높은 영역 | 첫 번째 대응 |
|---|---|---|
| 패키지 설치 실패 | 환경 또는 가속기 종속성 | 환경을 다시 생성하고 공식 설치 경로를 검토 |
| 모델이 로드되지 않음 | 형식, 메모리 또는 호환성 | 문서화된 모델을 사용해 보고 사용 가능한 호스트 메모리 확인 |
| 출력이 매우 느림 | 전송 부담 또는 캐시 누락 | 컨텍스트를 줄이고 GPU 및 시스템 메모리 모니터링 |
| 클라이언트가 연결되지 않음 | 인터페이스 불일치 | 릴리스별 로컬 서빙 지침 확인 |
| 세션이 예기치 않게 중단됨 | 타임아웃 또는 리소스 압박 | 더 짧은 요청을 테스트하고 최악 지연 시간 기록 |
로컬 API 준비 상태 체크리스트:
- 공식 데스크톱 또는 CLI 경로를 통해 FreeToken 설치
- 가속기와 운영 체제가 지원되는지 확인
- 문서화된 모델을 로드하고 짧은 생성 테스트 완료
- 모델, 런타임, 드라이버, 메모리 및 구성 세부 정보 기록
- 외부 클라이언트를 연결하기 전에 현재 서빙 인터페이스 확인
설정을 신뢰할 수 있는 상태로 간주하기 전에 다음 릴리스 체크리스트를 사용하세요.
- 2026년의 현재 버전과 설치 날짜를 확인합니다.
- 공식 저장소 URL과 릴리스 노트를 저장합니다.
- 콜드 스타트와 캐시가 예열된 요청을 테스트합니다.
- 일반 응답 시간과 최악 응답 시간을 모두 측정합니다.
- 프로세스가 예상되는 가장 긴 프롬프트를 처리하고 유지되는지 확인합니다.
- 더 작은 대체 모델을 준비해 둡니다.
- 인증 및 전송 보호 기능이 문서화되어 있지 않다면 신뢰할 수 있는 네트워크 외부에 로컬 서비스를 노출하지 마세요.
로컬 추론 프로세스가 접근 가능한 네트워크 인터페이스에 바인딩되어 있다면 민감한 프롬프트가 외부에 노출될 수 있습니다. 프로젝트에서 더 넓은 배포를 위한 보안 제어를 문서화하지 않았다면 개발 서비스를 신뢰할 수 있는 접근으로 제한하세요.
Q: FreeToken 로컬 API는 어디에 사용되나요?
데스크톱 채팅, CLI 실험, 연구 도구 및 에이전트 통합을 포함해 FreeToken 기반의 로컬 추론 워크플로를 구축하는 데 사용됩니다. 정확한 HTTP 또는 클라이언트 인터페이스는 설치된 릴리스에 따라 달라지므로 공식 문서에서 확인해야 합니다.
Q: FreeToken은 Windows와 Linux를 지원하나요?
현재 확인 가능한 공식 프로젝트 정보에는 Windows와 Linux용 데스크톱 애플리케이션이 문서화되어 있습니다. 명시된 환경은 NVIDIA CUDA와 POSIX Linux에 초점이 맞춰져 있으므로 다른 플랫폼을 사용하기 전에 현재 호환성 세부 정보를 확인하세요.
Q: FreeToken은 소비자용 하드웨어에서 대규모 MoE 모델을 실행할 수 있나요?
FreeToken은 GPU, CPU, 호스트 메모리 및 인터커넥트 리소스 전반에서 프런티어급 오픈 웨이트 MoE 모델을 서빙하도록 설계되었습니다. 실제 모델 호환성은 사용 가능한 메모리, 하드웨어 대역폭, 지원되는 형식 및 프로젝트의 현재 릴리스에 따라 달라집니다.
Q: 공식 설치 정보는 어디에서 확인할 수 있나요?
공식 FreeToken GitHub 저장소(https://github.com/FlashML-org/FreeToken)를 사용하세요. 저장소에는 데스크톱 경로, 패키지 설치, 소스 설정, 기능 개요, 라이선스 및 프로젝트 링크가 문서화되어 있습니다.