Ir para o conteúdo

apogee-ai-serving

Tier-aware router (CHEAP/BALANCED/EXPENSIVE), shadow traffic, canaries, batch inference.

Esta página está sendo ampliada

As tabelas abaixo são geradas do código-fonte do pacote, portanto estão corretas. Guias narrativos e exemplos comentados estão sendo escritos módulo a módulo.

API pública

Tudo abaixo é exportado pela raiz do pacote, então from apogee_ai_serving import X funciona para cada nome.

Camada Símbolos
Application · DTOs BenchDTO, CompleteDTO, RouteDTO
Application · Use cases BenchCacheHitUseCase, CompleteUseCase, ListEnginesUseCase, RouteUseCase
Domain CacheKey, CacheLookup, FallbackPolicy, ModelDescriptor, ModelTier, QuotaScope, QuotaSnapshot, RateLimit, RouterRule, RoutingDecision, RoutingStrategy, ServingChunk, ServingCompletionRequest, ServingCompletionResponse
Domain · Enums CacheKind, EngineKind
Domain · Exceptions EngineNotAvailableException, FallbackExhaustedException, ModelNotSupportedException, NoEngineMatchedException, RateLimitExceededException, ServingError
Domain · Protocols (ports) ICompletionEngine, IFallbackChain, IModelRouter, IPromptEmbedder, IRateLimiter, ISemanticCache
Infrastructure BridgedPromptEmbedder, EchoEngine, EngineRegistry, HashingPromptEmbedder, InMemoryRateLimiter, InMemorySemanticCache, JsonSemanticCache, LMStudioEngine, LlamaCppEngine, MlxEngine, OllamaEngine, OrderedFallbackChain, RedisRateLimiter, RedisSemanticCache, TgiEngine, TierAwareRouter, VllmEngine

Instalação

Bash
pip install apogee-ai-serving

A instalação base não tem dependência externa obrigatória. Cada extra habilita um adapter.

Extra Traz
ollama ollama>=0.3
vllm vllm>=0.6
llamacpp llama-cpp-python>=0.2
mlx mlx-lm>=0.18
redis redis>=5.0
embeddings apogee-ai-providers>=0.1
all ollama>=0.3, vllm>=0.6, llama-cpp-python>=0.2, mlx-lm>=0.18, redis>=5.0, apogee-ai-providers>=0.1

CLI

Instalado como console script e registrado como plugin do apogee, então os mesmos subcomandos funcionam sob o binário global.

Bash
apogee-serving --help

Leia a seguir