MODO DE IMPLANTAÇÃO · 3 DE 6
Self-Hosted LLMs.
Modelos de fronteira de código aberto - Llama, Mistral, Qwen, DeepSeek - executando em infraestrutura dedicada de GPU que o BrainPack opera em seu nome, ou em GPUs que você possui. Sem Anthropic no caminho dos dados. Sem OpenAI. Sem Google. Sem Microsoft. Apenas o modelo, a GPU, seus dados e a camada operacional do BrainPack. Para cargas de trabalho onde o requisito é "nenhum provedor de IA de terceiros pode ver isso" - este é o modo de implantação. Operamos as GPUs. Operamos os modelos. Você obtém os resultados.
O Provedor Não Pode Ver Dados Que Nunca Recebe.
ZDR é um contrato. Nuvem pública é uma configuração. Self-hosted é uma proposição completamente diferente - não há provedor de IA no caminho dos dados. O modelo é executado em uma GPU sob nosso controle ou o seu. A consulta nunca sai do perímetro. A resposta nunca entra no arquivo de log de outra pessoa, nem mesmo brevemente. Para classes de dados onde a resposta é "o provedor tecnicamente poderia ver isso por 200 milissegundos durante a inferência" é não, o modo de implantação deve ser self-hosted. Não há outra resposta.
Self-hosted costumava significar "construa você mesmo, execute você mesmo, espere que o talento permaneça" - é por isso que a maioria das empresas a evitava. Modelos de código aberto estavam 12-18 meses atrás da capacidade de fronteira. Infraestrutura de GPU era uma decisão de CapEx de seis dígitos. Operações exigiam engenheiros de ML que a maioria das empresas não conseguia reter. A matemática não funcionava fora de algumas indústrias específicas.
Em 2026, a matemática mudou. Modelos de código aberto - Llama, Mistral, Qwen, DeepSeek - fecharam a maioria do gap de capacidade nas cargas de trabalho que realmente importam. Serviços self-hosted gerenciados executam a camada de GPU para você. O gap de capacidade agora é de alguns meses para tarefas de ponta e zero para cargas de trabalho de produção. A economia de GPU funciona para qualquer empresa acima da menor escala. A única barreira restante era a complexidade operacional - e o BrainPack cuida disso como parte da camada gerenciada.
Uma Decisão de Limite de Controle, Não uma Preferência de Fornecedor.
Self-hosted significa executar inferência em infraestrutura que o BrainPack ou você controla diretamente, sem nenhum provedor de IA de terceiros envolvido. Os dados vão de seu ambiente para a GPU e voltam. Nada mais está no caminho dos dados. Nenhum fornecedor de IA vê o prompt, a resposta ou o raciocínio do modelo porque nenhum fornecedor de IA faz parte da chamada.
Os modelos nesta categoria são apenas de peso aberto Llama (Meta), Mistral, Qwen (Alibaba), DeepSeek e a cauda longa de variantes ajustadas construídas sobre eles. Os modelos de fronteira fechados (Claude, GPT, Gemini) não estão disponíveis self-hosted; seus provedores não liberam pesos. Para a maioria das cargas de trabalho de produção, o gap de capacidade agora é pequeno. Para algumas tarefas de ponta - pesquisa profunda, raciocínio especializado - permanece real.
Self-hosted não é automaticamente a escolha certa. GPUs reservadas para sua inferência têm um custo unitário menor por token em volume suficiente, mas abaixo desse volume o hardware fica ocioso e custa mais. O ponto de equilíbrio depende da carga de trabalho, geralmente em algum lugar entre 10 milhões e 50 milhões de tokens por dia. Self-hosted é apropriado para algumas classes de dados e antieconômico para outras. A decisão de implantação é uma decisão de limite de controle e volume, não uma decisão de confiança no fornecedor.
O BrainPack trata Self-Hosted como uma superfície de execução entre cinco. As camadas Connect, Orchestrate e Govern não mudam. O que muda é onde a inferência realmente é executada e o fato de que nenhum fornecedor de IA está no caminho dos dados.
Como Funciona Realmente — Camada GovernQuando Self-Hosted É O Modo Correto
Seis Cargas de Trabalho Onde Ganha.
Seis categorias de carga de trabalho onde self-hosted é a resposta apropriada - e onde ZDR ou on-premise são geralmente as alternativas que BrainPack também suporta.
PROPRIEDADE INTELECTUAL CENTRAL E TECNOLOGIA COMPETITIVA
Código-fonte de produtos que você vende, algoritmos proprietários, segredos comerciais, documentação de processo de fabricação, pipelines de P&D. Os dados definem sua posição competitiva. "O provedor viu por 200 milissegundos e descartou" não é a resposta - os dados nunca deveriam ter saído do seu controle. Self-hosted é a resposta.
INFORMAÇÕES FINANCEIRAS DE MATERIAL PRÉ-ANÚNCIO
Ganhos trimestrais antes do lançamento, documentos de M&A, materiais de conselho, discussão de compensação executiva, estratégias de preços. Mesmo ZDR é muito permissivo - os dados passam por um provedor de terceiros, embora brevemente. Self-hosted elimina o provedor completamente.
CARGAS DE TRABALHO DE ALTO VOLUME ONDE A ECONOMIA DE TOKENS IMPORTA
Automação de atendimento ao cliente processando milhões de interações por dia. Agentes de conhecimento interno servindo milhares de funcionários. Pipelines de processamento de documentos manipulando dezenas de milhares de documentos. Acima de ~10-50M tokens por dia, GPU dedicada fica mais barata por token do que as taxas de API de fronteira - e as economias se acumulam.
CARGAS DE TRABALHO ONDE A LATÊNCIA IMPORTA
Modelos self-hosted em GPUs dedicadas servem respostas com latência previsível, nenhum efeito vizinho barulhento de nuvem pública, nenhuma espera de limite de taxa, nenhuma fila do lado do provedor. Para voz em tempo real, loops de agente sub-segundo ou cargas de trabalho analíticas de alta frequência, self-hosted geralmente supera as APIs de nuvem.
REQUISITOS DE IA SOBERANA
Cargas de trabalho onde os dados nunca devem deixar comprovadamente uma jurisdição nacional específica, devem ser processados em infraestrutura possuída por entidades domésticas ou devem estar em conformidade com regras de soberania que provedores de IA em nuvem não podem satisfazer. Self-hosted em infraestrutura de GPU regional aborda isso.
REQUISITOS DE 'NENHUMA EMPRESA DE TECNOLOGIA DOS EUA NO CAMINHO DOS DADOS'
Algumas cargas de trabalho de defesa, financeiras, de saúde e governamentais em jurisdições fora dos EUA explicitamente excluem provedores de IA sediados nos EUA do caminho de inferência. Self-hosted com modelos europeus ou de código aberto em infraestrutura regional é a resposta.
Quando Self-Hosted É O Modo Errado.
E Para Onde A Carga De Trabalho Deveria Ir Em Vez Disso.
Cinco categorias de carga de trabalho onde self-hosted é a resposta errada e para onde o BrainPack roteia o trabalho para nuvem pública, ZDR, on-premise ou air-gapped em vez disso.
Cargas De Trabalho De Baixo Volume Ou Imprevisíveis
Cargas de trabalho que não ultrapassam o volume de equilíbrio de 10-50M tokens por dia deixam o siló de GPU dedicado ocioso. A economia favorece nuvem pública pay-per-token ou ZDR é mais barato, às vezes por um fator de dez. Reserve self-hosted para pipelines estáveis de alto throughput, não para experimentação em rajada.
Tarefas De Capacidade De Fronteira
Pesquisa profunda, raciocínio complexo com múltiplas etapas, as capacidades multimodais mais recentes, agentes de codificação avançados. Modelos de peso aberto fecharam a maioria do gap, mas na ponta da fronteira, Claude, GPT e Gemini ainda lideram às vezes por uma geração. Se a carga de trabalho realmente precisa dessa capacidade e a classe de dados permite, nuvem pública ou ZDR é a superfície correta.
Dados Sujeitos A Regras Estritas De Residência Ou Air-Gap
Self-hosted na infraestrutura do BrainPack ainda significa um data center em algum lugar, provavelmente não na jurisdição que o regulador se importa, e não air-gapped. Classificações de defesa, regras de soberania bancária, cargas de trabalho governamentais sob FedRAMP High exigem implantação on-premise ou air-gapped na região especificada. Self-hosted em infraestrutura compartilhada não satisfaz esses requisitos.
Trabalho Geral De Produtividade
Rascunho de emails, resumo de documentos públicos, brainstorming, conclusão de código em repositórios não sensíveis. A classe de dados não exige o limite de controle, o volume raramente justifica a reserva de GPU e a seleção de modelo é mais estreita. Nuvem pública faz este trabalho mais rápido, mais barato e com modelos melhores.
Cargas De Trabalho Onde Tempo-Para-Capacidade Importa Mais Que Controle
Um piloto que precisa ser lançado em uma semana. Um novo caso de uso onde o time ainda está validando se IA resolve o problema. Self-hosted exige procura de GPU, seleção de modelo, decisões de fine-tuning e preparação operacional. Nuvem pública é lançada em dias. Valide primeiro, então migre para self-hosted se a classe de dados e volume suportarem.
PARA ONDE ROTEAR EM VEZ DISSO
Como Self-Hosted Orquestra.
Com Cada Outro Modo De Implantação.
Self-hosted é raramente o único modo de implantação em uma empresa real. É executado ao lado de nuvem pública, ZDR, on-premise e air-gapped - cada um manipulando as cargas de trabalho que melhor se encaixam. A camada Govern roteia automaticamente.
Uma implantação real do BrainPack se parece com isto:
Mesmo usuário. Mesma interface conversacional. Mesma biblioteca de agentes. Mesmas políticas de governança. Cinco caminhos de inferência diferentes — selecionados automaticamente pela camada Govern com base na classificação de dados, framework regulatório e política.
O usuário nunca escolhe o modo de implantação. O modo se escolhe.
Self-Hosted Dentro Da Camada BrainPack.
O Que O BrainPack Adiciona No Topo De Uma Chamada De API Bruta.
Executar um LLM de código aberto em uma GPU é tecnicamente direto. Executá-lo como infraestrutura de produção com o rigor operacional que a empresa exige não é. Várias coisas que o BrainPack faz no topo da camada de GPU tornam o self-hosted pronto para produção.
Procura, dimensionamento e gerenciamento de ciclo de vida de GPU
Dimensionamos a capacidade de GPU para o seu mix de carga de trabalho, procuramos o hardware (ou operamos o seu), lidamos com atualizações de firmware, gerenciamos a utilização e substituímos hardware conforme envelhecer. Você não executa um time de operações de GPU.
Avaliação, seleção e migração de modelo
Novos modelos de código aberto são lançados mensalmente. Avaliamos cada um em padrões de carga de trabalho específicos, implantamos os prontos para produção e migramos cargas de trabalho quando modelos mais novos superam em suas tarefas. Sua capacidade de IA não congela no momento em que um modelo é implantado.
Observabilidade e resposta a incidentes
Cada chamada de inferência é monitorada. Anomalias de latência disparam alertas. Regressões de qualidade aparecem antes de impactarem os usuários. Inferencências com falha são diagnosticadas e resolvidas. A maturidade operacional é comparável a um SaaS maduro - não a um ambiente de pesquisa.
Roteamento multi-modelo dentro de self-hosted
O orquestrador também roteia dentro do self-hosted. Uma busca simples vai para um modelo de parâmetro 7B para footprint de GPU mínimo, tarefas exigentes de GPU para 70B, tarefas de raciocínio para Qwen-Coder. O roteamento é transparente para os usuários; a otimização de custo é significativa.
Failover para outros modos
Se uma GPU self-hosted tiver uma interrupção, o orquestrador falha automaticamente para endpoints ZDR - preservando a postura contratual o máximo possível enquanto mantém a IA disponível. O usuário não vê o failover; o log de auditoria o registra.
Fine-tuning e customização
Self-hosted habilita verdadeiro fine-tuning em seus dados - o que é impossível em provedores de API de fronteira. BrainPack gerencia pipelines de fine-tuning, avaliação e implantação de variantes customizadas para cargas de trabalho onde produz melhoria significativa.
Transparência de custo e modelagem de TCO
Rastreamos utilização, custo por token entre self-hosted vs outros modos e fornecemos relatórios de chargeback. Quando self-hosted é mais barato que alternativas, você vê isso. Quando é mais caro, você vê também - e o orquestrador pode ser ajustado por política para otimizar de acordo.
Custos E Velocidade.
O Que Você Realmente Obtém.
Self-hosted é o modo de implantação mais lento para começar e o custo unitário mais barato em volume. Ambas as afirmações vêm com ressalvas.
Para primeira capacidade, procura de GPU, seleção de modelo, decisões de fine-tuning e preparação de infraestrutura. Sem atalhos na linha do tempo.
Por chamada. Modelos de peso aberto em GPU dedicada são competitivos na maioria das cargas de trabalho. Tarefas pesadas em raciocínio executam mais lentamente que modelos fechados de fronteira — o gap está fechando mas não está fechado.
Custo mensal fixo, não pay-per-token. Abaixo do ponto de equilíbrio, é o modo mais caro por uma margem grande. Acima dele, o mais barato por uma margem grande.
Tokens-por-dia onde self-hosted se torna mais barato que APIs pay-per-token. BrainPack modela isso antes da implantação, não depois que as GPUs são solicitadas.
A despesa real do self-hosted não é a conta de GPU é a capacidade reservada ociosa porque o mix de carga de trabalho não correspondeu à projeção. A camada Govern roteia automaticamente trabalho de spillover e em rajadas para nuvem pública ou ZDR, mantendo a infraestrutura dedicada na utilização que a matemática assumiu.
Self-Hosted, Totalmente Controlado.
Junto Com Cada Outro Modo, Por Classe De Dados.
Self-hosted está operando em ambientes de produção hoje, ao lado de outros modos de implantação para cargas de trabalho não sensíveis a IP.
Self-hosted Llama executando em GPU dedicada manipula análise financeira de números trimestrais não anunciados. Nuvem pública manipula cópia de marketing. ZDR manipula interações individuais de clientes. Três modos, uma camada operacional.
Self-hosted Mistral processa análise de contrato de fornecedor onde as posições de negociação não podem transitar nenhum provedor de terceiros. Nuvem pública manipula análise de cadeia de suprimentos. ZDR manipula casos de suporte ao cliente.
Self-hosted Llama em GPUs de propriedade do hospital manipula dados de pesquisa clínica. ZDR manipula consultas de RH administrativas. Air-gapped manipula investigações de conformidade classificadas. Três níveis de sensibilidade, três modos apropriados.
Quando o Provedor Não Pode Estar No Caminho Dos Dados.
Self-hosted é o modo de implantação para cargas de trabalho onde provedores de IA de terceiros não são aceitáveis - em qualquer postura de retenção, por qualquer duração, sob qualquer contrato. Fale com um arquiteto sobre quais cargas de trabalho em seu ambiente exigem self-hosted e como a política de orquestração deve dividir o trabalho entre todos os cinco modos.