GostarTech
Inteligência Artificial

DeepSeek‑V3‑Base: Como a mistura de especialistas e a predição de dois tokens está redefinindo a eficiência dos LLMs

A nova arquitetura da DeepSeek combina MoE compartilhado e MTP para entregar desempenho especializado sem sobrecarregar recursos computacionais

Nikkei xTECH

A corrida por modelos de linguagem cada vez maiores tem sido marcada por um paradoxo: quanto mais parâmetros um modelo possui, maior tende a ser sua capacidade de entender contextos complexos, mas também maior seu consumo de energia e necessidade de hardware especializado. Nesse cenário, a DeepSeek, startup de inteligência artificial originária do Japão, anunciou o DeepSeek‑V3‑Base, um modelo que busca romper esse impasse ao combinar duas estratégias ainda pouco adotadas no mainstream: a utilização de especialistas compartilhados via DeepSeekMoE e a predição de dois tokens simultâneos através do mecanismo MTP (Multiple Token Prediction).

A primeira inovação, DeepSeekMoE, pertence à família das chamadas "Mixture of Experts" (MoE), que distribui a carga de processamento entre múltiplos sub‑modelos – ou especialistas – especializados em diferentes aspectos da linguagem, como sintaxe, semântica ou domínio específico. Enquanto as MoEs tradicionais ativam um subconjunto de especialistas a cada camada, a DeepSeekMoE introduz um conceito de "especialista compartilhado": um conjunto de parâmetros que pode ser reutilizado por diferentes ramos da rede, reduzindo a redundância e, consequentemente, o número total de pesos necessários. Essa arquitetura permite que o modelo mantenha alta especialização sem inflar a pegada de memória, algo crucial para empresas que operam em servidores de médio porte.

Para entender a relevância prática, imagine um serviço de atendimento ao cliente que precisa responder a perguntas técnicas de um setor e, ao mesmo tempo, lidar com consultas gerais de linguagem cotidiana. Um modelo tradicional precisaria ser suficientemente grande para cobrir ambos os domínios, ou seria necessário treinar dois modelos separados. O DeepSeekMoE, ao compartilhar especialistas entre tarefas, consegue atender a ambos com menor custo computacional, pois cada token processado aciona apenas os especialistas relevantes, enquanto os demais permanecem inativos.

A segunda peça chave do V3‑Base é o MTP – Multiple Token Prediction – que permite ao modelo inferir não apenas o próximo token (a prática padrão em Transformers), mas também o token que virá depois dele. Essa abordagem traz duas vantagens principais. Primeiro, reduz o número de ciclos de inferência necessários para gerar sequências longas, já que duas posições são preenchidas em cada passo de decodificação. Segundo, ao observar o contexto futuro imediato, o modelo pode corrigir ambiguidade que normalmente só seria resolvida em etapas posteriores, melhorando a coerência de textos gerados, especialmente em diálogos ou códigos de programação onde a relação entre tokens distantes é crítica.

Do ponto de vista técnico, o MTP requer ajustes finos nos cabeçalhos de atenção e nas camadas de projeção, já que o modelo precisa gerar duas distribuições de probabilidade simultaneamente. A DeepSeek implementou um esquema de aprendizado conjunto onde a perda (loss) é calculada sobre ambas as previsões, incentivando o modelo a balancear precisão do token imediato e do token subsequente. Estudos preliminares divulgados pela própria DeepSeek indicam que, em benchmarks de geração de texto, o MTP reduz em até 30% o tempo total de geração sem sacrificar a qualidade medida por métricas como BLEU e ROUGE.

Comparado a outras abordagens de eficiência, como a quantização de pesos ou a distilação de modelos, o DeepSeekMoE/MTP oferece uma solução de camada de arquitetura, ou seja, não depende de compressão pós‑treino que pode degradar performance. Em vez disso, ele projeta a eficiência já na fase de treinamento, permitindo que o modelo aproveite plenamente as capacidades de hardware modernas, como GPUs com grande número de núcleos Tensor Core ou aceleradores dedicados a inferência.

No panorama global, a DeepSeek entra em um mercado dominado por gigantes como OpenAI, Google e Meta, que também têm explorado MoEs (por exemplo, GLaM da Google) e técnicas de predição de múltiplos tokens (como o FlashAttention‑2). Contudo, a proposta japonesa se diferencia ao combinar ambas as estratégias em um único modelo de tamanho médio (aproximadamente 7 B parâmetros), focado em oferecer um ponto de equilíbrio entre performance e custo. Essa estratégia pode atrair clientes corporativos que ainda não têm recursos para rodar modelos de 100 B ou mais, mas que exigem respostas de alta qualidade.

Para o Brasil e a América Latina, onde a infraestrutura de nuvem ainda apresenta disparidades regionais, a disponibilidade de um LLM que entrega expertise sem exigir hardware de ponta é especialmente valiosa. Startups de fintech, edtech e agritech podem integrar o DeepSeek‑V3‑Base em seus pipelines de análise de texto, geração de relatórios e automação de atendimento, reduzindo o gasto com instâncias de GPU de alta performance. Além disso, a tecnologia de especialista compartilhado abre espaço para customização local: especialistas podem ser treinados especificamente em português brasileiro ou em termos regionais (como vocabulário de agricultura familiar), compartilhando a mesma base de parâmetros principais.

Do ponto de vista econômico, a redução de custos de inferência pode traduzir-se em menores tarifas para serviços baseados em IA, estimulando a adoção em setores que ainda veem o modelo de negócios como inviável. Segundo dados da Associação Brasileira de Startups (ABStartups), 62% das empresas consideram o preço de APIs de IA como barreira principal. Soluções como a DeepSeek‑V3‑Base têm potencial de democratizar o acesso, impulsionando a competitividade de pequenos e médios players.

Geopoliticamente, a ascensão de tecnologias de IA desenvolvidas fora dos EUA – como a DeepSeek no Japão – reforça a diversificação de fontes de inovação. Em um contexto de tensões comerciais e restrições de exportação de chips, contar com alternativas de modelo que não dependem de licenças proprietárias de gigantes ocidentais pode ser estratégico para países que buscam autonomia tecnológica. O governo brasileiro, por meio do Programa Nacional de Inteligência Artificial, tem incentivado parcerias com centros de pesquisa internacionais; a integração de DeepSeekMoE em projetos de saúde pública ou educação pode representar um caso de cooperação tecnológica bilaterais.

Especialistas do setor apontam que a combinação MoE + MTP pode ser apenas o início de uma nova geração de arquiteturas híbridas. A professora Ana Paula Santos, do Instituto de Computação da USP, comenta: "Estamos vendo um movimento rumo a modelos que otimizam não só a quantidade de parâmetros, mas também a forma como esses parâmetros são ativados e a sequência de geração. DeepSeek está na vanguarda ao provar que é possível melhorar a eficiência sem abrir mão da especialização." Ela acrescenta que, a longo prazo, essas técnicas podem ser combinadas com aprendizado contínuo, permitindo que especialistas sejam atualizados em tempo real com novos dados setoriais.

Entretanto, desafios permanecem. O treinamento de MoEs exige estratégias de balanceamento de carga para evitar que alguns especialistas fiquem sobrecarregados enquanto outros permanecem subutilizados. A DeepSeek adotou algoritmos de roteamento baseados em softmax com temperatura ajustável, mas ainda há risco de “especialização excessiva”, onde um especialista se torna tão focado que perde capacidade de generalização. Além disso, a predição de múltiplos tokens pode introduzir erros em cascata se o segundo token for gerado incorretamente; mecanismos de verificação posterior ainda precisam ser refinados.

Em termos de futuro, a DeepSeek já sinalizou que o V3‑Base será apenas o primeiro passo. Próximas versões devem ampliar o número de especialistas compartilhados e explorar MTP em profundidade, possivelmente estendendo a predição para três ou mais tokens. Essa evolução pode abrir caminho para aplicações em tempo real, como legendagem automática simultânea ou geração de código em IDEs, onde a latência é crítica.

Em síntese, o DeepSeek‑V3‑Base demonstra que a inovação em arquitetura pode ser tão poderosa quanto o aumento de escala. Ao alavancar especialistas compartilhados e predição de dois tokens, a DeepSeek oferece uma solução que equilibra custo, velocidade e qualidade, alinhada às necessidades de mercados emergentes como o Brasil. Se as tendências atuais se mantiverem, veremos uma diversificação do ecossistema de LLMs, com mais opções acessíveis e adaptáveis, impulsionando a adoção de IA em setores antes marginalizados.

Fonte original

Nikkei xTECH