Serviços de IA (locais)

Doco Translate pode se conectar a tempos de execução de modelo de IA locais, como Ollama, LM Studio e oMLX para tradução.

Serviços locais de tradução de IA

Avantagens dos modelos locais

Usar modelos locais é a abordagem que Doco Translate recomenda mais fortemente porque oferece várias vantagens importantes.

Qualidade da tradução

Modelos de linguagem grandes se destacam em tarefas de linguagem natural, especialmente tradução. Eles geralmente oferecem melhor qualidade de tradução do que os mecanismos de tradução automática convencionais.

Privacidade

Modelos carregados por meio de um tempo de execução local mantêm seus dados em seu dispositivo. Nada é enviado a um fornecedor terceirizado, garantindo que o processamento de documentos permaneça privado.

Custo

Ao contrário das APIs de IA em nuvem, os modelos locais não cobram por tokens e não têm taxas de uso adicionais.

Limitações de modelos locais

Tamanho do modelo

Os modelos locais geralmente são de código aberto e os modelos que funcionam bem em hardware de consumo geralmente têm contagens de parâmetros relativamente pequenas, como 4B, 9B, 35B-A3B ou 27B. As suas capacidades gerais podem, portanto, ser mais fracas do que os grandes modelos de nuvem.

No entanto, a tradução não requer uma cadeia de raciocínio muito longa ou o modelo de raciocínio mais forte possível. Modelos locais menores são capazes de produzir boas traduções, o que os torna uma escolha altamente econômica.

Velocidade de inferência

A velocidade de inferência local depende do seu hardware e do tamanho do modelo. Hardware melhor e modelos menores são mais rápidos, embora a inferência local geralmente ainda seja mais lenta do que uma API de IA em nuvem.

Tempos de execução do modelo de IA local

FerramentaCaracterísticas
OllamaConfiguração simples pela linha de comando e gerenciamento de modelos
LMInterface gráfica amigável para download e execução de modelos locais
oMLXInferência LLM local de alta velocidade otimizada para silício Apple

Ollama

Ollama é uma ferramenta de linha de comando acessível para executar modelos locais.

Instale o Ollama seguindo suas instruções oficiais e execute ollama pull MODEL_NAME para baixar um modelo.

Depois que o modelo for baixado e executado com sucesso no Ollama, conecte-o a Doco Translate com um clique.

O endpoint padrão do Ollama é http://localhost:11434.

Configurações do serviço Ollama

LM

LM Studio fornece uma interface gráfica para executar modelos locais e é fácil de começar.

Instale o LM Studio de seu site oficial e baixe um modelo dentro do aplicativo.

Após o download do modelo, inicie o servidor de modelo local do LM Studio para que ele exponha uma API. Você pode então conectá-lo a Doco Translate com um clique.

O endpoint padrão do LM Studio é http://localhost:1234.

LM Studio

oMLX

oMLX é um tempo de execução de modelo local otimizado para silício Apple e fornece inferência muito rápida.

Instale o oMLX de seu site oficial, abra o console oMLX e baixe um modelo.

oMLX inicia seu serviço local automaticamente. Depois que o modelo for baixado e aprovado no teste, conecte-o a Doco Translate com um clique.

O endpoint padrão do oMLX é http://localhost:8000.

oMLX

Modelos recomendados

Doco Translate recomenda os seguintes modelos para tradução:

  • Hy-MT2-1.8B: muito rápido, uso mínimo de memória e otimizado especificamente para tradução
  • Qwen3.5:9B: rápido com uso de memória relativamente baixo
  • Qwen3.6:35B-A3B: fortes recursos e desempenho rápido, com maior uso de memória
  • Gemma4:12B: uma escolha equilibrada para qualidade, velocidade e uso de memória
  • Qwen3.6:27B: os recursos mais fortes, mas mais lentos e com uso intenso de memória
  • Qwen3.5:4B: rápido com pouco uso de memória, mas um pouco menos estável

Para a maioria das cargas de trabalho, use Hy-MT2-1.8B ou Qwen3.5:9B como modelo principal. Ambos são rápidos e eficientes em termos de memória. Para maior qualidade e estabilidade, use Qwen3.6:35B-A3B, que é mais capaz, mas consome mais memória.