[{"data":1,"prerenderedAt":277},["ShallowReactive",2],{"docs-pt-/pt/docs/service/ai/local":3},{"id":4,"title":5,"body":6,"description":269,"extension":270,"meta":271,"navigation":272,"path":273,"seo":274,"stem":275,"__hash__":276},"docs_pt/pt/docs/service/ai/local.md","Serviços de IA (locais)",{"type":7,"value":8,"toc":258},"minimark",[9,13,17,24,29,32,37,40,44,47,51,54,58,62,65,68,72,75,79,137,140,143,151,154,161,167,170,173,176,179,185,191,194,197,200,203,209,214,218,221,243],[10,11,5],"h1",{"id":12},"serviços-de-ia-locais",[14,15,16],"p",{},"Doco Translate pode se conectar a tempos de execução de modelo de IA locais, como Ollama, LM Studio e oMLX para tradução.",[14,18,19],{},[20,21],"img",{"alt":22,"src":23},"Serviços locais de tradução de IA","/images/docs/local-ai-services.webp",[25,26,28],"h2",{"id":27},"avantagens-dos-modelos-locais","Avantagens dos modelos locais",[14,30,31],{},"Usar modelos locais é a abordagem que Doco Translate recomenda mais fortemente porque oferece várias vantagens importantes.",[33,34,36],"h4",{"id":35},"qualidade-da-tradução","Qualidade da tradução",[14,38,39],{},"Modelos de linguagem grandes se destacam em tarefas de linguagem natural, especialmente tradução. Eles geralmente oferecem melhor qualidade de tradução do que os mecanismos de tradução automática convencionais.",[33,41,43],{"id":42},"privacidade","Privacidade",[14,45,46],{},"Modelos carregados por meio de um tempo de execução local mantêm seus dados em seu dispositivo. Nada é enviado a um fornecedor terceirizado, garantindo que o processamento de documentos permaneça privado.",[33,48,50],{"id":49},"custo","Custo",[14,52,53],{},"Ao contrário das APIs de IA em nuvem, os modelos locais não cobram por tokens e não têm taxas de uso adicionais.",[25,55,57],{"id":56},"limitações-de-modelos-locais","Limitações de modelos locais",[33,59,61],{"id":60},"tamanho-do-modelo","Tamanho do modelo",[14,63,64],{},"Os modelos locais geralmente são de código aberto e os modelos que funcionam bem em hardware de consumo geralmente têm contagens de parâmetros relativamente pequenas, como 4B, 9B, 35B-A3B ou 27B. As suas capacidades gerais podem, portanto, ser mais fracas do que os grandes modelos de nuvem.",[14,66,67],{},"No entanto, a tradução não requer uma cadeia de raciocínio muito longa ou o modelo de raciocínio mais forte possível. Modelos locais menores são capazes de produzir boas traduções, o que os torna uma escolha altamente econômica.",[33,69,71],{"id":70},"velocidade-de-inferência","Velocidade de inferência",[14,73,74],{},"A velocidade de inferência local depende do seu hardware e do tamanho do modelo. Hardware melhor e modelos menores são mais rápidos, embora a inferência local geralmente ainda seja mais lenta do que uma API de IA em nuvem.",[25,76,78],{"id":77},"tempos-de-execução-do-modelo-de-ia-local","Tempos de execução do modelo de IA local",[80,81,82,95],"table",{},[83,84,85],"thead",{},[86,87,88,92],"tr",{},[89,90,91],"th",{},"Ferramenta",[89,93,94],{},"Características",[96,97,98,113,125],"tbody",{},[86,99,100,110],{},[101,102,103],"td",{},[104,105,109],"a",{"href":106,"rel":107},"https://ollama.com/",[108],"nofollow","Ollama",[101,111,112],{},"Configuração simples pela linha de comando e gerenciamento de modelos",[86,114,115,122],{},[101,116,117],{},[104,118,121],{"href":119,"rel":120},"https://lmstudio.ai/",[108],"LM",[101,123,124],{},"Interface gráfica amigável para download e execução de modelos locais",[86,126,127,134],{},[101,128,129],{},[104,130,133],{"href":131,"rel":132},"https://omlx.ai/",[108],"oMLX",[101,135,136],{},"Inferência LLM local de alta velocidade otimizada para silício Apple",[25,138,109],{"id":139},"ollama",[14,141,142],{},"Ollama é uma ferramenta de linha de comando acessível para executar modelos locais.",[14,144,145,146,150],{},"Instale o Ollama seguindo suas instruções oficiais e execute ",[147,148,149],"code",{},"ollama pull MODEL_NAME"," para baixar um modelo.",[14,152,153],{},"Depois que o modelo for baixado e executado com sucesso no Ollama, conecte-o a Doco Translate com um clique.",[14,155,156,157,160],{},"O endpoint padrão do Ollama é ",[147,158,159],{},"http://localhost:11434",".",[14,162,163],{},[20,164],{"alt":165,"src":166},"Configurações do serviço Ollama","/images/docs/ollama-settings.webp",[25,168,121],{"id":169},"lm",[14,171,172],{},"LM Studio fornece uma interface gráfica para executar modelos locais e é fácil de começar.",[14,174,175],{},"Instale o LM Studio de seu site oficial e baixe um modelo dentro do aplicativo.",[14,177,178],{},"Após o download do modelo, inicie o servidor de modelo local do LM Studio para que ele exponha uma API. Você pode então conectá-lo a Doco Translate com um clique.",[14,180,181,182,160],{},"O endpoint padrão do LM Studio é ",[147,183,184],{},"http://localhost:1234",[14,186,187],{},[20,188],{"alt":189,"src":190},"LM Studio","/images/docs/lm-studio-settings.webp",[25,192,133],{"id":193},"omlx",[14,195,196],{},"oMLX é um tempo de execução de modelo local otimizado para silício Apple e fornece inferência muito rápida.",[14,198,199],{},"Instale o oMLX de seu site oficial, abra o console oMLX e baixe um modelo.",[14,201,202],{},"oMLX inicia seu serviço local automaticamente. Depois que o modelo for baixado e aprovado no teste, conecte-o a Doco Translate com um clique.",[14,204,205,206,160],{},"O endpoint padrão do oMLX é ",[147,207,208],{},"http://localhost:8000",[14,210,211],{},[20,212],{"alt":133,"src":213},"/images/docs/omlx-settings.webp",[25,215,217],{"id":216},"modelos-recomendados","Modelos recomendados",[14,219,220],{},"Doco Translate recomenda os seguintes modelos para tradução:",[222,223,224,228,231,234,237,240],"ul",{},[225,226,227],"li",{},"Hy-MT2-1.8B: muito rápido, uso mínimo de memória e otimizado especificamente para tradução",[225,229,230],{},"Qwen3.5:9B: rápido com uso de memória relativamente baixo",[225,232,233],{},"Qwen3.6:35B-A3B: fortes recursos e desempenho rápido, com maior uso de memória",[225,235,236],{},"Gemma4:12B: uma escolha equilibrada para qualidade, velocidade e uso de memória",[225,238,239],{},"Qwen3.6:27B: os recursos mais fortes, mas mais lentos e com uso intenso de memória",[225,241,242],{},"Qwen3.5:4B: rápido com pouco uso de memória, mas um pouco menos estável",[14,244,245,246,249,250,253,254,257],{},"Para a maioria das cargas de trabalho, use ",[147,247,248],{},"Hy-MT2-1.8B"," ou ",[147,251,252],{},"Qwen3.5:9B"," como modelo principal. Ambos são rápidos e eficientes em termos de memória. Para maior qualidade e estabilidade, use ",[147,255,256],{},"Qwen3.6:35B-A3B",", que é mais capaz, mas consome mais memória.",{"title":259,"searchDepth":260,"depth":260,"links":261},"",2,[262,263,264,265,266,267,268],{"id":27,"depth":260,"text":28},{"id":56,"depth":260,"text":57},{"id":77,"depth":260,"text":78},{"id":139,"depth":260,"text":109},{"id":169,"depth":260,"text":121},{"id":193,"depth":260,"text":133},{"id":216,"depth":260,"text":217},"Conecte Ollama, LM Studio ou oMLX e traduza com modelos de IA executados no seu dispositivo.","md",{},true,"/pt/docs/service/ai/local",{"title":5,"description":269},"pt/docs/service/ai/local","YXMbgiDxDt1O1MLFWCdXQa1KMRr518Ch6J0tpu0ooP4",1787207636613]