Curadoria aberta para quem está começando em IA

O mapa das ferramentas de IA que você pode usar hoje

Só ferramentas gratuitas: APIs com camada grátis, modelos abertos, runtimes, servidores MCP, skills, datasets e agentes — com o caminho para baixar, como usar e onde usar cada tipo, descrição honesta, ranking de qualidade, requisitos reais e links oficiais. Feito para quem está começando e não quer se perder.

    Ferramentas de decisão

    Não é só uma lista: descubra, monte e verifique

    Cinco ferramentas que respondem “qual IA devo usar?”, “meu PC roda isso?” e “como combino tudo sem gastar?”.

    O que você quer construir?

    Escolha um projeto e o montador de stack se preenche sozinho

    Receitas prontas de sistemas de IA com peças gratuitas. Clique em Construir e o NeuroCatálogo monta a combinação no montador — depois é só trocar peças, comparar e salvar na sua caixa.

    Comece por aqui

    Seis ferramentas que valem o seu primeiro fim de semana

    Escolhas do curador: cada uma é a mais fácil da sua categoria para dar o primeiro resultado concreto.

    Coleções

    Listas prontas: populares, novidades, estrelas e melhores por uso

    Atalhos no estilo loja de aplicativos — cada lista já vem ordenada. Clique em qualquer item para abrir a página completa da ferramenta.

    Trilha do iniciante

    Cinco passos, do primeiro prompt ao primeiro projeto publicado

    Uma ordem sugerida para não se perder. Cada passo leva de meia hora a uma tarde e usa ferramentas gratuitas.

      Do baixar ao usar

      Como obter, usar e onde aplicar cada tipo

      Só entram ferramentas gratuitas — nada aqui exige pagamento. Para cada um dos sete tipos: o caminho para baixar, o passo a passo de uso e onde ele brilha.

      Ranking de qualidade

      Do melhor ao pior — e no que cada um é melhor

      Uma nota de curadoria de 0 a 100 por categoria, com os pontos fortes e fracos de cada item em uma linha. Não é um benchmark oficial: é uma opinião prática para você decidir rápido. Um dataset não compete com um runtime — compare sempre dentro da mesma categoria.

      Carregando…

        Como a nota é calculada: capacidade e resultados (peso maior), maturidade do projeto, custo, privacidade e apoio da comunidade. Os badges “Melhor em” e “Perde em” resumem o que cada item faz bem e onde ele decepciona — por exemplo, o Qwen 3 é forte em programação, raciocínio e português, mas não gera imagem nem vídeo.

        Comparação lado a lado

        Duas ou três ferramentas, critério por critério

        Selecione até três fichas no catálogo (botão “+ comparar”) e a tabela abaixo se monta sozinha — com licença, requisitos, custo e nota de facilidade.

        Sem jargão

        Glossário rápido de IA

        Os termos que aparecem em toda documentação, explicados em três linhas cada.

        Continue sozinho

        Listas, rankings, comunidades e newsletters

        Fontes que valem assinar ou marcar nos favoritos para acompanhar o ritmo do setor.

        Monitoramento automático

        Entrou ou saiu do open source? Aparece aqui

        O catálogo confere sozinho, no seu navegador, os repositórios e modelos listados — licença, arquivamento e disponibilidade — e ainda procura projetos, modelos e datasets em alta que ainda não estão na lista. Quando algo muda, a ficha afetada ganha um aviso.

        Carregando o histórico de verificações…

          A verificação roda no seu navegador — nada é enviado para servidores nossos — usando as APIs públicas do GitHub e do Hugging Face, a cada monitoramento.intervaloHoras horas (padrão: 6). Se as APIs atingirem o limite de requisições, a checagem é retomada de onde parou na próxima visita.

          Guia prático

          Como montar um assistente de voz com IA local

          Um assistente de voz local é um ciclo de quatro etapas: capturar o áudio, transcrever, pensar e falar. Cada etapa tem opções gratuitas no catálogo, e a qualidade final depende mais da transcrição e do hardware do que do modelo de linguagem.

          A transcrição transforma fala em texto e é a etapa que mais influencia o resultado: um erro aqui contamina tudo o que vem depois. As famílias de transcrição do catálogo são conhecidas por lidar bem com diferentes idiomas e sotaques.

          O modelo de linguagem é a etapa de raciocínio. Ele responde ao texto transcrito e pode ser um modelo pequeno, se o objetivo for conversa simples e respostas rápidas.

          A síntese de voz fecha o ciclo. O catálogo tem opções minúsculas que rodam só com CPU e outras mais leves ainda, pensadas para dispositivos modestos — a diferença entre elas está na naturalidade da fala.

          Ferramentas gratuitas do catálogo para este caso

          Whisper (OpenAI)

          Modelos de Linguagem · Áudio

          ★ 91

          Transcrição multilíngue robusta a sotaque e ruído, com versões que vão de muito leves a mais precisas.

          Onde roda
          Local (no seu PC)
          Preço
          Código aberto (grátis)
          Licença
          MIT
          Requisitos
          tiny: 1 GB de RAM. large: 10 GB ou GPU
          Nível
          Iniciante
          Ver ficha completa, como usar e alternativas →

          faster-whisper

          Modelos de Linguagem · Áudio

          ★ 88

          Mesma família de transcrição com execução mais rápida e uso menor de memória.

          Onde roda
          Local (no seu PC)
          Preço
          Código aberto (grátis)
          Licença
          MIT
          Requisitos
          small int8: ~1 GB de RAM. large-v3 int8: ~3 GB
          Nível
          Intermediário
          Ver ficha completa, como usar e alternativas →

          Kokoro TTS

          Modelos de Linguagem · Áudio

          ★ 87

          Síntese de voz natural em modelo minúsculo, funcionando apenas com CPU.

          Onde roda
          Local (no seu PC)
          Preço
          Código aberto (grátis)
          Licença
          Apache 2.0
          Requisitos
          ~500 MB de RAM em CPU; funciona sem GPU
          Nível
          Iniciante
          Ver ficha completa, como usar e alternativas →

          Piper TTS

          Modelos de Linguagem · Áudio

          ★ 83

          Síntese leve e offline, pensada para baixa latência e dispositivos embarcados.

          Onde roda
          Local (no seu PC)
          Preço
          Código aberto (grátis)
          Licença
          MIT (software); vozes com licenças próprias
          Requisitos
          Raspberry Pi 4 com 2 GB de RAM
          Nível
          Intermediário
          Ver ficha completa, como usar e alternativas →

          Ollama

          Runtimes & Frameworks · Runtime local

          ★ 95

          Runtime local que executa o modelo responsável por entender e responder.

          Onde roda
          Local (no seu PC)
          Preço
          Código aberto (grátis)
          Licença
          MIT
          Requisitos
          8 GB de RAM para modelos 7B/8B em Q4; GPU opcional
          Nível
          Iniciante
          Ver ficha completa, como usar e alternativas →

          Qwen 3 (Alibaba)

          Modelos de Linguagem · LLM de texto

          ★ 95

          Modelo generalista para a etapa de raciocínio, com bom desempenho em português.

          Onde roda
          Local (no seu PC)
          Preço
          Código aberto (grátis)
          Licença
          Apache 2.0 (maioria dos tamanhos)
          Requisitos
          0.6B–4B: 1–3 GB de RAM. 32B: ~20 GB. 235B MoE: servidor
          Nível
          Intermediário
          Ver ficha completa, como usar e alternativas →

          ElevenLabs API

          APIs de IA · Voz e áudio

          ★ 90

          Alternativa em nuvem com camada grátis, para quando a naturalidade da voz importa mais que a privacidade.

          Onde roda
          Nuvem (API ou site)
          Preço
          Grátis com limites (camada grátis)
          Licença
          Proprietária — tier gratuito com atribuição
          Requisitos
          Qualquer máquina com internet
          Nível
          Iniciante
          Ver ficha completa, como usar e alternativas →

          Como escolher

          Priorize a transcrição
          É a etapa que mais afeta o resultado. Escolha uma família de transcrição antes de decidir o modelo de linguagem.
          Dimensione a síntese pelo dispositivo
          Há opções de voz que rodam em hardware mínimo e opções mais naturais. Se o alvo é um dispositivo pequeno, comece pelas leves.
          Aceita a latência do ciclo completo?
          Transcrever, pensar e falar leva tempo. Modelos de raciocínio tornam o ciclo bem mais longo — para conversa, prefira respostas diretas.
          Local ou nuvem para a voz?
          Voz local mantém o áudio privado e funciona offline; a nuvem com camada grátis costuma soar mais natural. O catálogo registra login e limites de cada API.
          Comece com um botão, não com ativação por palavra
          O fluxo mais simples é gravar, transcrever e responder. Ativação por voz adiciona complexidade e pode vir depois.

          Prós e limitações

          Os pontos abaixo vêm da curadoria do catálogo — a nota de qualidade (0–100) e os itens “melhor em” e “perde em” registrados para cada ferramenta. Não são medições de benchmark.

          Whisper (OpenAI)

          Pontos fortes

          • Transcrição multilíngue (português incluído)
          • Robustez a sotaque e ruído

          Limitações

          • Velocidade em hardware modesto
          • Não separa quem falou (diarização)

          faster-whisper

          Pontos fortes

          • Transcrição rápida e barata
          • Rodar em CPU

          Limitações

          • Recursos novos chegam com atraso
          • Não separa quem falou

          Kokoro TTS

          Pontos fortes

          • Voz natural em modelo minúsculo (82M)
          • Fala offline e rápida

          Limitações

          • Número de idiomas limitado
          • Controle fino de emoção

          Piper TTS

          Pontos fortes

          • TTS leve para Raspberry Pi e offline
          • Baixa latência em tempo real

          Limitações

          • Naturalidade da voz
          • Idiomas e sotaques disponíveis

          Ollama

          Pontos fortes

          • Rodar LLM local com um comando
          • Primeiro contato com modelos abertos

          Limitações

          • Throughput abaixo do vLLM em produção
          • Recursos avançados de serving

          Qwen 3 (Alibaba)

          Pontos fortes

          • Programação e código
          • Raciocínio e matemática
          • Português e multilíngue

          Limitações

          • Geração de imagem ou vídeo
          • Modelos grandes pedem GPU forte

          ElevenLabs API

          Pontos fortes

          • Vozes sintéticas mais naturais
          • Clonagem de voz multilíngue

          Limitações

          • Custo por caractere
          • Uso indevido exige cuidado ético

          Perguntas frequentes

          Dá para montar um assistente de voz sem GPU?
          Sim. As opções de transcrição e de síntese catalogadas incluem modelos que rodam em CPU, inclusive em dispositivos modestos.
          Qual etapa é mais difícil?
          A transcrição é a mais determinante: erros nela afetam a resposta do modelo. Por isso vale escolher a família de transcrição com cuidado.
          O assistente funciona offline?
          Sim, quando transcrição, modelo e síntese rodam localmente. Depois de baixar os modelos, o ciclo não depende de internet.
          Modelos de raciocínio são indicados para voz?
          Eles respondem mais devagar, o que deixa a conversa arrastada. Para voz, modelos generalistas e diretos costumam ser mais confortáveis.

          Veja a receita “Assistente de Voz”

          O catálogo traz uma receita pronta de assistente de voz que monta as peças no montador de stack, com os requisitos de hardware estimados.

          Abrir o montador de stack →