Ir para o conteúdo

TranscriptionSuite: Transcrição de Áudio Local e Privada

Visão geral

TranscriptionSuite é uma solução de transcrição de áudio que prioriza a privacidade ao processar todo o conteúdo localmente, sem enviar dados para serviços externos. Sua arquitetura híbrida combina uma interface Electron amigável com um backend Python robusto, permitindo aos usuários realizar transcrições longas ou em tempo real com alta precisão.

Funcionalidades principais

Modo Audio Notebook

O Audio Notebook mode transforma gravações em notas interativas, onde é possível destacar trechos, adicionar comentários e exportar o resultado em diversos formatos. Essa funcionalidade é útil para entrevistas, aulas e reuniões.

Dica

Use marcadores de tempo dentro do notebook para voltar rapidamente a trechos específicos da gravação.

Diarização de falantes

Com a speaker diarization, o aplicativo identifica e rotula automaticamente diferentes falantes no mesmo áudio, facilitando a análise de conversas multi‑participantes.

Observacao

A precisão da diarização depende do modelo de STT escolhido e da qualidade do áudio de entrada.

Integração com LM Studio

TranscriptionSuite se integra ao LM Studio, possibilitando que modelos de linguagem grandes sejam carregados localmente e utilizados para tarefas como resumo de transcrições, geração de atas ou resposta a perguntas sobre o conteúdo falado.

Backends de STT

O backend Python oferece suporte a vários motores de reconhecimento de fala: - Whisper (modelo open‑ai) - NVIDIA NeMo (otimizado para GPUs NVIDIA) - **Vibe

Ferramentas e Tecnologias

  • [[Electron]]
  • [[Python]]
  • [[Whisper]]
  • [[NVIDIA NeMo]]
  • [[VibeVoice-ASR]]
  • [[Docker]]
  • [[CUDA]]
  • [[Metal]]
  • [[Vulkan]]
  • [[LM Studio]]

Nota pessoal

https://github.com/homelab-00/TranscriptionSuite

Tags

speech-to-text #transcription #speaker-diarization #local-ai #docker