GROBID para acervo científico
Parse de papers acadêmicos: metadados, citações e referências
- Memória de vídeo
- 4 GB
- Instalação
- ~3 min
- Acesso
- porta 8070
- Cobrança
- por hora, em reais
O GROBID lê um PDF de artigo e devolve XML estruturado: título, autores, filiação, resumo, seções e a lista de referências separada uma a uma. É a base de qualquer revisão sistemática automatizada.
GROBID extrai dados estruturados de papers científicos (TEI XML): cabeçalho, autores, abstract, seções, fórmulas, citações e referências bibliográficas. Padrão na indústria acadêmica (CERN, Inria, Allen AI).
Para que serve
- Revisão sistemática: extrair e cruzar centenas de artigos
- Montar base de citações para análise bibliométrica
- Alimentar um RAG acadêmico com texto já seccionado
- Processar acervo interno sem enviar PDF a serviço externo
Como subir
- Crie sua conta e adicione saldo em reais (Pix ou cartão, sem mensalidade).
- No console, escolha o template GROBID e a máquina — o próprio console esconde as que não atendem ao requisito.
- Em cerca de 3 minutos a instalação termina e o endereço de acesso aparece no painel, na porta 8070.
Terminou? Basta destruir a máquina: a cobrança para junto. Nada de contrato ou franquia mínima.
Perguntas frequentes
Precisa de GPU?
Ajuda nos modelos de aprendizado profundo, mas o volume é o que manda. Uma placa de entrada já acelera bastante o lote.
Qual formato ele devolve?
TEI XML, padrão em humanidades digitais e fácil de converter em JSON.
Dá para chamar em lote?
Sim, o serviço expõe API HTTP e aguenta processar milhares de PDFs em fila.