← MDifying, conversor de documentos para Markdown
Artigos são os documentos mais difíceis de converter bem deste site, e vale ser honesto. Um preprint moderno com camada de texto real sai limpo. Um PDF de revista em duas colunas de 2003, digitalizado do papel, não — e saber qual dos dois você tem antes de colar num modelo poupa uma hora de confusão.
Converta um arquivo agora — é grátis e roda no seu navegador
Tente selecionar uma frase no seu leitor de PDF. Se o texto marcar, converte direto. Se nada selecionar, a página é uma foto de papel e você precisa da rota de OCR abaixo.
Os títulos de seção devem sair como títulos e as tabelas como tabelas. Cabeçalhos corridos e números de página são removidos sozinhos, então o nome da revista não se repete quarenta vezes.
Quando um PDF não tem texto para extrair, o MDifying oferece lê-lo a partir das imagens das páginas. Isso também roda na sua máquina. Reconhece inglês e espanhol, é mais lento, e é aproximado — confira o resultado contra o original antes de citar qualquer coisa.
Referências, agradecimentos e afiliações costumam ser ruído para o que você vai perguntar. Cortar isso leva segundos num editor e devolve janela de contexto.
Layouts de duas colunas são o ponto fraco honesto. As linhas são agrupadas pela posição vertical, então um artigo em duas colunas pode entrelaçar as colunas num texto sem sentido. Se acontecer, o resultado está obviamente errado e não sutilmente errado — que pelo menos é uma falha visível. Equações e figuras também não são reconstruídas; as palavras ao redor, sim.
Trabalho não publicado, material sob embargo, e qualquer coisa coberta por um acordo de dados. Como a conversão roda no seu navegador, o arquivo nunca chega a um servidor — nem ao nosso nem ao de ninguém — o que é uma posição bem diferente da de um conversor que sobe e apaga em trinta dias.