Class PdfExtractor
Représente le composant Documentize.PdfExtractor. Utilisé pour extraire du texte, des images, des données de formulaire, des propriétés (méta‑données) des documents PDF.
public static class PdfExtractorInheritance
Inherited Members
- object.GetType(),
- object.MemberwiseClone(),
- object.ToString(),
- object.Equals(object?),
- object.Equals(object?, object?),
- object.ReferenceEquals(object?, object?),
- object.GetHashCode()
Methods
Extract(ExtractTextOptions)
Extrait le texte d’un document PDF.
public static string Extract(ExtractTextOptions options)Parameters
optionsExtractTextOptions : Un objet d’options contenant les instructions pour l’opération.
Returns
string : Texte extrait.
Examples
L’exemple montre comment extraire le contenu texte d’un fichier PDF.
// Créez un objet ExtractTextOptions pour définir le chemin du fichier d’entrée
var options = new ExtractTextOptions("path_to_your_pdf_file.pdf");
// Exécutez le processus et récupérez le texte extrait
var textExtracted = PdfExtractor.Extract(options);L’exemple montre comment extraire le contenu texte d’un flux PDF.
// Créez un objet ExtractTextOptions pour définir le flux d’entrée
var stream = File.OpenRead("path_to_your_pdf_file.pdf");
var options = new ExtractTextOptions(stream);
// Exécutez le processus et récupérez le texte extrait
var textExtracted = PdfExtractor.Extract(options);L’exemple montre comment extraire le texte d’un document PDF avec TextFormattingMode.
// Créez un objet ExtractTextOptions pour définir le chemin du fichier d’entrée et le TextFormattingMode
var options = new ExtractTextOptions("path_to_your_pdf_file.pdf", TextFormattingMode.Pure);
// Exécutez le processus et récupérez le texte extrait
var textExtracted = PdfExtractor.Extract(options);L’exemple montre comment extraire le texte d’un fichier PDF dans le style le plus concis possible.
// Exécutez le processus et récupérez le texte extrait
var textExtracted = PdfExtractor.Extract(new ExtractTextOptions("path_to_your_pdf_file.pdf", TextFormattingMode.Pure));Exceptions
Si les options ne sont pas définies.
Extract(ExtractImagesOptions)
Extrait les images d’un document PDF.
public static ResultContainer Extract(ExtractImagesOptions options)Parameters
optionsExtractImagesOptions : Un objet d’options contenant les instructions pour l’opération.
Returns
ResultContainer : Un objet contenant le résultat de l’opération.
Examples
L’exemple montre comment extraire les images d’un document PDF.
// Créez un ExtractImagesOptions pour définir les instructions
var options = new ExtractImagesOptions();
// Ajoutez le chemin du fichier d’entrée
options.AddInput(new FileData("path_to_your_pdf_file.pdf"));
// Définissez le chemin du répertoire de sortie
options.AddOutput(new DirectoryData("path_to_results_directory"));
// Exécutez le processus
var results = PdfExtractor.Extract(options);
// Récupérez le chemin du résultat image
var imageExtracted = results.ResultCollection[0].ToFile();L’exemple montre comment extraire les images d’un document PDF vers des flux sans créer de dossier.
// Créez un ExtractImagesOptions pour définir les instructions
var options = new ExtractImagesOptions();
// Ajoutez le chemin du fichier d’entrée
options.AddInput(new FileData("path_to_your_pdf_file.pdf"));
// Aucun sortie définie – les résultats seront écrits dans des flux
// Exécutez le processus
var results = PdfExtractor.Extract(options);
// Récupérez le flux
var ms = results.ResultCollection[0].ToStream();
// Copiez les données vers un fichier pour la démonstration
ms.Seek(0, SeekOrigin.Begin);
using (var fs = File.Create("test_file.png"))
{
ms.CopyTo(fs);
}Exceptions
Si les options ne sont pas définies.
Extract(ExtractFormDataToDsvOptions)
Extrait les données de formulaire d’un document PDF.
public static ResultContainer Extract(ExtractFormDataToDsvOptions options)Parameters
optionsExtractFormDataToDsvOptions : Un objet d’options contenant les instructions pour l’opération.
Returns
ResultContainer : Un objet contenant le résultat de l’opération.
Examples
L’exemple montre comment exporter les valeurs du formulaire vers un fichier CSV.
// Créez un ExtractFormDataToDsvOptions pour définir les instructions
var options = new ExtractFormDataToDsvOptions(',', true);
// Ajoutez le chemin du fichier d’entrée
options.AddInput(new FileData("path_to_your_pdf_file.pdf"));
// Définissez le chemin du fichier de sortie
options.AddOutput(new FileData("path_to_result_csv_file.csv"));
// Exécutez le processus
PdfExtractor.Extract(options);L’exemple montre comment exporter les valeurs du formulaire vers un fichier TSV et définir les propriétés.
// Créez un ExtractFormDataToDsvOptions pour définir les instructions
var options = new ExtractFormDataToDsvOptions();
//Définir le délimiteur
options.Delimiter = '\t';
//Ajouter les noms de champs au résultat
options.AddFieldName = true;
// Ajoutez le chemin du fichier d’entrée
options.AddInput(new FileData("path_to_your_pdf_file.pdf"));
// Définissez le chemin du fichier de sortie
options.AddOutput(new FileData("path_to_result_csv_file.tsv"));
// Exécutez le processus
PdfExtractor.Extract(options);Exceptions
Si les options ne sont pas définies.
Extract(ExtractPropertiesOptions)
Extrait les propriétés d’un document PDF.
public static PdfProperties Extract(ExtractPropertiesOptions options)Parameters
optionsExtractPropertiesOptions : Un objet d’options contenant les instructions pour l’opération.
Returns
PdfProperties : Un objet contenant le résultat de l’opération.
Examples
L’exemple montre comment extraire les propriétés (FileName, Title, Author, Subject, Keywords, Created, Modified, Application, PDF Producer, Number of Pages) d’un fichier PDF.
// Créez un ExtractPropertiesOptions pour définir le fichier d’entrée
var options = new ExtractPropertiesOptions("path_to_your_pdf_file.pdf");
// Exécutez le processus et récupérez les propriétés
var pdfProperties = PdfExtractor.Extract(options);
var filename = pdfProperties.FileName;
var title = pdfProperties.Title;
var author = pdfProperties.Author;
var subject = pdfProperties.Subject;
var keywords = pdfProperties.Keywords;
var created = pdfProperties.Created;
var modified = pdfProperties.Modified;
var application = pdfProperties.Application;
var pdfProducer = pdfProperties.PdfProducer;
var numberOfPages = pdfProperties.NumberOfPages;L’exemple montre comment extraire les propriétés (Title, Author, Subject, Keywords, Created, Modified, Application, PDF Producer, Number of Pages) d’un flux PDF.
// Créez un ExtractPropertiesOptions pour définir le flux d’entrée
var stream = File.OpenRead("path_to_your_pdf_file.pdf");
var options = new ExtractPropertiesOptions(stream);
// Exécutez le processus et récupérez les propriétés
var pdfProperties = PdfExtractor.Extract(options);
var title = pdfProperties.Title;
var author = pdfProperties.Author;
var subject = pdfProperties.Subject;
var keywords = pdfProperties.Keywords;
var created = pdfProperties.Created;
var modified = pdfProperties.Modified;
var application = pdfProperties.Application;
var pdfProducer = pdfProperties.PdfProducer;
var numberOfPages = pdfProperties.NumberOfPages;L’exemple montre comment extraire les propriétés d’un fichier PDF dans le style le plus concis possible.
// Exécutez le processus et récupérez les propriétés
var pdfProperties = PdfExtractor.Extract(new ExtractPropertiesOptions("path_to_your_pdf_file.pdf"));Exceptions
Si les options ne sont pas définies.
Namespace: Documentize Assembly: Documentize.dll