Voici comment extraire du texte avec Spectacle, l'outil de capture d'écran de KDE.

  • Spectacle peut extraire du texte de Plasma 6.6, mais pas par défaut.
  • Les modules OCR Tesseract doivent être installés.

Extraction de texte avec Spectacle

Depuis février dernier, coïncidant avec le lancement de Plasma 6.6, Spectacle Il peut extraire du texte à partir de captures d'écran. Cette fonctionnalité est connue sous le nom de reconnaissance optique de caractères (OCR). Cependant, elle n'est pas activée par défaut, et vous vous demandez peut-être pourquoi vous ne voyez pas cette option même après la mise à jour vers la dernière version, actuellement Plasma 6.6.5.

La raison est simple : les paquets nécessaires sont manquants. Ce problème se pose également avec l’option permettant de scanner un code QR pour accéder à un réseau Wi-Fi, mais ce sujet sera traité dans un autre article. Nous allons nous contenter de l’expliquer ici. Comment activer la prise en charge OCR dans Spectacle, à condition que vous utilisiez Plasma 6.6 ou une version ultérieure.

Activez la prise en charge de la reconnaissance optique de caractères (OCR) dans Spectacle si vous utilisez Plasma 6.6 ou une version ultérieure.

Lorsque nous prenons une capture d'écran après la mise à jour, nous constatons que l'option d'extraction de texte n'apparaît pas, contrairement à ce qui est indiqué dans les instructions. notes de versionIl existe même une vidéo d'exemple :

Si nous ouvrons Spectacle et accédons à ses paramètres, nous constatons que dans la section OCR, une icône en forme de « i » est censée fournir des informations supplémentaires. Or, elle indique simplement que cette fonctionnalité n'est pas disponible.

OCR non disponible

Spectacle est capable d'extraire du texte via son interface, mais la magie opère grâce à... Tesseract OCRCeci est courant dans les logiciels utilisés par les systèmes Linux : de nombreux programmes sont frontendmais ils dépendent de quelque chose backend Laissez-le faire le travail.

Pour faire disparaître le message de la capture d'écran précédente et le remplacer par les options de reconnaissance optique de caractères (OCR), il faut installer les paquets Tesseract nécessaires. Dans mon cas, avec une distribution basée sur Arch comme Manjaro, les paquets requis sont :

  • tesseract
  • tesseract-data-osd
  • tesseract-data-cat
  • tesseract-data-eng
  • tesseract-data-spa

Paquets Tesseract

Parmi les paquets ci-dessus, ceux qui se terminent par -cat, -eng et -spa sont les langues que je souhaite qu'il détecte (catalan, puisque je suis originaire de l'est de l'Espagne, anglais et espagnol). tesseract Il s'agit du paquet principal, et l'extension -osd permet au logiciel de détecter l'orientation d'écriture, ce qui, en théorie, lui permettra de détecter le texte même s'il est pivoté de 90°, par exemple.

C'est clair, mais il est bon de le rappeler : si quelqu'un a besoin de langues supplémentaires, il lui suffit d'installer les paquets correspondants. Par exemple, l'extension -ita pour l'italien, -fra pour le français ou -rus pour le russe.

Installation de ce qui est nécessaire

L'installation sur différentes distributions dépendra de la distribution en question. Dans le cas de Manjaro, elle peut se faire avec Pamac (son outil graphique de gestion des paquets), mais aussi avec… sudo pacman -S tesseract tesseract-data-osd tesseract-data-cat tesseract-data-eng tesseract-data-spaDans d'autres distributions, telles que celles basées sur Debian ou openSUSE, le paquet peut être tesseract-ocr.

Après avoir installé les paquets, vous verrez l'option permettant de faire une capture d'écran, comme indiqué dans la capture d'écran d'en-tête et le tutoriel vidéo KDE. Cliquer sur « Extraire le texte » affichera une notification vous permettant de copier le texte dans le presse-papiers ou de l'ouvrir dans un éditeur de texte.

Remarque : Vous devez activer les langues dans les paramètres

Lorsque l'option devient disponible, les paramètres changent également. Le message indiquant son indisponibilité est remplacé par la section « Reconnaissance de texte (OCR) ». Cette section ne comporte que deux parties :

  • Sélection de la langue : par cases à cocher. Nous allons sélectionner les langues à partir desquelles nous souhaitons extraire du texte. C’est également un bon moyen de voir quelles langues sont installées et lesquelles sont prises en charge.
  • Fermer le fichier après l'extraction empêche la sauvegarde automatique. C'est une question de préférence personnelle, mais j'ai désactivé cette option. Ainsi, le fichier est toujours copié dans le presse-papiers.

C'est une procédure simple, mais elle n'est pas activée par défaut. En installant quelques paquets, Spectacle pourra alors « lire ».


Ajouter comme source préférée