In this work, we target Handwritten Text Recognition (HTR) in low-resource scenarios, which arise from underrepresented languages, rare scripts, and degraded visual conditions typical of historical documents. We introduce SCAM (Sahidic Coptic Ancient Manuscripts), a new line-level dataset built from digitized ancient manuscripts written in the extinct Sahidic Coptic dialect. The dataset reflects a realistic and challenging setting, as it combines heterogeneous acquisition conditions across libraries with typical manuscript degradations such as ink fading, bleed-through, and material deterioration. In addition to visual complexity, SCAM poses significant linguistic challenges due to the scarcity of resources for Sahidic Coptic, its uncommon alphabet, and dialect-specific diacritics. To support research in low-resource HTR, we benchmark several state-of-the-art approaches based on different paradigms, highlighting their limitations and strengths in this setting. Our results underline the gap between current HTR performance on well-resourced modern scripts and historically grounded, low-resource scenarios, thus providing a reference point for future developments.

A Text Recognition Dataset from Sahidic Coptic Ancient Manuscripts / Quattrini, F., Zaccagnino, C., Bianchi, C., Cascianelli, S., Cucchiara, R.. - (2026). (20th International Conference on Document Analysis and Recognition, ICDAR 2026 Vienna, AUSTRIA AUG 30-SEP 04, 2026).

A Text Recognition Dataset from Sahidic Coptic Ancient Manuscripts

Fabio Quattrini;Carmine Zaccagnino;Costanza Bianchi;Silvia Cascianelli;Rita Cucchiara
2026

Abstract

In this work, we target Handwritten Text Recognition (HTR) in low-resource scenarios, which arise from underrepresented languages, rare scripts, and degraded visual conditions typical of historical documents. We introduce SCAM (Sahidic Coptic Ancient Manuscripts), a new line-level dataset built from digitized ancient manuscripts written in the extinct Sahidic Coptic dialect. The dataset reflects a realistic and challenging setting, as it combines heterogeneous acquisition conditions across libraries with typical manuscript degradations such as ink fading, bleed-through, and material deterioration. In addition to visual complexity, SCAM poses significant linguistic challenges due to the scarcity of resources for Sahidic Coptic, its uncommon alphabet, and dialect-specific diacritics. To support research in low-resource HTR, we benchmark several state-of-the-art approaches based on different paradigms, highlighting their limitations and strengths in this setting. Our results underline the gap between current HTR performance on well-resourced modern scripts and historically grounded, low-resource scenarios, thus providing a reference point for future developments.
2026
14-giu-2026
20th International Conference on Document Analysis and Recognition, ICDAR 2026
Vienna, AUSTRIA
AUG 30-SEP 04, 2026
Quattrini, Fabio; Zaccagnino, Carmine; Bianchi, Costanza; Cascianelli, Silvia; Cucchiara, Rita
A Text Recognition Dataset from Sahidic Coptic Ancient Manuscripts / Quattrini, F., Zaccagnino, C., Bianchi, C., Cascianelli, S., Cucchiara, R.. - (2026). (20th International Conference on Document Analysis and Recognition, ICDAR 2026 Vienna, AUSTRIA AUG 30-SEP 04, 2026).
File in questo prodotto:
Non ci sono file associati a questo prodotto.
Pubblicazioni consigliate

Licenza Creative Commons
I metadati presenti in IRIS UNIMORE sono rilasciati con licenza Creative Commons CC0 1.0 Universal, mentre i file delle pubblicazioni sono rilasciati con licenza Attribuzione 4.0 Internazionale (CC BY 4.0), salvo diversa indicazione.
In caso di violazione di copyright, contattare Supporto Iris

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/11380/1414429
Citazioni
  • ???jsp.display-item.citation.pmc??? ND
  • Scopus ND
  • ???jsp.display-item.citation.isi??? ND
  • OpenAlex ND
social impact