Das Signal im Rauschen: Eine prüfbare Zuverlässigkeitsschicht für biomedizinische Textklassifizierung

arXiv:2608.28595v1 Ankündigungstyp: neu Abstract: Biomedizinische NLP-Pipelines setzen routinemäßig saubere Eingabetexte voraus, doch großangelegte Korpora, die durch automatisiertes PDF-Parsing zusammengestellt wurden, enthalten weit verbreitete OCR-ähnliche Artefakte, Token-Splits und Merges, Trennstrich-Relikte und Zeichen-Korruption, die