Kritikalität bei unähnlicher Zerlegung und Unterabtastung von zufälligen Datensätzen mit Anomalien
arXiv:2609.13201v1 Ankündigungstyp: neu Zusammenfassung: Trainingsdatensätze für kommende LLMs würden eine erhebliche Menge an AI-Text-/Bilddaten enthalten, die von aktuellen LLMs generiert wurden. In solch einem Szenario ist es wichtig zu verstehen, wie dies Batch-Zerlegungen und damit die Leistung der resultierenden Modelle beeinflusst…