Das Preprint ReDraft (arXiv, 15. September 2026) misst auf Counting, Clock Reading und Jigsaw mit Qwen2.5-VL 3B und 7B, dass das Modell durch die Überarbeitung seines eigenen fehlerhaften Rollouts, mit der Expertenantwort als Referenz und einem Verifikator als Filter, 56,9 Punkte auf der neuen Aufgabe gewinnt und 1,5 auf den vorherigen verliert, gegenüber 52,9 und 16,6 bei SFT. Die Evidenz deutet darauf hin, dass Forgetting vom Abstand zwischen Target und Policy abhängt, mit einem auf synthetische, verifizierbare Aufgaben beschränkten Rahmen.