Apple entwickelt KI für Bildunterschriften, die größere Modelle schlägt
Apple-Forschende haben ein neues Verfahren zum Trainieren von KI-Modellen für Bildunterschriften vorgestellt. Das System liefert detailliertere Beschreibungen bei deutlich kleinerer Modellgröße.
Neues RubiCap-Verfahren für dichte Bildunterschriften
In der Studie „RubiCap: Rubric-Guided Reinforcement Learning for Dense Image Captioning“ arbeiten Apple-Forschende gemeinsam mit der University of Wisconsin–Madison an einem neuen Rahmenwerk für dichte Bildbeschreibungen. Das Team erreicht damit laut eigener Aussage den aktuellen Stand der Technik in mehreren Benchmark-Tests.
Bei dichter Bildbeschreibung geht es darum, nicht nur eine allgemeine Zusammenfassung eines Bildes zu erzeugen. Stattdessen werden mehrere Bereiche und Objekte identifiziert und jeweils mit einer eigenen, möglichst präzisen Beschreibung versehen.
So entsteht ein viel detaillierteres Verständnis der Szene, als es eine einzelne, globale Bildunterschrift bieten könnte. Beispiele dafür finden sich im ursprünglichen Stanford-Papier „DenseCap: Fully Convolutional Localization Networks for Dense Captioning“.
Dichte Bildunterschriften lassen sich etwa für das Training von Bild-Text- und Text-zu-Bild-Modellen nutzen. In Anwendungen für Nutzer:innen können sie die Bildsuche verbessern oder Funktionen zur Barrierefreiheit unterstützen.
Nach Einschätzung der Forschenden stoßen bisherige, KI-basierte Ansätze beim Training solcher Modelle jedoch an Grenzen. Menschliche Expert:innen für die Erstellung hochwertiger Annotationsdaten sind teuer, synthetische Beschriftungen durch leistungsstarke Bild-Text-Modelle bieten oft zu wenig Vielfalt und verallgemeinern schlecht. Verstärkungslernen könnte diese Probleme lösen, verlangt aber normalerweise prüfbare Aufgaben mit klaren, deterministischen Kontrollen, die es bei offenen Bildbeschreibungen nicht gibt.
So funktioniert RubiCap im Detail
Um diese Einschränkungen zu adressieren, schlagen die Forschenden mit RubiCap einen neuen Ansatz vor. Sie ziehen dafür 50.000 zufällig ausgewählte Bilder aus den Trainingsdatensätzen PixMoCap und DenseFusion-4V-100K heran.
Zu jedem Bild erzeugt das System mehrere Beschriftungsvorschläge mit bestehenden Bild-Text-Modellen, darunter Gemini 2.5 Pro, GPT-5, Qwen2.5-VL-72B-Instruct, Gemma-3-27B-IT und Qwen3-VL-30B-A3B-Instruct. Parallel dazu erstellt das zu trainierende RubiCap-Modell seine eigene Bildbeschreibung.
Anschließend nutzt RubiCap Gemini 2.5 Pro für drei Schritte: Das Modell analysiert Bild und Kandidatenunterschriften gemeinsam, ermittelt Übereinstimmungen sowie fehlende oder falsch dargestellte Details und leitet daraus klare Bewertungsmaßstäbe für die Qualität der Bildbeschreibungen ab.
Darauf aufbauend übernimmt Qwen2.5-7B-Instruct die Rolle der Bewertungsinstanz. Es vergibt anhand der definierten Kriterien Punktwerte für die einzelnen Beschriftungen und erzeugt so das Belohnungssignal für das Verstärkungslernen.
Auf diese Weise erhält das Modell strukturiertes Feedback dazu, was verbessert werden muss, ohne dass eine einzelne „richtige“ Antwort vorgegeben wird. Das führt laut Studie zu präziseren, konsistenteren Bildunterschriften.
Kleine RubiCap-Modelle schlagen deutlich größere Konkurrenz
Am Ende der Arbeit stehen drei Modelle: RubiCap-2B, RubiCap-3B und RubiCap-7B mit jeweils 2, 3 und 7 Milliarden Parametern. In Vergleichstests übertreffen sie andere Ansätze, darunter Modelle mit bis zu 72 Milliarden Parametern.
Auf dem Benchmark CapArena erreicht RubiCap laut Studie die höchsten Erfolgsraten und lässt überwachte Distillation, frühere RL-Methoden, Annotationen von Expert:innen und mit GPT-4V erweiterte Ausgaben hinter sich. Auf CaptionQA zeigt sich zudem eine hohe Worteffizienz: Das 7B-Modell erreicht das Niveau von Qwen2.5-VL-32B-Instruct, das 3B-Modell liegt vor dessen 7B-Variante.
Bemerkenswert ist der Hinweis der Forschenden, dass ein kompaktes RubiCap-3B-Modell als Beschriftungssystem zu stärkeren vortrainierten Bild-Text-Modellen führen kann als Bildunterschriften proprietärer Systeme. In einer Blindbewertung erzielt RubiCap-7B den höchsten Anteil an Erstplatzierungen über alle Modelle inklusive 72B- und 32B-Varianten und weist zugleich die geringste Halluzinationsstrafe bei hoher Genauigkeit auf.
Weitere Beispiele für Bildunterschriften im Vergleich zu Qwen2.5-VL-7B-Instruct sowie technische Details zum Verfahren findet Ihr in der vollständigen Studie auf der Apple-Seite zum maschinellen Lernen.
Via: https://9to5mac.com