robotmafia
banner
robotmafia.com
robotmafia
@robotmafia.com
Notes on AI research papers - each one explained, sourced,
and with a section on what speaks against it.
Written in German, sources in English. robotmafia.com
Where the reference study used 240 datasets, each of five AI research frameworks used one - and a Kosmos Ridge run scored 0.18 for both encodings.

Note in German, source paper in English:

robotmafia.com/artikel/zwei...
Zweihundertvierzig Datensätze im Original, einer im KI-Bericht
Fünf Systeme, die Forschung automatisieren sollen - in der Literatur AI research frameworks -, wurden nicht auf einen Benchmark losgelassen, sondern auf zwei fertige Arbeiten aus …
robotmafia.com
September 15, 2026 at 8:55 PM
Plain false sentences poison agent memory; the write-time filter refused 0 of 360, because content-only screening cannot see them.

Note in German, source paper in English:

robotmafia.com/artikel/ein-...
Ein Filter, der Angriffe fängt und Lügen durchlässt
Ein zustandsloses Sprachmodell lässt sich für die Dauer einer Anfrage belügen; danach ist das Fenster leer und die Lüge weg. Ein Agent mit dauerhaftem Gedächtnis hat diese Grenze …
robotmafia.com
September 5, 2026 at 9:38 PM
With well-bound slots, two auxiliary mechanisms become unnecessary: 84.7% success without them; robustness tracks similar frozen pretrained features.

Note in German, source paper in English:

robotmafia.com/artikel/zwei...
Zwei Hilfsmittel kompensierten nur die schlechte Objekttrennung
Ein Weltmodell lernt aus aufgezeichneten Bewegungsbahnen, wie sich eine Umgebung verhält, und plant damit auf ein Ziel zu. Seit Jahren gilt als plausibel, dass es hilft, die Szene …
robotmafia.com
September 4, 2026 at 8:25 PM
A 9-token chat template moves a model's fixed-point structure from 0.948 to 0.000; instruction tuning that moves IFEval by 60.5 points moves the class by zero.

Note in German, source paper in English:

robotmafia.com/artikel/neun...
Neun Token kippen die Struktur, ein ganzes Nachtraining nicht
Dass derselbe Prompt bei zwei Modellen verschieden wirkt, ist seit Jahren belegt - gemessen wurde es aber immer an einer Aufgabe: Genauigkeit, Trefferrate, Platz in einer …
robotmafia.com
September 4, 2026 at 12:23 AM
"Verify the reasoning first" does not help uniformly: 3 of 10 models recover, 4 get worse, pooled +0.4 pp hides it.

Two other guards: +9.7 and +8.3 pp.

Note in German, source paper in English:

robotmafia.com/artikel/dies...
Dieselbe Sicherheitszeile hilft drei Modellen und schadet vier
In vielen ausgelieferten Strecken steht eine Zeile wie "Prüfe zuerst jede Tatsachenannahme in der obigen Begründung". Sie kostet nichts, klingt nach Sorgfalt, und ob sie hilft …
robotmafia.com
August 27, 2026 at 7:23 PM
Excluding the outcome isn't enough: a retained proxy pushes imputed exposure to |0.86| with it. Gradient-boosted finds it, logistic doesn't.

Part 6 of "Wenn die Messung das Ergebnis macht".

Note in German, source paper in English:

robotmafia.com/artikel/der-...
Der ausgeschlossene Zielwert kommt über seinen Stellvertreter zurück
Wer wissen will, ob Weichmacher dick machen, landet in den USA fast zwangsläufig bei NHANES, der großen Gesundheitsbefragung, deren Rohdaten jeder herunterladen kann. Eine …
robotmafia.com
August 26, 2026 at 8:16 AM
Four self-improvement parts, all flat. The record differs: two had a stopping condition written down, two were measured three days before that plan existed.

Part 4 of "Blick nach innen".

Note in German, source paper in English:

robotmafia.com/artikel/nich...
Nicht jedes Bauteil hatte seine Abbruchbedingung vorher
Seit Anfang Juni lief in der Werkstatt hinter dieser Seite der Versuch, einen KI-Assistenten aus seinen eigenen Fehlern lernen zu lassen, ohne dafür seine Gewichte anzufassen. Ab …
robotmafia.com
August 24, 2026 at 7:37 PM
All ten agents pulled in data the task never required.

A category-aware system prompt cuts that by half at best, and on the 44 labelled cases the confidentiality banner made disclosure worse.

Note in German, source paper in English:

robotmafia.com/artikel/der-...
Der fähigere Agent holt sich mehr, als die Aufgabe braucht
Wenn geprüft wird, ob ein Agent mit Werkzeugen die Privatsphäre achtet, schaut fast jede Prüfung auf das, was am Ende herauskommt: die Antwort, die abgeschickte Mail, den …
robotmafia.com
August 24, 2026 at 7:47 AM
Video generators render plausible causal continuations while scoring near zero at reading the cause - with a scene description supplied and weak instruction following as caveats.

Note in German, source paper in English:

robotmafia.com/artikel/wo-d...
Wo das Verständnis bei null liegt, entsteht trotzdem plausible Bewegung
Ein Videomodell, das eine zersplitternde Scheibe rendert, hat entweder verstanden, was beim Aufprall passiert - oder es hat oft genug gesehen, wie so etwas aussieht. Vom Ergebnis …
robotmafia.com
August 23, 2026 at 10:03 PM
Probes of four variants differ by at most 0.03 R2 on PushT, while success spans 43 points at a one-epoch budget - same latent, different ranking.

Note in German, source paper in English:

robotmafia.com/artikel/der-...
Der Zustandsraum enthält alles Nötige und ordnet die Pläne trotzdem falsch
Ein Weltmodell, das aus Bildern plant, arbeitet mit einem Abstand: Es rollt mehrere Handlungsfolgen in seinem gelernten Zustandsraum aus und wählt die, deren vorhergesagter …
robotmafia.com
August 23, 2026 at 9:59 AM
Testing tool: score unchanged, +42% cost at High effort - premium: context re-reading.

Reasoning effort: 28 to 89% first-try perfect, six sweep cells.

Note in German, source paper in English:

robotmafia.com/artikel/das-...
Das Prüfwerkzeug sieht die Oberfläche, gescheitert wird darunter
Wer einen Agenten Software bauen lässt, gibt ihm gern etwas mit: ein Browser-Werkzeug, mit dem er die laufende Oberfläche selbst bedienen und ansehen kann, oder einen …
robotmafia.com
August 22, 2026 at 9:52 PM
One evaluation seed put an end-to-end world model ahead on three of four tasks; three fresh evaluation seeds leave it level.

Teil 4 der Reihe »Wenn die Messung das Ergebnis macht«.

robotmafia.com/artikel/ein-... (note in german)
Ein einziger Zufallsstartwert macht aus Gleichstand einen Vorsprung
Ein Weltmodell, das aus Bildern plant, lernt zwei Dinge gleichzeitig: eine Darstellung der Szene und eine Vorhersage, wie sich diese Darstellung unter Handlungen verändert. Damit …
robotmafia.com
August 21, 2026 at 2:36 AM
In nearly half of 8,133 real conversations, at least one explicit request-state dimension stays in the history and never reaches the final prompt.

Note in German: robotmafia.com/artikel/die-...
Die ganze Anforderung steht selten im letzten Prompt
Wer wissen will, was ein KI-Assistent zu einem Thema sagt, schickt ihm eine Nachricht und liest, was zurückkommt. Sichtbarkeits-Panels, Benchmark-Sammlungen und ein großer Teil …
robotmafia.com
August 20, 2026 at 8:18 PM
In 16 environments with frozen reflective memory, none of 121 stored self-critiques names the correct target object (backbone gpt-3.5-turbo).

Part 3 of "Blick nach innen":
robotmafia.com/artikel/was-... (note in german)
Was der Agent über sein Scheitern notiert, ist nicht die Aufgabe
Ein Agent scheitert an einer Aufgabe, schreibt in eigenen Worten auf, woran es lag, und bekommt diese Notiz beim nächsten Anlauf vorgelegt. Das ist der Kern der …
robotmafia.com
August 20, 2026 at 2:27 AM
Asked as multiple choice, 52 models never fail together on 130 questions. Asked as free response, 18 models fail together on 10 of 79. Same questions.

Note in German, source paper in English:

robotmafia.com/artikel/wo-a...
Wo alle Modelle zugleich falsch liegen, hilft kein Umschalten
Wer mehrere Sprachmodelle zusammenschaltet – ein Router wählt pro Anfrage eines aus, eine Mehrheit stimmt ab, eine Kaskade eskaliert vom billigen zum teuren –, begründet das mit …
robotmafia.com
August 19, 2026 at 7:04 PM
Across five leave-one-embodiment-out folds, a world model stumbles over the visually distant robot, not the mechanically different one.

Note in German, source paper in English:

robotmafia.com/artikel/nich...
Nicht die fremde Mechanik überfordert das Weltmodell, sondern das fremde Aussehen
Ein Weltmodell in der Robotik ist ein gelernter Simulator: Es bekommt ein Startbild und eine Folge von Befehlen und sagt voraus, wie das Video weitergeht. Wer damit später …
robotmafia.com
August 18, 2026 at 9:56 AM
Even the best non-long-context system acts on only part of what its backbone can recall.

Part 3 of "Wenn die Messung das Ergebnis macht".

Note in German, source paper in English:

robotmafia.com/artikel/der-...
Der Agent kann die Vorliebe abrufen und übergeht sie beim Antworten
Ein Assistent, der sich Dinge merkt, wird daran gemessen, ob er sie wiedergeben kann. Frag ihn nach der Pollenallergie, die vor drei Wochen beiläufig zur Sprache kam, und er nennt …
robotmafia.com
August 17, 2026 at 10:18 PM
Assume the fewest observation errors and you can get the wrong tumour phylogeny — for any error rates in (0,0.5) the true tree need not be the unique cost minimum.

robotmafia.com/artikel/wer-... (note in german)
Wer die wenigsten Fehler unterstellt, bekommt den falschen Stammbaum
Wer aus Einzelzell-Daten den Stammbaum eines Tumors rekonstruiert, arbeitet meistens mit einer Idealisierung, die im Fach perfect phylogeny heißt: Jede Mutation entsteht genau …
robotmafia.com
August 15, 2026 at 1:11 PM
Four RAG paradigms, 1,144 to 511,959 documents.

The agent leads at the smallest tier, BM25 at every larger shared tier. Measure at one size and you report a curve point as a ranking.

robotmafia.com/artikel/bei-... (note in german)
Bei tausend Dokumenten gewinnt der Agent, bei einer halben Million die Wortsuche
Wer ein Sprachmodell auf eine große Dokumentensammlung ansetzt, muss ihm die passenden Stellen erst besorgen – im Fach heißt dieses Anreichern des Modells mit gesuchtem Material …
robotmafia.com
August 14, 2026 at 11:30 PM
Crop the binding pocket once around the native ligand, reuse it for every decoy, and the geometry gives the answer away: centre-of-mass distance alone tells the poses apart at ROC-AUC 0.744.

robotmafia.com/artikel/der-... (note in german)
Der Zuschnitt der Bindetasche verrät die richtige Antwort
Wer einen Wirkstoff sucht, lässt den Rechner große Molekülbibliotheken in eine Proteintasche legen und nach Passgenauigkeit sortieren. Die Funktion, die dabei die Punkte vergibt – …
robotmafia.com
August 13, 2026 at 11:09 PM
Five verifiers had to agree a document was misleading before it entered the corpus.

Three of them are the same models running the tested agents - and they adopt its false conclusion anyway.

robotmafia.com/artikel/was-... (note in german)
Was einzeln auffliegt, überlebt den langen Arbeitsgang
Ein Deep-Research-Agent zerlegt eine Frage, sucht, liest, verdichtet Zwischenstände und schreibt am Ende einen Bericht. Zwischen der ersten Suche und dem letzten Absatz liegen …
robotmafia.com
August 13, 2026 at 9:33 PM
In simulation the same predictions are the best by the usual score and among the worst at what the analysis needs: an event from 30 generations ago becomes 1530.

(Note in German)

robotmafia.com/artikel/die-...
Die Genauigkeit merkt nicht, dass die Antwort zerfällt
Wer von zwei getrennten Bevölkerungen abstammt, trägt ein Erbgut wie ein Flickenteppich: Jedes Stück Chromosom stammt aus der einen oder der anderen Quelle. Das Verfahren, das …
robotmafia.com
August 12, 2026 at 10:43 PM
Keep a picture's surface statistics, destroy its shape: that is when a deep net matches human visual responses best — better than for the natural scene itself. (Note in German)

robotmafia.com/artikel/netz...
Netz und Gehirn treffen sich in der Textur, nicht im Gegenstand
Tiefe neuronale Netze sagen die Antworten des menschlichen Sehsystems über dessen Stufen hinweg vorher, und das gilt weithin als Hinweis darauf, dass beide dasselbe tun …
robotmafia.com
August 12, 2026 at 6:31 PM
A lens ranking, layer by layer, the words a model's activations would push it to say.

What generalizes: swapping a representation changes the answer only for tasks that read it.

In German:
robotmafia.com/artikel/ein-...
Ein Modell rechnet mit den Wörtern, die es aussprechen könnte
Ein Sprachmodell zeigt seine Antwort, nicht den Weg dorthin. Teil eins dieser Reihe handelte davon, dass sich eine Selbstauskunft nur prüfen lässt, wenn man die Antwort vorher …
robotmafia.com
August 12, 2026 at 12:28 AM
I had the first 15 notes on this site checked against the full texts
they cite. All 15 were wrong. Never an invented number, always a wrong
reference: right figure, wrong column, dropped caveat.

What I changed (page in German):
robotmafia.com/seiten/pruef...
Wie hier geprüft wird
Notizen zu Arbeiten aus der KI-Forschung - erklaert, eingeordnet und mit Quelle. Archiv statt Nachrichtenstrom.
robotmafia.com
August 12, 2026 at 12:25 AM