Custom semantic representation ("bryła") beats raw text in 24/27 configs — built solo on an RTX 2060, looking for feedback
Update: sześć nowych eksperymentów, skrypty i dzienniki w repo
Od ostatniego wpisu zrobiłem sześć eksperymentów — każdy z pomiarem na wielu seedach, przedziałami ufności, sekcją “czego NIE twierdzę” i komendą do odtworzenia. Pełne dzienniki pomiarowe (metoda, wyniki, granice, reprodukcja) leżą w repo jako diary_01 do diary_06. Tu skrót.
1. Enkoder audio: MFCC → HuBERT — word 52% → 91% standalone, fuzja 48.4 → 79.3% (+30.9pp). Jedna zmienna, CI rozłączne. Kanał audio był hamulcem, nie nośnik.
2. Odczyt emocji: keyword → embedding CLAP — bug _infer_emotion, o którym pisałem, naprawiony i zmierzony. 8-way: 29.6% vs los 12.5% (CI rozłączne, twarde). 3-way NIE domyka (CI obejmuje los) — udokumentowane. Pierwsza wersja fiksu przegrała z losem; dźwignią okazał się ensemble promptów, nie kalibracja.
3. Kotwice: dwukanałowa pamięć — pierwotna motywacja bryły, wreszcie zmierzona. Dual (bazowy 16 + bieżący 112) trzyma fakt bazowy w 100% ±0.0 niezależnie od długości strumienia (T=500–4000). Protected buffer: 72%. Recency: 0%. Firewall działa. Złożony retrieval (baza I bieżący naraz) konsekwentnie najwyższy dla dual, ale CI szerokie — twarde twierdzenie tylko o bazie. Bez LLM, sam retrieval.
4. Ranking ścian jest KORPUSO-ZALEŻNY — ta sama eliminacja wsteczna na korpusie matematycznym vs technicznym: ATT spada z 1. na 19., POL skacze z 20. na 2., DENSE z ostatniej na 7. Wniosek: NIE wolno odchudzać bryły globalnie. Tylko 4 ściany martwe wszędzie (SPK, MOD, ANCHOR_TIME, ANCHOR_REG). Reszta to “uśpiona na tym zadaniu”, nie “zbędna”.
5. Odporność: brakujące modalności — testowane na MOSEI (realne dane, speaker-split). Late-fusion bije concat od p=20% braków w górę, szczyt +1.4pp przy p=60%. zero-fill potwierdzony jako antywzorzec (40.5% przy p=90%, poniżej losu 63.2%). Przewaga skromna, bo na MOSEI tekst dominuje — ale kierunkowa, monotoniczna i na realnych danych.
6. Odporność: szum w kanale — ważenie pewnością OBALONE (szum produkuje fałszywą pewność, conf podbija wagę kłamcy — strata rośnie do −6.4pp przy σ=8). Odrzucenie outliera POTWIERDZONE (mediana trzyma ~73% płasko niezależnie od σ, +5.9pp nad uniform przy σ=8). Lekcja: pod szumem właściwe pytanie to “kto stoi w sprzeczności z konsensusem”, nie “kto najpewniejszy”.
Wzorzec z #5 i #6: late-fusion bryły nie jest lepsza wszędzie — jest lepsza konkretnie w bałaganie, i im większy bałagan, tym większa przewaga. Czyste dane → remis lub lekka strata.
Czego NIE twierdzę:
* Wyniki multimodalne na naturalnych danych (poza #5 MOSEI). Reszta to kontrolowany/syntetyczny PoC.
* Kotwice działają z LLM (testowany sam retrieval, nie generacja).
* 3-way emocja domyka (nie domyka — CI obejmuje los).
Wszystkie skrypty testowe leżą w repo — generują własny syntetyk albo używają publicznych zbiorów (SpeechCommands, CIFAR-10, RAVDESS, MOSEI). Parser nie jest potrzebny do reprodukcji. Dzienniki: diary_01 do diary_06.
huggingface.co
### krzysiekpl/bryla-kris · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Jak zawsze — nie wierzcie mi na słowo, odpalcie sami.