"We are back" « oc.at

KI News und was dazu gehört

Kirby 30.01.2025 - 22:57 28613 168 Thread rating
Posts

mat

Administrator
Legends never die
Avatar
Registered: Aug 2003
Location: nö
Posts: 26018
Ich finde den Benchmark eigentlich ganz interessant. Auch weil es überraschend gut funktioniert, die komplette Aufgabe wortlos in einem Bild hochzuladen.

Qwen 3.8 hat auch mit einer Quantifizierung von 4 bit überhaupt kein Problem damit, das Bild zu analysieren, die Anspielung auf die Müller-Lyer Illusion zu finden und trotzdem das richtige Ergebnis zu präsentieren.

Alles getestet auf einem M5 Max mit 64 GB und oMLX. Model Load Time abgerechnet.

Qwen 3.8 27B 4 bit, 81 Sekunden, 33 Token/s:

click to enlarge

Qwen 3.8 27B oQ6e MTP, 81 Sekunden, 23 Token/s:

click to enlarge

Qwen 3.8 27B 8bit, 122 Sekunden, 18 Token/s:

click to enlarge

GPT Astra XHigh löst die Aufgabe übrigens in wenigen Sekunden ebenfalls korrekt. Maybe Cache?

screenshot-2026-09-10-at-22-52-24_282373.png

Dargor

Shadowlord
Avatar
Registered: Sep 2006
Location: 4020
Posts: 2396
click to enlarge

hab's mit Lumo getestet, hat es zuerst falsch erkannt, aber auf Nachfrage dann "sorry, war pattern matching" ausgespuckt

MightyMaz

hat nun auch einen Titel
Registered: Feb 2003
Location: .de
Posts: 790
Gemma-4-31b-qat in LM Studio.
In etwa 75% der Fälle ist die Antwort korrekt davon findet er aber grundsätzlich immer erst beim 2. Versuch den Bezug zu Müller-Lyer (auch in einem neuen Chat und sogar wenn der alte gelöscht wurde keine Ahnung warum) und dieser wird dann manchmal falsch und manchmal richtig aufgelöst. Die Denkprozesse sind dabei auch in Länge und Qualität stark unterschiedlich, ohne dass ich etwas an den Einstellungen ändere.
Ist ein lustiges Spielzeug aber so lange das so inkonsistent ist kann man sich halt nie wirklich auf Antworten verlassen.

click to enlarge
click to enlarge
click to enlarge
click to enlarge
Bearbeitet von MightyMaz am 11.09.2026, 00:48

Jedimaster

Here to stay
Avatar
Registered: Dec 2005
Location: Linz
Posts: 4633
So nebenbei - ist nicht die Skizze falsch? :D

Siehe https://de.wikipedia.org/wiki/M%C3%...er_illusion.svg

Umlüx

Huge Metal Fan
Avatar
Registered: Jun 2001
Location: Kärnten
Posts: 9358
darum gehts ja. blau ist eindeutig länger, aber die KI verheddert sich in der bekannten illusion und ignoriert fakten :D

Jedimaster

Here to stay
Avatar
Registered: Dec 2005
Location: Linz
Posts: 4633
Ich meine die Form der Pfeile.

Das Original ist Vergleich >----< zu <----> und nicht >------< zu >---<

DuneV2

Bloody Newbie
Registered: Dec 2025
Location: VIE
Posts: 36
Der Knackpunkt liegt imho darin dass LLMs extrem schlecht darin sind Geometrien exakt zu interpretieren. Deshalb wird's hier wahrscheinlich eher daran liegen, wie die Trainingsdaten gegenüber der Interpretation gewichtet sind, probabilistisches Sampling erzeugt dann jeweils unterschiedliche Antworten.

Ist ein super Beispiel dafür, warum LLMs bei CAD Anwendungen und ähnlichem immer noch völlig abkacken. Ich hab mal vor einiger Zeit versucht ein paar Piktogramme zu erstellen, Paradebeispiel für einen schlechten Use Case :D

MightyMaz

hat nun auch einen Titel
Registered: Feb 2003
Location: .de
Posts: 790
Dass beide Pfeile nach innen zeigen ist auch ein Teil des "Scherzes". Gemma-4-31b-qat hat das nicht bemerkt. In mats Beispiel hat es Qwen 3.8 27B oQ6e MTP erkannt aber Qwen 3.8 27B 4 bit und Qwen 3.8 27B 8bit ist es nicht aufgefallen.

Philipp

Here to stay
Registered: Jul 2001
Location: Wien
Posts: 2030
So, nachdem die kleinen Modelle Details zu den Titanic Swimming Pools und zur Müller-Lyer-Illusion wissen, bin ich heute auf die Idee gekommen, dem Modell einen Screenshot von einem Film zu geben und zu fragen, welcher Film das ist.

Das sollte jetzt wirklich unmöglich für ein 20GB Coding Modell sein, aber ich war trotzdem auf die Reaktion gespannt. Ich habe einen Screenshot aus The Pink Panther Strikes Again (alias Inspektor Clouseau, der beste Mann bei Interpol) genommen, da ich die 4K-UHD-Box der Filme diese Woche gekauft habe.

Das Ergebnis hat mich dann doch ein wenig überrascht:
click to enlarge
:eek:

kleinerChemiker

Here to stay
Avatar
Registered: Feb 2002
Location: Wien
Posts: 4419


DuneV2

Bloody Newbie
Registered: Dec 2025
Location: VIE
Posts: 36
Es ist irgendwie ein bisschen befremdlich wie empört die Medien/Anbieter über solche Anwendungen sind, das Zeug wird von fast jedem für fast alles verwendet. Heißt natürlich nicht, dass ich es toll finde.

smashIt

master of disaster
Avatar
Registered: Feb 2004
Location: OÖ
Posts: 5563

satya muss wie ein rumpelstilzchen herumhüpfen, dass die leute seinen slop-schrott nicht wollen.
ich werte das auch als beweis, dass windows on arm wieder einmal gescheitert ist.

WONDERMIKE

Administrator
Administrator
Registered: Jul 2001
Location: -
Posts: 11117
Zitat aus einem Post von DuneV2
Es ist irgendwie ein bisschen befremdlich wie empört die Medien/Anbieter über solche Anwendungen sind, das Zeug wird von fast jedem für fast alles verwendet. Heißt natürlich nicht, dass ich es toll finde.

Welche Medien? Golem empört sich sonst gerne über alles mögliche, aber hier schreibt der Herr Donath einfach nur sachlich über die Geschehnisse.

DuneV2

Bloody Newbie
Registered: Dec 2025
Location: VIE
Posts: 36
Ich habe jetzt eher allgemeine Medien und die Anbieter gemeint, beim Golem Artikel finde ich auch nichts, worüber ich mich echauffieren könnte :)

Wurde im Schwesterthread angesprochen, ich bin sehr gespannt, wie das mit der Regulierung laufen soll und ob es dabei eher um das "Rausfunken" oder die Mächtigkeit der Modelle per se geht. Ich kann mir nicht vorstellen dass irgendwer das Wettrennen freiwillig aufgibt.

smashIt

master of disaster
Avatar
Registered: Feb 2004
Location: OÖ
Posts: 5563
die ratten verlassen das sinkende schiff :D

Kontakt | Unser Forum | Über overclockers.at | Impressum | Datenschutz