[Sammelthread] ChatGPT und andere KI - Anwendungsbeispiele und Diskussion

Everlast hat eigentlich hin und wieder interessante Videos, auch Interviews mit Leuten aus der Branche. Die fand ich teils interessant. Mein Problem ist eher, dass deren Videos nicht selten erheblich länger als 30 Minuten lang sind. 60 Minuten oder länger schaue ich mir selten an, wenn dann eher von Morpheus, der macht gut Videos. Die Videos von "AI mit Arni" schaue ich auch ganz gerne, er macht auch ausführliche Tests und hat wie Morpheus einige Tests, die er mit jedem neuen Model durchführt und vergleicht. Bowen schaue ich aus dem gleichen Grund auch gerne. Solche festen Tests zeigen doch gut den Unterschied zwischen den Modellen.

Allerdings muss man bei solchen One Shot Tests auch immer in Betracht ziehen, dass man vielleicht einen Run erwischt hat, wo die KI nicht das beste Resultat liefert, als das was es könnte.
 
Wenn Du diese Anzeige nicht sehen willst, registriere Dich und/oder logge Dich ein.
Ja klar ist auch Everlast immer ein Besuch wert - aber bei Bowen sind glaube ich die Langtests nicht nur one shots und er lässt ja auch schion mal korrigieren wenn die "Grundsubstanz" viel verspricht.

Das mit dem Roboterarm fand ioch mal wieder cool und die Game Portierungen auf ESP32 mit Webcam auf der sich AI selber kontrollieren konnte- glaube das werde ich auch machen in Zkunft eine Webcam nutzen wenn ich da auf Microcontroller was grafisch ausgebe.

Er macht halt mit am meisten so ungewöhnliche verschiedene Tests auif die garantiert nicht speziell trainiert wurde

Mal sehen wo die Modelle in 3 Jahren sind :O die Fortschritte sind jedenfalls immer noch krass
 
Zuletzt bearbeitet:
Naja, 3 Jahre ist eine lange Zeit, da kann viel passieren, bis hin zu KI Verboten für Consumer, weil "zu gefährlich". xD
 
naja die lokalen Modelle sind ja auch immer besser - und längst abliterated - die hinken auch nur noch 1-1,5 Jahre hinterher und die wird es immer irgendwo geben zum runterladen.
 
Bijan hat heute einen Astra <-> Fable 5.1 Test veröffentlicht mit verschiedenen Aufgaben - super sehenswert.
Von 3D Physiksimulation, selbstlernender Robotersteuerung, 3D Helm Gaming, ESP32, usw usw

Beitrag automatisch zusammengeführt:
völlig irre was Fable da mit praktisch einem
Prompt ausgeworfen hat am Ende. Komplett irre
 
Wenn man bedenkt dass es erst zwei Jahre her ist, als das erste Reasoning-Modell veröffentlicht wurde. (o1 preview)..

Und gleich mal ein Dankeschön an OpenAI, heute morgen wieder mit 100% aufgewacht. Die Reset Company lässt sich nicht lumpen. 😅

Durch die Blume wurde ja schon 6 Terra und Luna angekündigt.
 
Zuletzt bearbeitet:
Und gleich mal ein Dankeschön an OpenAI, heute morgen wieder mit 100% aufgewacht. Die Reset Company lässt sich nicht lumpen. 😅
Habe ich auch gerade gesehen. Und ich habe mir gestern noch 2.500 Credits gekauft, weil ich schon auf 10% runter war und die nächste Zurücksetzung noch bis Samstag gedauert hätte. Danke OpenAI.
 
Aber Astra dass das mit einer einzigen 2d Kamera lerrnen konnte einen Roboterarm in einer 3D Welt so gezielt zu steuern ist ja auch krass.

Die finde ich geben sich nicht viel

Man muss ja auch bedenken was man hier sieht - ein System das (lassen wir mal global Workspace und Co raus) trainiert wurde die nächsten Teilworte statsitisch vorherzusagen es ist ja "nur" ein LLM - also in einer 1D Welt "existiert" und arbeitet - findet mittels eines 2D Sensors raus wie es in einer 3D Welt einen Roboterarm gezielt steuern kann einen Gegenstand greifen und bewegen kann - und kann aus den Tokens die seine Grundlage sind sinnvolle physikalsiche Gesetz ableiten die es fpür die spezielle Aufgabe ja braucht - zumindest ein Verständnis der Gravitation Längen Zeit Reibung etc.

Das ist verrückt wie weit die Modelle in so kurzer Zeit gekommen sind.
 
Zuletzt bearbeitet:
Man darf allerdings auch nicht vergessen, dass KI Agenten so arbeiten, dass sie immer wieder testen und korrigieren, nach Möglichkeit so lange bis es passt. Das ist also nicht "KI haut Antwort raus > passt", sondern eben "KI probiert und probiert und probiert und verbrennt dabei Token, bis es möglichst passt". Und die Frage ist auch: funktioniert der Greifarm wirklich frei und genau mit jedem Objekt oder cheatet die KI hier und er ist vorprogrammiert für genau diesen Block? Genau die Frage beantwortet das Video eben nicht.
 
Man darf allerdings auch nicht vergessen, dass KI Agenten so arbeiten, dass sie immer wieder testen und korrigieren, nach Möglichkeit so lange bis es passt. Das ist also nicht "KI haut Antwort raus > passt", sondern eben "KI probiert und probiert und probiert und verbrennt dabei Token, bis es möglichst passt". Und die Frage ist auch: funktioniert der Greifarm wirklich frei und genau mit jedem Objekt oder cheatet die KI hier und er ist vorprogrammiert für genau diesen Block? Genau die Frage beantwortet das Video eben nicht.

Tja das 1:1 von Mathematik, Iterationen :)
 
Wieso sollte Bijan das vorprogrammieren? Man sieht doch auch dass die AI den Roboterarm erst kalibriert - dann hätte Fable das ja auch geschafft. Ich dneke mit "Failed" erzielt man sowieso mehr Klicks als mit "INSANE"

Was man hier sieht ist ein "statistisches Textergänzungstool" bekommt es hin zu verstehen was eine 3D dimensionale Welt ist und das mit Hilfe einens 2D Sensors den Roboterarm innerhalb des 3D Raumes zu positionieren - und dann entsprechende Aktionen zu machen - das ist nunmal super huge, denn das zeigt halt dass das Potential slebst von "Prosumer" LLMs inzwischen über das hinausgeht was textbasiert ist.

Denn auf mehr als Tokenwahrscheinlichkeit ist das ganze System nicht ausleget das kann eigentlich nur nach "ARZ" kommt mit Wahrscheinlickeit x% "ERT" und mit Wahscheinlichkeit y% "DEF" - das ist halt alles worauf das System im Grunde aufbaut.

Auch zum nicht zufälligen Probieren baucht man ein Verständnis des 3D Raum das System fährt ja nicht zufällig Millionen von Randompositionen an - man sieht doch im Reasoning dass es die 3D Welt verstanden hat. Es probiert eben nicht rein zufällig sondern ganz gezielt. Es nutzt von 10 Millionen möglichen Positionen dann die 10 sinnvollen - die anderen nicht. Das ist halt eben gerade kein klassischer try and error Ansatz.
 
Zuletzt bearbeitet:
häh weiso sollte Bijan das vorprogrammieren? Man sieht doch auch dass die AI den Roboterarm erst kalibriert - dann hätte Fable das ja auch geschafft.
Weil es auf den Prompt ankommt, wenn er da nicht deutlich genug ist und Interpretationsspielraum lässt, könnte eine KI eben mal den einen oder den anderen Weg gehen.

Was man hier sieht ist "statistisches Textergänzungstool" bekommt es hin zu verstehen was eine 3D dimensionale Welt ist und das mit Hilfe einens 2D Sensors den Roboterarm innerhlabn des 3D Raumes zu positionieren - und dann entsprechende Aktionen zu machen - das ist nunmal super huge.
"statistisches Textergänzungstool" ist so aber auch nur die halbe Wahrheit. Diese KIs können inzwischen auch direkt Bilder/Video verarbeiten. Die machen Screenshots und analysieren diese, ob das dort abgebildete dem erwarteten entspricht. Es ist also kein reines Textmodell mehr. Und das ist auch nur die LLM Seite, die allein kann aber nichts, das sind nur die Weights, die Software entscheidet primär darüber was ein LLM am Ende kann und was nicht und KI Agenten haben hier besonders viele Tools an ihrer Seite, ohne die sie solche Dinge nicht machen könnten.
 
Auch die Bilder/Videos/Audio werden als Tokens gefüttert und nicht als "Gesamteinheit" das ist kein Unterschied. Ob das ein Satz aus einem Buch ist oder Byte-Teile eines Bildes ist einfach immer eine kurze
Teilbytefolge. ob "ABD" "RTW" "XYZ" ein Text oder Bild (Media) token ist wie soll denn das für das System ein Unterschied sein? Es gibt keinen Unterschied an den Nodes, die landen alle einfach im grossen Tokentopf. Ein LLM (jedenfalls keines das ich kenne) hat keinen Extraspace oder Extraflags an den Nodes für Mediatokens oder sonstige Definition des Weight-Typs - sondenr nur alles wird gleichgemacht und kommt in den grossen Sack :d

Ich finde das jedenfalls super wie AI die Grenzen wozu es fähig ist immer noch jeden Tag mit jedem neuen Major Release eines Modells verschieben kann.
 
Zuletzt bearbeitet:
Manche LLMs wie Qwen haben durchaus ein extra Vision Modell, das man parallel zum Text LLM laden muss oder weglassen kann, wenn man es nicht benötigt.
 
Es geht um die intenre Struktur des Media oder Textmodells also der Node Konzeption - nicht ob man das ein und auslagern kann. Natürlich haben manche Modelle einen Mixture of Experts Ansatz aber das hat nicht mit dem grundsätzlichen internen Aufbau zu tun. Dass ein MoE Konzeopt doch so gut funktioniert ist ja auch wieder so ein Wunderkram - da dass ja eigentlich krass in die vektorbasierte Vernetzung des "Gesamtwissens" eingreift - das ja auch erstaunlich dass das so gut funktioniert.
 
Zuletzt bearbeitet:
Das hat nichts mit MoE zu tun. Auch Dense Modelle haben oftmals extra Bild/Video/Audio Modelle wie auch Mistral.

Aber ist ja auch egal, am Ende arbeiten sie in der Tat alle mit Tokens.
 
Hmm ich kenne nur MoE mit shared Transformer für Media und Hauptnetz - welches Modell hat denn das nicht?

Ohne shared transformer verliert man doch die wesentlichen Vorzüge der Haupt AI Struktur der grossen Nodestruktur und ihrer Effekte? oder nicht? Ohne MoE glaube ich nicht dass dann die Medientokens im "Global Workspace" z.B. vorhanden sein können, ohne den shared transformer sind das dann doch nur "simple" Inputtokens - aber das kann doch dann nie die Qualität erreichen.

Hehe ich zumindest würde IMMER ein MoE mit shared transformer bevorzugen einfach wiel ich denke die hinterlegten weights sind das was AI so gut macht :d aber wer weiss was morgen rauskommt.
 
Zuletzt bearbeitet:
Reden wir hier wirklich vom gleichen "MoE"?

Es gibt einmal die Dense Modelle, die sollten für gute Geschwindigkeit komplett im VRAM liegen, weil alle Parameter Aktiv sind. Haben für ihre Größe dann aber auch eine entsprechend hohe Qualität. Zum Beispiel das aktuell stark beliebte Qwen 3.8 27B ist ein solches Modell.

Und dann gibt es die MoE Modelle, die können gut auf VRAM und RAM aufgesplitttet werden, da sie trotzdem sehr schnell bleiben, aber um die Qualität eine Dense Modells zu erreichen, müssen sie deutlich größer sein. Ein aktuelles 27B Dense Modell sollte ein aktuelles 35B A3B MoE Modell aus der gleichen Modellfamilie (Qwen z.B.) in Sachen Qualität noch immer schlagen. Aber dank MoE kann z.B. ein 120B Modell mit 24GB VRAM + 64GB DRAM immer noch in solider Geschwindigkeit laufen. Auf die Art ist auch Qwen 3.8 Flash Next lauffähig, aber noch nicht dazu gekommen es selbst auszuprobieren.
 
Da ist ja nur das generische MoE Konzept was aber doch entscheidend ist ja wie das MoE intern konzipiert ist - es gibt das shared transformer Konzept - das finde ich halt besser - und das shared main network Konzept. Beim Shared transformer hat man halt die den Inhalt der Integration des MoE trotzdem immer den weights lediglich die Nodes sind halt nicht aktiv beim shared main network halt nicht.

Das entscheidend ist doch nicht die optionale Anbindung/Aktivierung sondern wie die optionale Anbindung vom grundsätzlichen AI Nodekonzept her umgesetzt ist. Genrerll denke ich kann man sagen shared network ist etwas ressourcensparender - aber shared transformer ist sicher qualitativ besser - weil das halt mehr das AI Grundprinzip umsetzt - bei shared Network MoE gibt es damit ein prinzipielle Unterscheidung der Media tokens zumidnest bis sie das shared network erreichen - beim shared transfomer MoE aber halt nicht.
 
Zuletzt bearbeitet:
Hehe und irgendwann kann GPT 7 dann sogar allgemein die Umlaufbahn von 3 Klumpen berechnen :d verrückt eigentlich dass sowas doch eher auf den ersten Blick einfaches aktuell nur näherungsweise gelöst werden kann.
 
Also die haben definitiv wieder an Astra herumgedreht. Jedes mal der gleiche Mist. Heute kaum zu gebrauchen. :poop:
Die ersten 24-48h sind immer hot, danach lieber erstmal Finger weg. War bei Sol genauso.
 
Da ist ja nur das generische MoE Konzept was aber doch entscheidend ist ja wie das MoE intern konzipiert ist - es gibt das shared transformer Konzept - das finde ich halt besser - und das shared main network Konzept. Beim Shared transformer hat man halt die den Inhalt der Integration des MoE trotzdem immer den weights lediglich die Nodes sind halt nicht aktiv beim shared main network halt nicht.

Das entscheidend ist doch nicht die optionale Anbindung/Aktivierung sondern wie die optionale Anbindung vom grundsätzlichen AI Nodekonzept her umgesetzt ist. Genrerll denke ich kann man sagen shared network ist etwas ressourcensparender - aber shared transformer ist sicher qualitativ besser - weil das halt mehr das AI Grundprinzip umsetzt - bei shared Network MoE gibt es damit ein prinzipielle Unterscheidung der Media tokens zumidnest bis sie das shared network erreichen - beim shared transfomer MoE aber halt nicht.
Gut, das geht tiefer in das Thema als ich darin eingetaucht bin. Welches konkrete open weight Model gehört denn zum Beispiel zu shared transformer MoE?
 
Nun sicher weiss man das von GPT, QWEN, Gemini, Von anderen ist das explizit nicht bekannt - aber es wäre ja nicht sehr sinnvoll auf die Weights im Haupt Netz zu verzichten.

Ein AI Netz lebt im Prinzuip davon dass alle Infomationen in der Haupt AI einen Einfluss haben durch die Weights und die Vernetzung - das ist der Idealzustand den man immer haben will - und eben nicht davon dass Teile vorprocessed sind.

Man will immer dass (Teilinfos) das Foto eines Hundes mit einer Mütze aus Mexico irgendwie am Ende verknüpft ist mit den (Teilinfos) der Geburtstagsdaten von Oma Ernie in Hamburg weil nur so das Rätsel der Gravitation gelöst werden kann :d

Ich habe mir mal von AI die MoE Modelle listen lassen einfach hehe weil das das halt besser kann und ich jetzt auch B und C eher in einen Topf geworfen hätte

Code:
A) Separate models
   Image AI → description → LLM
   ❌ not shared


B) Encoder + shared LLM
   Image → vision encoder ─┐
   Audio → audio encoder ──┼→ common transformer
   Text ───────────────────┘
   ✓ shared transformer


C) Unified token space / early fusion
   image tokens ─┐
   audio tokens ─┤
   text tokens ──┼→ same transformer
   video tokens ─┘
   ✓✓ strongly shared


D) Fully native multimodal network
   modalities learned end-to-end as parts
   of one network
   ✓✓✓ strongest integration

Most modern multimodal LLMs are somewhere around B–C. Models such as GPT are closer to C/D,
 
Zuletzt bearbeitet:
Die ersten 24-48h sind immer hot, danach lieber erstmal Finger weg. War bei Sol genauso.
Im Doppelgänger Podcast haben sie das als AI Dieselskandal bezeichnet :d. Finde das recht passend, die ersten Tage immer alles top solange alle Benchmarks laufen und dann tweaked man es sofort auf niedrigen Tokenverbrauch um die Kosten zu drücken.
 
Also die haben definitiv wieder an Astra herumgedreht. Jedes mal der gleiche Mist. Heute kaum zu gebrauchen. :poop:
Die ersten 24-48h sind immer hot, danach lieber erstmal Finger weg. War bei Sol genauso.
Ich habe den Workflow etwas umgestellt. Astra muss man machen lassen, da es ja im Hintergrund mit Agents arbeitet. Man muss eigentlich nur noch das Ziel definieren und zwischendurch leichte Anpassungen vornehmen. Keine exakten Prompts mehr. Ich lasse mir vorher immer ein Mockup machen, welches Astra 1:1 umsetzen kann. Wenn es mir gefällt - los, ansonsten wird nochmal angepasst. Sehr exakte Prompte bei jedem Schritt mag Astra nicht so gerne habe ich gemerkt.
 
/goal war schon immer ineffizientes Tokenverbrennen, bessere Ergebnisse bekommt man deswegen nicht.

Zumindest für meinen Zweck.

EDIT: Gestern hat mein Hermes Agent mit Astra auch nur noch Blödsinn fabriziert, bin dann vorübergehend auf Sol zurück. Heute wieder deutlich besser!
 
Zuletzt bearbeitet:
GPT auch. Ich glaube langsam echt, die sprechen sich untereinander in Codisch ab die LLMs :ROFLMAO: :ROFLMAO: :ROFLMAO: :ROFLMAO: :ROFLMAO: Versuche gerade 6 Schaubilder/Infografiken zu einem Thema erstellen zu lassen. Das ganze hat schon Slapstik-Ausmaße, was mit GPT heute liefert :d
 
Hardwareluxx setzt keine externen Werbe- und Tracking-Cookies ein. Auf unserer Webseite finden Sie nur noch Cookies nach berechtigtem Interesse (Art. 6 Abs. 1 Satz 1 lit. f DSGVO) oder eigene funktionelle Cookies. Durch die Nutzung unserer Webseite erklären Sie sich damit einverstanden, dass wir diese Cookies setzen. Mehr Informationen und Möglichkeiten zur Einstellung unserer Cookies finden Sie in unserer Datenschutzerklärung.


Zurück
Oben Unten refresh