Folge 125: Warum TOPS noch keine gute Vision-Plattform ausmachen

Shownotes

"Tera Operations per Second" ist eine häufig herangezogene Zahl, wenn es um die Leistungsfähigkeit einer KI-Plattform geht. Heute sprechen Stefan Schütz und Manuel Ott über die Grenzen ihrer Aussagekraft und worauf man in der Praxis beim Vergleichen von Systemen mit neuronalen Netzen achten muss.

Transkript anzeigen

00:00:13: Herzlich Willkommen im wohl innovativsten Schuppen zu unserem Podcast Embedded Wishing aus der Gartenhütte.

00:00:18: Heute wollen wir uns mal da Frage stellen, warum Tops noch keine gute Wischenplattform ausmachen?

00:00:23: Aber ich möchte natürlich zunächst meinen Co-Hos begrüßen.

00:00:26: Hallo Manuel!

00:00:27: Hallo

00:00:27: Stefan!

00:00:28: Interessantes Thema auf jeden Fall und ich freue mich dass ihr auch die Woche da mit dabei bin.

00:00:32: Genau wir wollten uns ja einfach mal den Thema Tops nähern oder annehmen vielleicht einfach mal kurz beschreiben einleitend, um was es da geht.

00:00:41: Letztendlich gibt ja auch andere Bezeichnungen für GPU-Performance.

00:00:45: aber dieses Tops zeigt an, was eine KI für eine Rechenleistung hat.

00:00:52: also steht für Terror Operation Per Second also quasi Billionen Operationen pro Sekunde.

00:00:59: und da geht man natürlich davon aus Mensch wenn ein Chip Fünffahrt ist besser wie der, der zwei hat und wenn jemand zwölf hat ist er schlechter.

00:01:07: Wie jemand der fünfundzwanzig hat und so weiter.

00:01:10: und da sagen wir aber na ja Kommt schon auch drauf an.

00:01:15: klar ist es erst mal die pure Einheit was wirklich eine npu oder ein neuronaler Prozessor in dem Wischen-Subsystem quasi wirklich verarbeiten kann, aber es sind ja wirklich nur die Operationen.

00:01:32: Da ist zum einen keine Sprache drüber verloren worden, welche Operanten er überhaupt unterstützt.

00:01:39: Das heißt kriege ich überhaupt die aktuellsten Netze auf die KI wenn ich erst mal nur mein KI Subsystem bleibe Aber auf der anderen Seite auch nicht.

00:01:49: wie gut ist denn der Chip angebunden?

00:01:51: Passt die Latents passt die Bandbreite zum Chip, vom Chip weg?

00:01:57: wie auch immer.

00:01:58: Wie ist das ganze Handling außen rum?

00:02:01: Klar wenn ich irgendein System habe und ich vergleiche zwei Tops dann kann ich schon mal davon ausgehen dass es auf jeden Fall ein performanteres System ist.

00:02:10: aber einfach zu sagen Ich kann zehnmal mehr damit machen das wird dann schon schwieriger.

00:02:16: Es ist halt so ein Anhaltspunkt Aber es ist keine absolutistische Aussage.

00:02:20: Genau, also da kann ich auch mal aus dem Nähkästchen.

00:02:23: tatsächlich ein so passierter Fall... ...kann ich mal wiedergeben.

00:02:27: und zwar haben wir einfach mal für den System zum Evaluieren einen Foto von der ganzen Schule.

00:02:34: Also da waren lauter Gesichter wirklich hunderte von Gesichtern auf diesen Foto.

00:02:38: oder was im Marathon?

00:02:39: Ich weiß es nicht mehr!

00:02:40: Aber auf eine Hunderte von Gesichtern und da war auf diesem KI-Beschleuniger lief eine Gesichtserkennung So.

00:02:47: Und das Ganze, wir sind ja hier im Embedded Vision pro Tag.

00:02:51: Das war ein Embeddad-System auf dem es ganz lief.

00:02:54: Dann auch mit überschaubarber Topsanzahl und ... das Netz so wie wir's hatten hat, ich würd mal so sagen, fünfzig bis hundert Gesichter erkannt?

00:03:05: Von links oben, soweitweise... Genau!

00:03:07: ...und dann auf einmal Ende.

00:03:08: Also sprich alles was rechts unten an Gesicht war wurde nicht erkannt.

00:03:13: Und dann haben wir genau das selbe System gemacht, haben ... nur das Post-Processing.

00:03:20: Also... Das was quasi am Ende auswertet ist es jetzt ein valides Gesicht oder doch nicht?

00:03:27: Er kennt ja ganz viel und dann muss er entscheiden, ist es ja oder nein!

00:03:30: Und diese Ja oder Nein Entscheidung, die haben wir einfach ausgelagert von der CPU, die da sowieso läuft auf einen FPGA Fabrik.

00:03:38: Der FPG ist für solche Jahrneinentscheidungen halt einfach Bomben.

00:03:42: Also das läuft zack, zacks, zack Paar Wehl auch durch Und auf einmal haben wir alle ... keine Ahnung, es waren halt vierhundert Gesichter gesehen.

00:03:50: Davor war einfach die CPU-Load beim Hundertprozent und nach diesen hundert Gesichtern, die er da erkannt hat, kam halt schon wieder der nächste Frame sein.

00:03:58: Das heißt, er musste abrechen mit dieser Erkennung?

00:04:00: Genau!

00:04:01: Dadurch, dass wir das dann auch vom FPG ausgeladen haben, war da quasi in diesem Timing für den Frame.

00:04:06: Und das andere ist, die CPU Load war bei null.

00:04:09: Also nahe zu null nicht ganz aber so etwa bei null... Es hat nichts an den Topzzeilen geändert.

00:04:15: Also es war genau dasselbe neue Netzbeschläge, genau das was du halt sagst.

00:04:18: Wie ist die Anbindung außen und wie sind denn die anderen Voraussetzungen?

00:04:22: Manchmal sehen wir dann auch Architekturen wo ein dedizierter Chip über PCI Express zum Beispiel angebunden ist.

00:04:28: Das kann ja durchaus eben auch eine Schnittstelle sein Die in Embedded Geräten verwendet wird.

00:04:33: Und da muss man dann aber manchmal auch ins Detail schauen weil manche physikalischen Steckverbinder haben schon vier Lanes ist eine einzelne Datenleitung, wenn ich da vier habe.

00:04:43: Habe ich die vierfache Bandbreite also kann viermal so viel Daten an so ein Subsystem liefern.

00:04:50: aber haben dann System gesehen wo SOC seidlich nur der hatte einfach nur eine PCI Express Lane kann funktionieren, man muss es aber einfach dann bewerten.

00:05:01: Welcher Standard von PCI Express wird dann wie verwendet?

00:05:04: Natürlich auch welche Latents habe ich und ich kann mich auch an einen Kunden erinnern.

00:05:08: Den haben wir so unsere kleine SXVPU vorgestellt, haben dann stolz gesagt was die alles kann... Und dann war der ganz überrascht wo man dann drauf kamen dass das Ding weit unter zehn Watt braucht und eher wirklich davon ausgangen ist okay mit den Sachen die wir versprochen haben sind irgendwie Bei so einem klassischen Industrie-PC, also schon miniaturisiert.

00:05:31: gibt es da auch einen prominenten Hersteller der viele Lösungen bietet von fünfzig Watt und mehr.

00:05:35: Und wir konnten sagen nene klar jede Kamera braucht vielleicht zu ihr Watt.

00:05:40: bei vier Kameras hat man dann vier Watt vom Leistungsverbrauch von jeder Kamera selber.

00:05:46: aber die Box wird nicht besonders warm ist komplett passiv gekühlt.

00:05:51: und ich sage mal da gibts einfach auch nicht nur drum Welche Tops hat so ein System, sondern wie viele Tops pro Watt hab ich da verbaut?

00:06:00: Und ich sag mal moderne Systeme sollten da schon auch bei einer Leistungskennzahl von zehn Tops Pro Watt sein und dann nicht.

00:06:08: groß drüber hinausgehen oder zumindest auch einhalten, dass ich da auch irgendwie so einen Sweetspot habe.

00:06:14: Ich hab genügend KI-Leistungen aber ich hab nicht irgendwie einen Mörderleistungsverbrauch oder das.

00:06:20: ich sage weil ich nicht unbedingt weiß was ich wirklich brauche.

00:06:24: dann overengineere ich lieber mein System oder ich setze so an den System ein mit zweihundert Tops und wie auch immer und kriege es dann einfach nicht gekühlt.

00:06:33: Ich brauche zwar bloß ein, zwei Tops.

00:06:35: Aber die Leistungsaufnahme ist einfach da und da geht es halt... ...einfach.

00:06:40: darüber hinaus also nicht nur immer die KI anschauen sondern auch wie du sagst, wie ist das?

00:06:47: Du hast jetzt das Post Processing ansprungen.

00:06:49: Das gleiche kann ja auch im Pre-Processing sein oder absolut Wie laufen die Daten dahin?

00:06:54: Gibt's da DMAs?

00:06:56: Muss ich da Daten einzeln schaufeln?

00:06:58: Habe ich dann eine einfache Formatkonvertierung?

00:07:04: Manche Chips können eine Farbraumkonvertierung in dem KI-Subsystem selber machen, was dann einfach ganz schick ist.

00:07:13: Weil man meistens gewisse Standard hat, gewisse standard Farbräume im SoC gewisse Netze, wie so ein Standard Yolo und wie auch immer aber in speziellen Farbräumen mit einer Farbunterabtastung arbeitet.

00:07:27: Und da ist es natürlich auch schick wenn ich die Daten vielleicht gar nicht groß konvertieren muss, aber in der Art und Weise wie mein neues Netz dann die Bilder braucht das einfach da irgendwo auf dem Weg dahin quasi automatisch passiert.

00:07:40: Deswegen plädieren wir halt immer dafür, aber das sind glaube ich ... jegliche Leute, die sich in dem KI-Bereich und Computerwischen beschäftigen... ... dass eben TOPS schon eine wertige Angabe ist.

00:07:54: Aber bei LIBE eben noch nicht anzeigt was ich mit dem System machen kann.

00:07:59: Wo es vielleicht auch Grenzen gibt, was diese TOPS Anzahl für alleine noch nichts aussagt wie du sagst ne?

00:08:06: Da gibts dann irgendwelche Demos, da kommen die Kunden und sagen ja ich brauche bloß einen TOP weil schau!

00:08:10: Ich detektiere da ein Gesicht oder eine Person.

00:08:13: Und wo du sagst, naja ist es denn so abwägig dass da auch mal zehn Personen rumlaufen?

00:08:18: Dann sagt der Kunde nie eigentlich nicht.

00:08:20: und dann sagen wir Na ja aber dann funktioniert eigentlich dein System so net.

00:08:24: Weil Du eigentlich dann relativ schnell auch irgendwo ein Abbruchkriterien drin hast oder deine ganze System Architektur soweit getuned hast das Du eigentlich nur eine Person detektieren kannst weil Du vielleicht noch einen halbwegs intelligentes Tracking mit drin hast gar nicht deinen komplettes Bild analysierst.

00:08:40: Das kann man machen.

00:08:41: Man kann quasi auch aus Niederperformanten SoCs viel rausholen, das ist die andere Seite der Medaille.

00:08:49: Also man braucht nicht unbedingt immer zehn Tops.

00:08:52: mit einem intelligenten Subsystem, mit irgendeinem Bild Tracking kann man auch mit einem Top sehr viel machen oder mit viel weniger gibt ja auch irgendwelche Low Power Anwendungen im Consumer Bereich.

00:09:03: aber Ich sag mal, man muss es eigentlich immer im Zusammenhang sehen.

00:09:07: Im Zusammenhang wie du gesagt hast mit CPU... ...mit Bussen, mit den Anbindungen,... ...mit Pre-Processing, mit Post Processing und dann macht die Zahl Sinn und dann kann man irgendwie so ein Gesamtsystem bewerten.

00:09:21: Genau also das passt eigentlich.

00:09:23: Das hat jetzt alles quasi noch einmal zusammengefasst.

00:09:25: Also unser Plittoyer im Prinzip Kunden sollten das Gesamtsystem anschauen.

00:09:30: Das war ja jetzt eigentlich noch mal zusammengefasst, perfekt!

00:09:33: Dann wenn ich auf die Uhr schaue dann sind wir am Ende unserer heutigen Folge angekommen und der Hinweis wie immer am ende jeder folge an unsere Zuhörerinnen und Zuhöhrer Die Email Podcast etzoelectrics.de gibt's auch diese Woche Und wir würden uns freuen wenn wir auch mal von den eigenen Erfahrungen hören.

00:09:48: wo hat bei euch bei ihnen die KI schlapp gemacht, aber wo war zu viel gefordert?

00:09:56: Da würden wir uns total über freuen, wenn wir da was führen würden.

00:09:58: Ansonsten wünsche ich mir wieder eine schöne Zeit, ne schöne Woche bis zum nächsten Mal.

00:10:02: Tschüss und

00:10:02: ciao!

Neuer Kommentar

Dein Name oder Pseudonym (wird öffentlich angezeigt)
Mindestens 10 Zeichen
Durch das Abschicken des Formulars stimmst du zu, dass der Wert unter "Name oder Pseudonym" gespeichert wird und öffentlich angezeigt werden kann. Wir speichern keine IP-Adressen oder andere personenbezogene Daten. Die Nutzung deines echten Namens ist freiwillig.