WEBVTT

00:00:00.000 --> 00:00:03.740
<v Dominik>Hallo, liebe Hörerinnen und Hörer. Willkommen im Python-Podcast, Episode 61.

00:00:03.740 --> 00:00:08.960
<v Jochen>Wirklich 61. Wir haben eben noch ein bisschen drüber zu erhalten.

00:00:08.960 --> 00:00:11.640
<v Dominik>Heute geht es um Auphonikin. Hallo, Jochen.

00:00:11.640 --> 00:00:14.660
<v Jochen>Hallo, Dominik. Herzlich willkommen und herzlich willkommen, Johannes.

00:00:14.660 --> 00:00:15.560
<v Jochen>Hi, Johannes.

00:00:15.560 --> 00:00:16.020
<v Jochen>Auch wieder mit dabei.

00:00:16.020 --> 00:00:16.320
<v Jochen>Ja.

00:00:16.320 --> 00:00:17.080
<v Jochen>Hallo zusammen.

00:00:17.080 --> 00:00:19.240
<v Dominik>Wir haben ja schon ein paar Mal hier gehabt, glaube ich. Ihr kennt ihn.

00:00:19.240 --> 00:00:19.800
<v Dominik>Genau.

00:00:19.800 --> 00:00:22.120
<v Dominik>Und wir haben auch einen besonderen Gast heute wieder.

00:00:22.120 --> 00:00:23.220
<v Dominik>Hallo, Georg.

00:00:23.220 --> 00:00:25.700
<v Georg>Hallo, danke für die Einladung.

00:00:25.700 --> 00:00:27.520
<v Georg>Ja, schön, dass du da bist.

00:00:29.340 --> 00:00:31.800
<v Dominik>Eine Vorstellung machen wir vielleicht bestimmt noch später, wenn wir zur Welt kommen.

00:00:31.800 --> 00:00:33.540
<v Dominik>Vielleicht fangen wir mit unserer klassischen Struktur an.

00:00:33.540 --> 00:00:36.040
<v Dominik>Wir haben ja immer besonders viel Struktur im Podcast, habe ich gehört, Jochen.

00:00:36.040 --> 00:00:36.320
<v Dominik>Ja?

00:00:36.320 --> 00:00:36.800
<v Dominik>Ja.

00:00:36.800 --> 00:00:37.560
<v Dominik>Okay.

00:00:37.560 --> 00:00:40.360
<v Dominik>Vielleicht als erstes News. Für alle, die es noch nicht mitbekommen haben, wir planen

00:00:40.360 --> 00:00:41.860
<v Dominik>ein HörerInnen-Treffen.

00:00:41.860 --> 00:00:44.740
<v Jochen>Ja, wir hatten ja letztes Mal da aufgerufen, sich zu melden.

00:00:44.740 --> 00:00:47.300
<v Dominik>In der Region Rheinland. Es haben sich tatsächlich einige Leute schon gemeldet.

00:00:47.300 --> 00:00:51.400
<v Jochen>Genau. Wir haben gesagt, ihr solltet uns auf jeden Fall immer noch eine Mail schreiben,

00:00:51.400 --> 00:00:54.480
<v Jochen>damit wir das dann ordentlich zählen können. Und genau einer hat uns eine Mail geschrieben.

00:00:54.480 --> 00:00:56.140
<v Jochen>Die anderen Leute haben sich über alle Kanäle gemeldet.

00:00:56.140 --> 00:00:58.680
<v Jochen>Manche haben sich auf LinkedIn gemeldet, manche haben sich über

00:00:58.680 --> 00:01:01.260
<v Jochen>Discord gemeldet, manche haben sich einfach nur persönlich gemeldet.

00:01:01.260 --> 00:01:03.740
<v Jochen>Aber wir kriegen das immer wieder.

00:01:03.740 --> 00:01:05.520
<v Dominik>Also, wer Lust hat, sagt auf jeden Fall Bescheid. Wir würden uns freuen.

00:01:05.520 --> 00:01:09.680
<v Johannes>Und ich habe gehört, dass die Stuttgart-Fraktion, die Süddeutschland-Fraktion,

00:01:09.680 --> 00:01:11.480
<v Johannes>die ist gerade stark in Führung.

00:01:11.480 --> 00:01:12.380
<v Johannes>Macht ihr eine Frage?

00:01:12.380 --> 00:01:13.920
<v Dominik>Nein, leider nicht.

00:01:13.920 --> 00:01:16.780
<v Jochen>Diese Gerüchte kann ich nicht bestätigen.

00:01:16.780 --> 00:01:20.500
<v Jochen>Also, auf LinkedIn hat einer gesagt, er würde gerne das lieber in Stuttgart

00:01:20.500 --> 00:01:24.320
<v Jochen>haben als in Düsseldorf. Aber ansonsten, zum Beispiel auf Spotify

00:01:24.320 --> 00:01:27.120
<v Jochen>wollten vier Düsseldorf und keiner Stuttgart.

00:01:28.020 --> 00:01:29.560
<v Dominik>Ja, und bei uns im Discord auch.

00:01:29.560 --> 00:01:32.920
<v Dominik>Ja, also, tut mir leid, du musst leider anreisen.

00:01:32.920 --> 00:01:36.220
<v Jochen>Aber wir müssen uns halt noch überlegen, wie wir das machen wollen und wo.

00:01:36.220 --> 00:01:40.600
<v Johannes>Also, ist jetzt aber letzte Chance für die Süddeutschland-Hörer.

00:01:40.600 --> 00:01:43.180
<v Jochen>Ja, okay, wenn man jetzt wirklich, wirklich will, dass es in Stuttgart stattfindet,

00:01:43.180 --> 00:01:43.680
<v Jochen>könnte man nochmal.

00:01:43.680 --> 00:01:45.120
<v Jochen>Ihr habt noch die Chance.

00:01:45.120 --> 00:01:45.540
<v Jochen>Ja.

00:01:45.540 --> 00:01:47.060
<v Jochen>Stimmen Sie jetzt ab.

00:01:47.060 --> 00:01:49.060
<v Johannes>Die Telefonleitungen sind geschaltet.

00:01:49.060 --> 00:01:54.080
<v Jochen>Die Spuren sind scharf gestellt am Mischpult, mit dem wir nie Probleme haben.

00:01:54.080 --> 00:01:54.920
<v Jochen>Das war es doch schon wieder.

00:01:54.920 --> 00:01:55.800
<v Jochen>Dann bleibt uns gewogen.

00:01:55.800 --> 00:01:57.380
<v Jochen>Hallo at PythonPodcast.com.de.

00:01:57.380 --> 00:01:57.960
<v Jochen>Haben wir Pics?

00:01:58.280 --> 00:01:58.460
<v Jochen>Nein.

00:01:58.460 --> 00:02:01.360
<v Dominik>Wir wollten News machen, glaube ich, noch.

00:02:01.360 --> 00:02:02.080
<v Dominik>Okay, gut.

00:02:02.080 --> 00:02:05.660
<v Jochen>Ich habe, ehrlich gesagt, fast gar nichts.

00:02:05.660 --> 00:02:09.640
<v Jochen>Also, es gibt eine neue Rails-Version, die ein bisschen mehr Deployment dazu kann.

00:02:09.640 --> 00:02:11.820
<v Dominik>Okay, wir waren, glaube ich, erst vor zwei Wochen News gemacht.

00:02:11.820 --> 00:02:13.500
<v Dominik>Und in den letzten zwei Wochen ist nicht so wahnsinnig viel passiert.

00:02:13.500 --> 00:02:14.720
<v Dominik>Ja, und es ist nicht so wirklich viel passiert.

00:02:14.720 --> 00:02:15.300
<v Dominik>Keine Ahnung warum.

00:02:15.300 --> 00:02:16.840
<v Dominik>Dann skippen wir heute die News.

00:02:16.840 --> 00:02:18.080
<v Dominik>Oder hast du mit News mitgebracht?

00:02:18.080 --> 00:02:21.120
<v Jochen>Oder hat jemand von euch irgendwas Interessantes, was in der Python-Welt passiert ist?

00:02:21.120 --> 00:02:23.120
<v Jochen>Nein, ich habe nichts.

00:02:23.120 --> 00:02:27.040
<v Dominik>Dann lassen wir einfach den Georg sich selbst vorstellen und ein bisschen was erzählen.

00:02:27.040 --> 00:02:27.900
<v Dominik>Das ist eine tolle Idee.

00:02:28.460 --> 00:02:30.620
<v Jochen>Obwohl, wir könnten auch einmal noch kurz Werbung machen für uns selber.

00:02:30.620 --> 00:02:32.240
<v Jochen>Das ist eine gute Idee.

00:02:32.240 --> 00:02:32.660
<v Jochen>Willst du für uns selber Werbung machen?

00:02:32.660 --> 00:02:33.200
<v Jochen>Bitte?

00:02:33.200 --> 00:02:34.380
<v Jochen>Willst du für uns selber Werbung machen?

00:02:34.380 --> 00:02:34.700
<v Jochen>Ja, okay.

00:02:34.700 --> 00:02:36.020
<v Jochen>Ja, ganz kurz vielleicht.

00:02:36.020 --> 00:02:38.340
<v Jochen>Miet mich, miet mich, miet mich.

00:02:38.340 --> 00:02:39.380
<v Jochen>Jetzt hier.

00:02:39.380 --> 00:02:40.620
<v Jochen>Ja, wie war das?

00:02:40.620 --> 00:02:43.040
<v Jochen>Ja, man kann uns auch mieten.

00:02:43.040 --> 00:02:46.500
<v Jochen>Und ich habe gehört, das muss man wiederholen.

00:02:46.500 --> 00:02:48.060
<v Jochen>Sonst merken sich die Leute das nicht.

00:02:48.060 --> 00:02:49.720
<v Jochen>Deswegen, wir haben das ja schon einmal gemacht.

00:02:49.720 --> 00:02:50.960
<v Jochen>Aber einmal ist zu wenig.

00:02:50.960 --> 00:02:53.060
<v Jochen>Und deswegen sagen wir das einfach nochmal.

00:02:53.060 --> 00:02:54.920
<v Jochen>Also, wenn ihr interessante Projekte habt oder so.

00:02:54.920 --> 00:02:57.360
<v Jochen>Die meisten von uns sind irgendwie Freelancer.

00:02:58.020 --> 00:03:02.260
<v Jochen>Und auch im Prinzip für schöne Projekte buchbar.

00:03:02.260 --> 00:03:05.900
<v Jochen>Und ich wiederhole das jetzt mal in meiner Stimme auch nochmal.

00:03:05.900 --> 00:03:07.820
<v Jochen>Auch ich bin mietbar.

00:03:07.820 --> 00:03:10.460
<v Johannes>Und immer für interessante Projekte zu haben.

00:03:10.460 --> 00:03:11.420
<v Johannes>Ja, wunderbar.

00:03:11.420 --> 00:03:13.000
<v Johannes>Und Georg, wie ist das bei dir?

00:03:13.000 --> 00:03:15.120
<v Johannes>Bist du auch mietbar oder bist du irgendwo angestellt?

00:03:15.120 --> 00:03:17.620
<v Georg>Wir sind alle mietbar irgendwie, oder?

00:03:17.620 --> 00:03:18.600
<v Georg>Ja, gut.

00:03:18.600 --> 00:03:21.660
<v Dominik>Also, ihr wisst ja schon, dass ihr alle für die Werbung im Podcast erst eine Rechnung bekommt.

00:03:21.660 --> 00:03:22.940
<v Dominik>Von mir.

00:03:22.940 --> 00:03:25.280
<v Dominik>Das zählt.

00:03:25.280 --> 00:03:27.740
<v Dominik>Dominik, das war jetzt deine Überleitung.

00:03:28.020 --> 00:03:29.700
<v Dominik>Damit du dir den Georg vorstellen kannst.

00:03:29.700 --> 00:03:30.160
<v Dominik>Ja.

00:03:30.160 --> 00:03:30.780
<v Dominik>Ja, gut, dann.

00:03:30.780 --> 00:03:32.780
<v Dominik>Okay, genau.

00:03:32.780 --> 00:03:34.380
<v Dominik>Entschuldigung, Georg, bitte.

00:03:34.380 --> 00:03:37.660
<v Georg>Ja, ich bin der Georg, hallo.

00:03:37.660 --> 00:03:45.920
<v Georg>Und, ja, wenn man mich mieten will, ich bin aus Österreich an der slowenischen Grenze, ganz im Süden.

00:03:45.920 --> 00:03:47.380
<v Georg>Da in der Nähe von Graz.

00:03:47.380 --> 00:03:49.440
<v Georg>Und warum bin ich da?

00:03:49.440 --> 00:03:51.960
<v Georg>Also, wir haben so ein Projekt, Afonik nennen sie das.

00:03:51.960 --> 00:03:53.660
<v Georg>Da geht es um Audioverbesserung.

00:03:53.660 --> 00:03:56.480
<v Dominik>Vielleicht noch einmal ganz kurz einhaken darf.

00:03:56.480 --> 00:03:58.000
<v Dominik>Afonik habt ihr auf jeden Fall schon.

00:03:58.020 --> 00:03:58.520
<v Dominik>Schon mal gehört.

00:03:58.520 --> 00:04:03.100
<v Dominik>Also, zumindest, wenn ihr unseren Podcast schon mal gehört habt, habt ihr auf jeden Fall Afonik gehört.

00:04:03.100 --> 00:04:03.980
<v Dominik>Also, den Effekt zumindest.

00:04:03.980 --> 00:04:08.680
<v Dominik>Wir von Anfang an alle unsere Episoden durch Afonik jagen.

00:04:08.680 --> 00:04:08.860
<v Dominik>Ja.

00:04:08.860 --> 00:04:10.480
<v Dominik>Aha, so gehört.

00:04:10.480 --> 00:04:11.440
<v Dominik>Nicht schlecht.

00:04:11.440 --> 00:04:11.700
<v Dominik>Ja.

00:04:11.700 --> 00:04:13.040
<v Dominik>Ja.

00:04:13.040 --> 00:04:16.760
<v Georg>Also, zuerst mal zu mir.

00:04:16.760 --> 00:04:19.980
<v Georg>Also, ich habe bei uns da in Graz Toningenieur studiert.

00:04:19.980 --> 00:04:26.600
<v Georg>Das ist eine interessante Studie, weil man so Audiosachen und Informatik und Elektrotechnik-Sachen in Kombination quasi hat.

00:04:26.600 --> 00:04:28.000
<v Georg>Also, du hättest das Audio-Problem.

00:04:28.020 --> 00:04:31.600
<v Dominik>Was wir am Anfang der Episode hatten, heute sehr viel schneller in den Griff bekommen.

00:04:31.600 --> 00:04:34.420
<v Georg>Deswegen habe ich gesagt, warum verwendet ihr einen Mischpuls?

00:04:34.420 --> 00:04:38.140
<v Georg>Dann hat man keine Probleme, wenn man keines verwendet.

00:04:38.140 --> 00:04:39.420
<v Georg>Wie auch immer.

00:04:39.420 --> 00:04:44.020
<v Georg>Und ja, dann mehr so in die Richtung Informatik.

00:04:44.020 --> 00:04:46.100
<v Georg>Also, alles ein bisschen so kombiniert.

00:04:46.100 --> 00:04:49.860
<v Georg>Also, Audio und Informatik und Machine Learning und so weiter.

00:04:49.860 --> 00:04:55.600
<v Georg>Und dadurch war ich sehr viel Podcast-Hörer immer.

00:04:55.600 --> 00:04:57.600
<v Georg>Und dadurch bin ich dann irgendwie zu...

00:04:58.020 --> 00:05:02.400
<v Georg>Da war Phonic gekommen, wo es eben um die Verbesserung von Audio gegangen ist.

00:05:02.400 --> 00:05:06.880
<v Georg>Und was am Anfang auch noch ganz wichtig war, ist, verschiedene Dateien zu erstellen.

00:05:06.880 --> 00:05:09.780
<v Georg>Sei es MP3, AAC.

00:05:09.780 --> 00:05:11.960
<v Georg>Da hat es ja alle möglichen Formate damals noch gegeben.

00:05:11.960 --> 00:05:14.540
<v Georg>Und die Metadaten korrekt zu haben und so weiter und so fort.

00:05:14.540 --> 00:05:18.360
<v Georg>Und so ist das ganze Projekt sozusagen entstanden.

00:05:18.360 --> 00:05:21.500
<v Georg>Warum jetzt im beiden Podcast, wenn Sie einige fragen.

00:05:21.500 --> 00:05:25.700
<v Georg>Also, bei uns ist ja fast alles mit beiden gemacht.

00:05:25.700 --> 00:05:27.060
<v Georg>Weil...

00:05:27.060 --> 00:05:27.300
<v Georg>Weil...

00:05:27.300 --> 00:05:27.500
<v Georg>Weil...

00:05:28.020 --> 00:05:30.960
<v Georg>Allein schon von der ganzen Algorithmen-Seite ist das alles mit beiden.

00:05:30.960 --> 00:05:32.320
<v Georg>Hat das immer...

00:05:32.320 --> 00:05:33.460
<v Georg>War das immer schon auf beiden.

00:05:33.460 --> 00:05:35.860
<v Georg>Dann das ganze Websystem haben wir auch mit beiden gemacht.

00:05:35.860 --> 00:05:38.700
<v Dominik>Da erzählen wir bitte gerne gleich noch ein bisschen ausführlicher drüber.

00:05:38.700 --> 00:05:41.220
<v Dominik>Das interessiert unsere Hörerinnen natürlich sehr.

00:05:41.220 --> 00:05:42.380
<v Dominik>Glaube ich.

00:05:42.380 --> 00:05:43.260
<v Dominik>Vielleicht.

00:05:43.260 --> 00:05:44.540
<v Dominik>Ja.

00:05:44.540 --> 00:05:45.540
<v Dominik>Okay.

00:05:45.540 --> 00:05:47.740
<v Jochen>Ja, das klingt auch gut.

00:05:47.740 --> 00:05:50.200
<v Jochen>Und genau.

00:05:50.200 --> 00:05:52.080
<v Jochen>Ich weiß nicht, wie kommt denn dann...

00:05:52.080 --> 00:05:53.160
<v Jochen>Also, ich habe immer schon...

00:05:53.160 --> 00:05:53.840
<v Jochen>Also, ich höre ja...

00:05:53.840 --> 00:05:55.580
<v Jochen>Ich habe schon ganz lange immer Podcast gehört.

00:05:55.580 --> 00:05:57.700
<v Jochen>Und gefühlt war so...

00:05:57.700 --> 00:05:59.780
<v Jochen>Vor allem auch schon relativ früh mit dabei.

00:05:59.780 --> 00:06:01.400
<v Jochen>Wie...

00:06:01.400 --> 00:06:03.680
<v Jochen>War ein Podcast speziell irgendwie?

00:06:03.680 --> 00:06:09.380
<v Jochen>Auch so eine Motivation dafür, irgendwie das zu machen?

00:06:09.380 --> 00:06:11.740
<v Jochen>Oder ist das halt irgendwie später dazu gekommen,

00:06:11.740 --> 00:06:15.440
<v Jochen>dass das Podcast funktioniert vielleicht?

00:06:15.440 --> 00:06:19.500
<v Georg>Ja, also zuerst...

00:06:19.500 --> 00:06:22.820
<v Georg>Das erste System war quasi explizit für Podcasts, ja.

00:06:22.820 --> 00:06:25.640
<v Georg>Das war der Tim damals, der Tim Britloff,

00:06:25.640 --> 00:06:27.640
<v Georg>der immer gestöhnt hat.

00:06:27.700 --> 00:06:28.980
<v Georg>Er hat gesagt, dass alles so kompliziert ist.

00:06:28.980 --> 00:06:32.220
<v Georg>Und da denkt man sich dann natürlich,

00:06:32.220 --> 00:06:34.080
<v Georg>na okay, da braucht man halt immer so ein Tool.

00:06:34.080 --> 00:06:36.100
<v Georg>Und das hat dann eben so angefangen.

00:06:36.100 --> 00:06:38.600
<v Georg>Zuerst mit dem Leveling,

00:06:38.600 --> 00:06:40.360
<v Georg>dass man eben verschiedene Lautstärken

00:06:40.360 --> 00:06:41.680
<v Georg>von verschiedenen Sprechern

00:06:41.680 --> 00:06:43.960
<v Georg>auf gleiche Levels bringt und so weiter.

00:06:43.960 --> 00:06:46.440
<v Georg>Und dann eben so ein Web-System,

00:06:46.440 --> 00:06:47.940
<v Georg>also so ein Web-Interface dazu.

00:06:47.940 --> 00:06:52.900
<v Georg>Und von dort weg ist es dann halt weiter gewachsen

00:06:52.900 --> 00:06:54.460
<v Georg>in andere Bereiche.

00:06:54.460 --> 00:06:57.340
<v Georg>Der Tim hat das dann eben auch angekündigt.

00:06:57.400 --> 00:06:58.560
<v Georg>Auf seinem Podcast damals.

00:06:58.560 --> 00:07:01.440
<v Georg>Und so sind halt viele andere

00:07:01.440 --> 00:07:03.100
<v Georg>Podcaster auch dazukommen.

00:07:03.100 --> 00:07:05.540
<v Georg>Und dann hat sich das immer sehr schön langsam

00:07:05.540 --> 00:07:06.380
<v Georg>weiter verbreitet.

00:07:06.380 --> 00:07:09.540
<v Jochen>Ja, ich glaube, ich habe es auch daher mal gehört,

00:07:09.540 --> 00:07:11.060
<v Jochen>denke ich, wahrscheinlich, ja.

00:07:11.060 --> 00:07:12.640
<v Jochen>Genau, ja.

00:07:12.640 --> 00:07:17.060
<v Jochen>Ja, das ist ja auch interessant.

00:07:17.060 --> 00:07:19.120
<v Jochen>Ich habe auch den Eindruck,

00:07:19.120 --> 00:07:21.000
<v Jochen>dass ihr da am Anfang

00:07:21.000 --> 00:07:22.740
<v Jochen>relativ viel so Scikit-Learn

00:07:22.740 --> 00:07:24.040
<v Jochen>irgendwie verwendet habt zumindest

00:07:24.040 --> 00:07:26.640
<v Jochen>für irgendwie diese ganzen...

00:07:27.400 --> 00:07:28.600
<v Jochen>Anpassungen.

00:07:28.600 --> 00:07:31.740
<v Georg>Ja, also wir haben ganz am Anfang

00:07:31.740 --> 00:07:34.600
<v Georg>so viel mit NumPy, Scikit-Learn,

00:07:34.600 --> 00:07:36.600
<v Georg>ja, SciPy, also diese ganzen

00:07:36.600 --> 00:07:38.680
<v Georg>Signalfarbe-Docs

00:07:38.680 --> 00:07:39.980
<v Georg>und Machine Learning Packages,

00:07:39.980 --> 00:07:41.800
<v Georg>was es eben damals so gegeben hat.

00:07:41.800 --> 00:07:44.680
<v Georg>Und das war eh...

00:07:44.680 --> 00:07:46.100
<v Georg>Vielleicht kannst du kurz sagen, wann damals war?

00:07:46.100 --> 00:07:48.560
<v Georg>Damals, also gestartet

00:07:48.560 --> 00:07:50.920
<v Georg>sind wir 2013,

00:07:50.920 --> 00:07:52.680
<v Georg>wenn ich das richtig im Kopf habe.

00:07:52.680 --> 00:07:54.780
<v Dominik>Also es ist bald das zwölfte Jahr.

00:07:54.780 --> 00:07:56.580
<v Dominik>Schon ein bisschen was Errotes dort.

00:07:56.580 --> 00:07:57.100
<v Dominik>Ja, das...

00:07:57.100 --> 00:08:00.940
<v Georg>Das waren halt die frühen 2010er-Jahre quasi,

00:08:00.940 --> 00:08:03.160
<v Georg>wo die erste Version entstanden ist.

00:08:03.160 --> 00:08:05.580
<v Georg>Und...

00:08:05.580 --> 00:08:06.920
<v Georg>Ja, was...

00:08:06.920 --> 00:08:09.000
<v Georg>Ich schätze mal, eure Hörer kennen eh

00:08:09.000 --> 00:08:11.120
<v Georg>diese ganzen Packages, also NumPy,

00:08:11.120 --> 00:08:13.120
<v Georg>so Array-Processing

00:08:13.120 --> 00:08:15.620
<v Georg>und SciPy

00:08:15.620 --> 00:08:16.940
<v Georg>setzt eben drauf auf,

00:08:16.940 --> 00:08:19.120
<v Georg>hat ein paar zusätzliche Algorithmen,

00:08:19.120 --> 00:08:21.060
<v Georg>vor allem im

00:08:21.060 --> 00:08:22.920
<v Georg>Signalfarbetungsbereich.

00:08:22.920 --> 00:08:25.020
<v Georg>Und Scikit-Learn,

00:08:25.020 --> 00:08:27.080
<v Georg>ja, waren halt früher hauptsächlich,

00:08:27.100 --> 00:08:29.100
<v Georg>alle möglichen Klassifikations-

00:08:29.100 --> 00:08:30.340
<v Georg>und Clustering-Algorithmen,

00:08:30.340 --> 00:08:33.420
<v Georg>auf denen wir dann halt auch aufgebaut haben.

00:08:33.420 --> 00:08:35.120
<v Georg>Und...

00:08:35.120 --> 00:08:37.260
<v Georg>Ja, vielleicht mal ein Beispiel,

00:08:37.260 --> 00:08:38.960
<v Georg>was wir damals da so machen konnten,

00:08:38.960 --> 00:08:40.400
<v Georg>so...

00:08:40.400 --> 00:08:41.860
<v Georg>Oder geht natürlich jetzt auch noch,

00:08:41.860 --> 00:08:43.360
<v Georg>aber jetzt gibt es halt andere Techniken auch.

00:08:43.360 --> 00:08:45.440
<v Georg>Wir haben halt damals versucht,

00:08:45.440 --> 00:08:49.140
<v Georg>früher hat es ja eigentlich nur so Audio-Plugins gegeben,

00:08:49.140 --> 00:08:51.300
<v Georg>was halt Signalverarbeitungsalgorithmen

00:08:51.300 --> 00:08:53.260
<v Georg>waren, die halt irgendwie abgelaufen

00:08:53.260 --> 00:08:55.500
<v Georg>sind und man hat da Parameter dann eingestellt

00:08:55.500 --> 00:08:57.000
<v Georg>und im Prinzip,

00:08:57.000 --> 00:08:58.740
<v Georg>war das immer noch sehr schwer

00:08:58.740 --> 00:09:00.880
<v Georg>zu bedienen, wie man es am Mischpult sieht.

00:09:00.880 --> 00:09:02.320
<v Georg>Und

00:09:02.320 --> 00:09:05.160
<v Georg>das Ganze haben wir

00:09:05.160 --> 00:09:07.380
<v Georg>versucht eigentlich einmal zu automatisieren.

00:09:07.380 --> 00:09:08.140
<v Georg>Das heißt, wir haben halt

00:09:08.140 --> 00:09:10.720
<v Georg>nicht nur diese DSP-Algorithmen gehabt,

00:09:10.720 --> 00:09:12.660
<v Georg>die man aufs Audio irgendwie anwendet, sondern

00:09:12.660 --> 00:09:14.740
<v Georg>versucht mit Klassifikatoren

00:09:14.740 --> 00:09:16.840
<v Georg>gewisse Sachen im Audio zu erkennen, also wo

00:09:16.840 --> 00:09:18.840
<v Georg>zum Beispiel verschiedene Sprecher sind, oder wo

00:09:18.840 --> 00:09:20.400
<v Georg>Musikteile sind, wo jetzt nur

00:09:20.400 --> 00:09:22.700
<v Georg>Rausch-Teile sind, oder

00:09:22.700 --> 00:09:24.540
<v Georg>eben nur Hintergrundgeräusche,

00:09:24.540 --> 00:09:26.980
<v Georg>oder Hintergrundmusik, Vordergrundmusik und lauter so.

00:09:26.980 --> 00:09:28.600
<v Georg>Und mit diesen

00:09:28.600 --> 00:09:33.080
<v Georg>Ergebnissen, die wir eben von den Klassifikatoren

00:09:33.080 --> 00:09:34.980
<v Georg>dann bekommen haben, dafür haben wir

00:09:34.980 --> 00:09:37.180
<v Georg>zum Beispiel im Scikit-Learn

00:09:37.180 --> 00:09:38.820
<v Georg>Sachen verwendet, wie jetzt

00:09:38.820 --> 00:09:40.980
<v Georg>SVMs oder

00:09:40.980 --> 00:09:43.220
<v Georg>irgendeine Decision-Trees

00:09:43.220 --> 00:09:44.940
<v Georg>mit Feature-Extraction vorher.

00:09:44.940 --> 00:09:46.740
<v Georg>Und aufgrund von diesen

00:09:46.740 --> 00:09:48.480
<v Georg>Analysedaten haben wir dann eben

00:09:48.480 --> 00:09:50.980
<v Georg>die Parameter der ganzen DSP-Algorithmen

00:09:50.980 --> 00:09:52.760
<v Georg>automatisch gesetzt.

00:09:52.760 --> 00:09:55.420
<v Georg>Also zum Beispiel, wenn man

00:09:55.420 --> 00:09:56.820
<v Georg>einen Denoiser hat, haben wir

00:09:56.820 --> 00:09:58.700
<v Georg>das Audio mal segmentiert in verschiedene

00:09:58.700 --> 00:10:01.220
<v Georg>Abschnitte, wo verschiedene Noise-Profile

00:10:01.220 --> 00:10:03.080
<v Georg>sind, also zum Beispiel

00:10:03.080 --> 00:10:04.880
<v Georg>wir reden jetzt hier in einem Raum, dann geht man raus,

00:10:04.880 --> 00:10:06.500
<v Georg>dann hat man natürlich ein anderes Noise-Profil.

00:10:06.500 --> 00:10:09.080
<v Georg>Da haben wir so ein Clustering gemacht, dass das Audio

00:10:09.080 --> 00:10:11.140
<v Georg>segmentiert, und dann in den

00:10:11.140 --> 00:10:13.320
<v Georg>einzelnen Segmenten

00:10:13.320 --> 00:10:14.960
<v Georg>haben wir geschaut, wo

00:10:14.960 --> 00:10:16.920
<v Georg>jetzt Sprecher sind, oder Musikteile, und in den

00:10:16.920 --> 00:10:19.100
<v Georg>stillen Teilen, wo halt eben keiner

00:10:19.100 --> 00:10:21.400
<v Georg>spricht, also wo nur der Noise-Floor

00:10:21.400 --> 00:10:23.160
<v Georg>sozusagen unten überbleibt,

00:10:23.160 --> 00:10:25.080
<v Georg>diese haben wir dann so zusammengestitcht

00:10:25.080 --> 00:10:26.740
<v Georg>und daraus Noise-Profile.

00:10:26.740 --> 00:10:26.800
<v Georg>Und dann haben wir dann auch

00:10:26.800 --> 00:10:28.600
<v Georg>extrahiert und

00:10:28.600 --> 00:10:30.420
<v Georg>diesen Noise dann quasi

00:10:30.420 --> 00:10:32.800
<v Georg>vom Gesamtsignal abgezogen.

00:10:32.800 --> 00:10:34.920
<v Georg>Und wiederum entschieden,

00:10:34.920 --> 00:10:36.640
<v Georg>ob das überhaupt Sinn macht, dass man

00:10:36.640 --> 00:10:38.820
<v Georg>das macht, oder ob das nicht Musik ist,

00:10:38.820 --> 00:10:40.220
<v Georg>und da wollen wir das vielleicht nicht abziehen.

00:10:40.220 --> 00:10:42.880
<v Georg>Also die Grundidee ist halt, dass man so verschiedene

00:10:42.880 --> 00:10:44.700
<v Georg>Klassifikatoren hat und mit denen

00:10:44.700 --> 00:10:46.800
<v Georg>dann die Algorithmen steuert.

00:10:46.800 --> 00:10:48.900
<v Georg>Und für das hat das

00:10:48.900 --> 00:10:50.960
<v Georg>ganz gut funktioniert, ja. Aber diese Algorithmen

00:10:50.960 --> 00:10:52.780
<v Jochen>sind dann quasi noch so die klassischen, ich weiß jetzt

00:10:52.780 --> 00:10:54.700
<v Jochen>nicht, ich hab jetzt so im Hinterkopf, da gibt's

00:10:54.700 --> 00:10:56.700
<v Jochen>irgendwie so Audio-Works,

00:10:56.780 --> 00:10:58.600
<v Jochen>Vibrations und irgendwelche Plugins und so

00:10:58.600 --> 00:11:00.700
<v Jochen>und da kann man dann wahrscheinlich die Parameter einstellen,

00:11:00.700 --> 00:11:02.400
<v Jochen>aber sozusagen die sind dann halt

00:11:02.400 --> 00:11:04.680
<v Jochen>übernommen, aber wie man die einstellt, ist

00:11:04.680 --> 00:11:06.360
<v Jochen>automatisiert über halt

00:11:06.360 --> 00:11:08.560
<v Georg>irgendwie... Übernommen, also die haben wir natürlich

00:11:08.560 --> 00:11:10.620
<v Georg>schon selber entwickelt, aber vom

00:11:10.620 --> 00:11:12.540
<v Georg>Prinzip her ähnlich natürlich, also

00:11:12.540 --> 00:11:14.440
<v Georg>man hat halt bestimmte Filter oder

00:11:14.440 --> 00:11:16.820
<v Georg>Kompressoren, Limiter und

00:11:16.820 --> 00:11:18.360
<v Georg>was gibt's noch,

00:11:18.360 --> 00:11:20.500
<v Georg>FFT-basierten Prozesse,

00:11:20.500 --> 00:11:22.400
<v Georg>so wie das ist, denoising zum Beispiel.

00:11:22.400 --> 00:11:23.900
<v Georg>Ja. Und

00:11:23.900 --> 00:11:26.700
<v Georg>auf diese Weise steuert

00:11:26.700 --> 00:11:27.860
<v Georg>man dann diese

00:11:27.860 --> 00:11:30.680
<v Georg>klassischen DSB-Algorithmen quasi, ja.

00:11:30.680 --> 00:11:32.780
<v Georg>Ja. Aber

00:11:32.780 --> 00:11:35.040
<v Jochen>genau, gibt's da nicht irgendwie,

00:11:35.040 --> 00:11:36.320
<v Jochen>wenn man jetzt zum Beispiel,

00:11:36.320 --> 00:11:38.860
<v Jochen>das ist ja auch ein spezieller Anwendungsfall

00:11:38.860 --> 00:11:40.620
<v Jochen>eigentlich, dass man halt das, dass man

00:11:40.620 --> 00:11:43.000
<v Jochen>so ein fertiges Audio hat, was man dann post-processen

00:11:43.000 --> 00:11:44.840
<v Jochen>will, kann man da nicht

00:11:44.840 --> 00:11:46.500
<v Jochen>auch noch irgendwie vielleicht

00:11:46.500 --> 00:11:48.200
<v Jochen>irgendwie Informationen,

00:11:48.200 --> 00:11:50.800
<v Jochen>mehr Informationen verwerten, wenn man

00:11:50.800 --> 00:11:52.680
<v Jochen>halt das ganze Audio, weil normalerweise

00:11:52.680 --> 00:11:54.560
<v Jochen>diese Audio-Works-Sessions sind ja immer so

00:11:54.560 --> 00:11:56.480
<v Jochen>mehr so drauf ausgelegt, dass man halt

00:11:56.480 --> 00:11:58.600
<v Jochen>irgendwie einen Mix so live

00:11:58.600 --> 00:11:59.640
<v Jochen>erzeugt und

00:11:59.640 --> 00:12:02.120
<v Jochen>da hat man ja gar nicht so viele Informationen.

00:12:02.120 --> 00:12:03.760
<v Georg>Das ist eben das,

00:12:03.760 --> 00:12:05.460
<v Georg>das ist eben das,

00:12:05.460 --> 00:12:08.560
<v Georg>der Unterschied von unserem System

00:12:08.560 --> 00:12:10.380
<v Georg>gewesen zu den anderen Sachen oder zu den

00:12:10.380 --> 00:12:12.060
<v Georg>meisten anderen Sachen, also

00:12:12.060 --> 00:12:14.520
<v Georg>das ist eben, das ist unser

00:12:14.520 --> 00:12:16.660
<v Georg>Konzept, wie es am Computer meistens funktioniert,

00:12:16.660 --> 00:12:19.040
<v Georg>also in Audio-Plugins

00:12:19.040 --> 00:12:20.440
<v Georg>ist es halt

00:12:20.440 --> 00:12:22.200
<v Georg>eigentlich ein Realtime-Konzept, also

00:12:22.200 --> 00:12:24.200
<v Georg>ein Plugin sieht ja nur einen kleinen

00:12:24.200 --> 00:12:26.420
<v Georg>Buffer an Audio, den er prozessiert,

00:12:26.420 --> 00:12:28.440
<v Georg>und der muss ja jetzt auch so

00:12:28.440 --> 00:12:30.240
<v Georg>schnell wie möglich prozessieren und dann spuckt er

00:12:30.240 --> 00:12:32.160
<v Georg>wieder aus, weil das System ja

00:12:32.160 --> 00:12:34.080
<v Georg>auf Realtime ausgelegt ist

00:12:34.080 --> 00:12:35.880
<v Georg>und es hat

00:12:35.880 --> 00:12:38.320
<v Georg>zumindest damals sehr wenig Programme

00:12:38.320 --> 00:12:40.420
<v Georg>gegeben, die jetzt ja wirklich so

00:12:40.420 --> 00:12:42.420
<v Georg>Offline-Audio-Berechnung

00:12:42.420 --> 00:12:44.560
<v Georg>gemacht haben und

00:12:44.560 --> 00:12:45.760
<v Georg>das war

00:12:45.760 --> 00:12:48.300
<v Georg>damals eben der Levelator, den es da

00:12:48.300 --> 00:12:50.140
<v Georg>gegeben hat, das war auch so ein Programm, das

00:12:50.140 --> 00:12:52.440
<v Georg>einfach die Levels quasi gleich geregelt

00:12:52.440 --> 00:12:54.600
<v Georg>hat von Aufnahmen,

00:12:54.600 --> 00:12:55.520
<v Georg>die mich

00:12:56.200 --> 00:12:58.340
<v Georg>BruteForce, also der hat nicht geschaut, ob da irgendwie

00:12:58.340 --> 00:13:00.380
<v Georg>Musik ist, das hat er vollkommen zerstört, aber halt

00:13:00.380 --> 00:13:02.400
<v Georg>einfach versucht, alles irgendwie gleich laut zu machen

00:13:02.400 --> 00:13:03.740
<v Georg>und

00:13:03.740 --> 00:13:06.400
<v Georg>dieses Programm hat

00:13:06.400 --> 00:13:08.380
<v Georg>mich damals ein bisschen fasziniert, weil ich doch

00:13:08.380 --> 00:13:10.360
<v Georg>aus der Audio-Bubble sozusagen gekommen

00:13:10.360 --> 00:13:12.580
<v Georg>bin und das haben mir die Podcaster damals gezeigt

00:13:12.580 --> 00:13:14.500
<v Georg>und ich habe mir gedacht, warum habe ich noch nie

00:13:14.500 --> 00:13:16.200
<v Georg>von dem gehört, das ist ja eigentlich ganz praktisch,

00:13:16.200 --> 00:13:18.000
<v Georg>weil in der ganzen

00:13:18.000 --> 00:13:20.240
<v Georg>professionellen Audio-Welt

00:13:20.240 --> 00:13:22.420
<v Georg>dieses Konzept einfach nicht existent

00:13:22.420 --> 00:13:23.760
<v Georg>war, also wirklich, also

00:13:23.760 --> 00:13:26.140
<v Georg>weil es da halt natürlich die super

00:13:26.140 --> 00:13:28.340
<v Georg>speziellen Plugins geben, die

00:13:28.340 --> 00:13:30.640
<v Georg>von den namhaften Herstellern

00:13:30.640 --> 00:13:32.160
<v Georg>und so weiter, aber

00:13:32.160 --> 00:13:34.220
<v Georg>dieses Konzept haben wir dann auch

00:13:34.220 --> 00:13:36.520
<v Georg>versucht ähnlich zu machen, also weg von dem Plugin-Konzept

00:13:36.520 --> 00:13:38.500
<v Georg>und eben einfach das gesamte

00:13:38.500 --> 00:13:40.220
<v Georg>Audio analysiert, das heißt man hat

00:13:40.220 --> 00:13:42.160
<v Georg>vorher schon mal schauen können, wo was passiert und

00:13:42.160 --> 00:13:44.340
<v Georg>danach eben die Algorithmen dann darauf anpassen

00:13:44.340 --> 00:13:46.600
<v Georg>zusätzlich

00:13:46.600 --> 00:13:48.260
<v Georg>ist es natürlich praktisch, das kann man

00:13:48.260 --> 00:13:50.100
<v Georg>dann als Web-Service anbieten, weil

00:13:50.100 --> 00:13:52.440
<v Georg>da kann man dann das ganze feil hin tun

00:13:52.440 --> 00:13:53.920
<v Georg>und das wird dann halt einfach

00:13:53.920 --> 00:13:55.860
<v Georg>sozusagen im Hintergrund

00:13:55.860 --> 00:13:55.920
<v Georg>äh

00:13:55.920 --> 00:13:57.960
<v Georg>prozessiert und dann bieten sie

00:13:57.960 --> 00:13:59.780
<v Georg>natürlich auch andere Sachen an, dass man

00:13:59.780 --> 00:14:01.660
<v Georg>das feilt dann gleich mal hin

00:14:01.660 --> 00:14:04.100
<v Georg>distributiert, also auf YouTube und auf Soundcloud

00:14:04.100 --> 00:14:05.520
<v Georg>war damals man ziemlich populär

00:14:05.520 --> 00:14:07.600
<v Georg>und alle möglichen anderen Targets

00:14:07.600 --> 00:14:09.760
<v Georg>auf den eigenen Server oder

00:14:09.760 --> 00:14:11.680
<v Georg>verschiedene andere

00:14:11.680 --> 00:14:13.420
<v Georg>Publikations- und

00:14:13.420 --> 00:14:15.580
<v Georg>Encoding-Steps dann

00:14:15.580 --> 00:14:16.600
<v Georg>dazu tun.

00:14:16.600 --> 00:14:19.860
<v Dominik>Darf ich noch so ein paar Fragen stellen, vielleicht zu diesem Audio-Ding?

00:14:19.860 --> 00:14:20.800
<v Dominik>Das würde mich so ein bisschen

00:14:20.800 --> 00:14:23.140
<v Dominik>mehr interessieren, also du hast das aus der

00:14:23.140 --> 00:14:25.500
<v Dominik>Tontechnik-Welt quasi gedacht, ja?

00:14:25.920 --> 00:14:27.780
<v Dominik>Und wenn du sagst, okay, du möchtest

00:14:27.780 --> 00:14:29.840
<v Dominik>die Sachen auspegeln irgendwie, dann

00:14:29.840 --> 00:14:31.700
<v Dominik>guckst du darauf, dass

00:14:31.700 --> 00:14:33.920
<v Dominik>das so ein bisschen harmonisch ist und du

00:14:33.920 --> 00:14:35.840
<v Dominik>guckst, dass das so ein bisschen Raum gibt

00:14:35.840 --> 00:14:37.440
<v Dominik>und du versuchst dann mit

00:14:37.440 --> 00:14:39.260
<v Dominik>den Filtern,

00:14:39.260 --> 00:14:41.920
<v Dominik>die durch das Machine Learning trainiert

00:14:41.920 --> 00:14:43.740
<v Dominik>sind, zu erkennen, was jetzt ein

00:14:43.740 --> 00:14:46.080
<v Dominik>Störgeräusch ist und nicht zur Stimme gehört

00:14:46.080 --> 00:14:48.720
<v Dominik>und

00:14:48.720 --> 00:14:50.960
<v Dominik>ja, also so

00:14:50.960 --> 00:14:53.620
<v Dominik>ich versuch's so ein bisschen einfach darzustellen, ja, weil ich möchte gerne

00:14:53.620 --> 00:14:55.620
<v Dominik>diesen Prozess aus dieser Audio-Perspektive

00:14:55.920 --> 00:14:57.280
<v Dominik>so ein bisschen eher verstehen.

00:14:57.280 --> 00:14:58.700
<v Dominik>Ja,

00:14:58.700 --> 00:15:02.120
<v Georg>naja, ich rede jetzt immer noch aus der Perspektive,

00:15:02.120 --> 00:15:03.020
<v Georg>wie das quasi

00:15:03.020 --> 00:15:04.660
<v Georg>früher war.

00:15:04.660 --> 00:15:06.340
<v Georg>Aber

00:15:06.340 --> 00:15:08.780
<v Georg>nehmen wir vielleicht mal dieses

00:15:08.780 --> 00:15:11.760
<v Georg>Leveling-Beispiel, was muss man da machen?

00:15:11.760 --> 00:15:13.600
<v Georg>Also wenn man jetzt verschiedene Sprecher hat,

00:15:13.600 --> 00:15:16.300
<v Georg>zum Beispiel

00:15:16.300 --> 00:15:17.840
<v Georg>wie wir da, einer ist halt

00:15:17.840 --> 00:15:19.400
<v Georg>viel lauter, einer ist viel leiser

00:15:19.400 --> 00:15:21.840
<v Georg>und das wechselt sich dann ab

00:15:21.840 --> 00:15:23.900
<v Georg>und

00:15:23.900 --> 00:15:25.640
<v Georg>wo war ich jetzt?

00:15:25.920 --> 00:15:27.960
<v Georg>Ja, dann hat man jetzt irgendwelche anderen Sachen noch

00:15:27.960 --> 00:15:30.180
<v Georg>dabei, also Intro-Musik zum Beispiel

00:15:30.180 --> 00:15:32.040
<v Georg>oder dann ist wieder mal

00:15:32.040 --> 00:15:34.000
<v Georg>Pause und dann hört man irgendwelche anderen

00:15:34.000 --> 00:15:35.400
<v Georg>Geräusche.

00:15:35.400 --> 00:15:36.680
<v Georg>Dann

00:15:36.680 --> 00:15:39.840
<v Georg>nennt sich das so

00:15:39.840 --> 00:15:41.860
<v Georg>Voice-Activity-Detection, also man

00:15:41.860 --> 00:15:43.880
<v Georg>detektiert eben, wo jetzt wirklich die

00:15:43.880 --> 00:15:45.980
<v Georg>Sprache aktiv ist und wo jetzt Pausen

00:15:45.980 --> 00:15:48.020
<v Georg>sind, dann detektiert man

00:15:48.020 --> 00:15:50.100
<v Georg>zum Beispiel, wo jetzt Musiksegmente sind

00:15:50.100 --> 00:15:51.740
<v Georg>und dann, wo jetzt irgendwas

00:15:51.740 --> 00:15:54.400
<v Georg>anderes ist, also irgendeine Störgeräusche,

00:15:54.400 --> 00:15:55.700
<v Georg>die jetzt weder Sprache noch

00:15:55.700 --> 00:15:57.640
<v Georg>Musik sind sozusagen

00:15:57.640 --> 00:15:59.820
<v Georg>und dann, wenn man jetzt

00:15:59.820 --> 00:16:01.940
<v Georg>die verschiedenen Sprachsegmente

00:16:01.940 --> 00:16:03.320
<v Georg>hat und da sind große

00:16:03.320 --> 00:16:05.840
<v Georg>Level-Unterschiede, dann versucht man die so schnell

00:16:05.840 --> 00:16:07.660
<v Georg>wie möglich nachzuregeln, dass

00:16:07.660 --> 00:16:09.700
<v Georg>sie möglichst ähnlich laut klingen, also

00:16:09.700 --> 00:16:11.200
<v Georg>relativ schnell

00:16:11.200 --> 00:16:13.920
<v Georg>zu faden. Bei Musik

00:16:13.920 --> 00:16:15.640
<v Georg>muss man das jetzt wieder anders machen, weil wenn man

00:16:15.640 --> 00:16:17.620
<v Georg>in der Musik jetzt so schnell nachregelt, dann würde man

00:16:17.620 --> 00:16:19.780
<v Georg>die ganze innere Dynamik

00:16:19.780 --> 00:16:21.780
<v Georg>der Musik zerstören, weil Musik braucht

00:16:21.780 --> 00:16:23.880
<v Georg>ja viel mehr Dynamik natürlich, sind ja alles

00:16:23.880 --> 00:16:25.340
<v Georg>ziemlich, ziemlich

00:16:25.700 --> 00:16:27.820
<v Georg>wurscht, nicht wurscht in dem Sinn,

00:16:27.820 --> 00:16:30.040
<v Georg>dass alles gleich laut ist und dann nicht mehr gut klingt.

00:16:30.040 --> 00:16:32.000
<v Georg>Das heißt, bei Musik muss man das natürlich

00:16:32.000 --> 00:16:33.660
<v Georg>wiederum anders machen, deswegen muss man das vorher

00:16:33.660 --> 00:16:35.720
<v Georg>klassifizieren, dann hat man wieder irgendwelche anderen

00:16:35.720 --> 00:16:37.600
<v Georg>Geräusche, die jetzt weder Musik noch

00:16:37.600 --> 00:16:39.740
<v Georg>Sprache sind, die wird man wahrscheinlich nicht

00:16:39.740 --> 00:16:41.900
<v Georg>raufregeln wollen, also

00:16:41.900 --> 00:16:43.580
<v Georg>das kennt man von so alten

00:16:43.580 --> 00:16:46.020
<v Georg>Automatik-Gain-Control-Algorithmen

00:16:46.020 --> 00:16:47.560
<v Georg>bei diversen

00:16:47.560 --> 00:16:49.620
<v Georg>Recording-Systemen, wenn man das einstellt

00:16:49.620 --> 00:16:51.740
<v Georg>und dann stehen lässt und dann mal der Zeit lang nichts sagt,

00:16:51.740 --> 00:16:53.640
<v Georg>dann wird auf einmal der Noise-Begel komplett

00:16:53.640 --> 00:16:55.020
<v Georg>hochgezogen vom Hintergrund,

00:16:55.480 --> 00:16:57.520
<v Georg>und dann fängt wieder irgendwer zum Sprechen an,

00:16:57.520 --> 00:16:59.480
<v Georg>dann regelt der Begel

00:16:59.480 --> 00:17:01.480
<v Georg>wieder runter und dann ist der Noise wieder unten

00:17:01.480 --> 00:17:03.480
<v Georg>und die Sprache kommt wieder, also genau

00:17:03.480 --> 00:17:05.920
<v Georg>solche Pumping-Artefakte,

00:17:05.920 --> 00:17:07.580
<v Georg>dass irgendwas hochgezogen wird, was man

00:17:07.580 --> 00:17:09.460
<v Georg>nicht will, will man natürlich

00:17:09.460 --> 00:17:11.640
<v Georg>nicht haben und das kann man natürlich

00:17:11.640 --> 00:17:13.500
<v Georg>viel besser machen, wenn man das ganze

00:17:13.500 --> 00:17:14.900
<v Georg>Pfeil vorher klassifiziert, wo

00:17:14.900 --> 00:17:17.440
<v Georg>welche Events, also so ein

00:17:17.440 --> 00:17:19.600
<v Georg>basierende Relevanz sind für diesen Algorithmus

00:17:19.600 --> 00:17:21.620
<v Georg>jetzt und dann weiß man

00:17:21.620 --> 00:17:23.640
<v Georg>schon, das ist da und das ist da und dann kann man

00:17:23.640 --> 00:17:24.320
<v Georg>diese

00:17:24.320 --> 00:17:24.600
<v Georg>...

00:17:24.600 --> 00:17:25.260
<v Georg>...

00:17:25.260 --> 00:17:30.900
<v Georg>Dieses Nachregeln natürlich ein bisschen besser machen, ganz einfach. Ich hoffe, das war jetzt deine Frage.

00:17:55.260 --> 00:18:07.660
<v Jochen>Ja, aber ist Musik eigentlich überhaupt jemals sozusagen auch das Ziel gewesen, dass man das halt verbessern kann? Oder ist das auch vor allem nicht eher schon immer irgendwie Sprache, reine Sprache gewesen?

00:18:07.660 --> 00:18:11.660
<v Georg>Ja, aber du musst ja mit der Musik auch irgendwie klar kommen.

00:18:11.660 --> 00:18:20.760
<v Georg>Das Problem ist ja, du kannst ja nicht einfach nichts machen, weil wenn du jetzt die Sprache irgendwie großartig nachregelst und dann ist die Musik wieder ganz woanders, dann passt das ja erst wieder nicht zusammen.

00:18:20.760 --> 00:18:25.160
<v Georg>Also wir versuchen natürlich die Musik so wenig.

00:18:25.260 --> 00:18:35.860
<v Georg>Wie möglich zu verändern, sag ich mal. Also künstlerisch zu verändern, sondern einfach so anzupassen, dass sie zum Rest von der Produktion passt.

00:18:35.860 --> 00:18:47.180
<v Georg>Also dass halt die Lautstärkenverhältnisse zu den Sprechern und der Musik einigermaßen passt, dass die Lautstärkenverhältnisse in der Musik nicht so viel verändert werden.

00:18:47.180 --> 00:18:54.360
<v Georg>Also natürlich werden sie ein bisschen verändert, aber nicht zu extrem. Und spektral wird die Musik jetzt eigentlich auch nicht verändert.

00:18:54.360 --> 00:18:55.180
<v Georg>Also wir...

00:18:55.260 --> 00:18:57.280
<v Georg>Zumindest bis jetzt nicht.

00:18:57.280 --> 00:18:59.280
<v Georg>Vielleicht machen wir das in Zukunft einmal.

00:18:59.280 --> 00:19:11.280
<v Georg>Also, weil wir gehen natürlich davon aus, meistens hat man so ein Einspieler oder sonst irgendwas, das ist schon vorproduziert, das ist künstlerisch meistens so gewollt und da will man jetzt nicht so großartig was ändern dabei.

00:19:11.280 --> 00:19:17.180
<v Georg>Außer vielleicht ein bisschen Noise weglöschen oder eben die Begel anpassen, dass sie zum Rest passen.

00:19:17.180 --> 00:19:24.140
<v Georg>Was man natürlich auch sehr oft an so Musikmixes, da macht es ja schon Sinn, also wenn man jetzt ein Stück hat, das sehr laut ist an sehr leise, das passt dann auch.

00:19:24.140 --> 00:19:26.100
<v Georg>Passen wir schon an, dass das dann wieder zusammenpasst.

00:19:26.100 --> 00:19:28.860
<v Georg>Aber jetzt nicht den spektralen Content in der Musik.

00:19:28.860 --> 00:19:30.100
<v Georg>Ja.

00:19:30.100 --> 00:19:33.980
<v Jochen>Aber genau, ist das denn...

00:19:33.980 --> 00:19:37.720
<v Jochen>Aber inzwischen hat sich ja auch im Machine Learning-Bereich

00:19:37.720 --> 00:19:40.840
<v Jochen>so einiges getan, so in den letzten zehn Jahren.

00:19:40.840 --> 00:19:43.340
<v Jochen>Ich meine, 2013 hat das mit dem Deep Learning

00:19:43.340 --> 00:19:44.300
<v Jochen>und so gerade erst angefangen.

00:19:44.300 --> 00:19:48.180
<v Jochen>Gibt es da inzwischen auch Geschichten,

00:19:48.180 --> 00:19:49.940
<v Jochen>wo man das so mehr so richtig End-to-End,

00:19:49.940 --> 00:19:53.260
<v Jochen>ohne dass man dann noch irgendwelche Blöcke dazwischen hat,

00:19:53.300 --> 00:19:55.280
<v Jochen>die man konfiguriert, sondern einfach quasi,

00:19:55.280 --> 00:19:57.660
<v Jochen>man könnte ja auch das alles irgendwie insgesamt lernen

00:19:57.660 --> 00:20:00.540
<v Jochen>und dann halt Audio rein auf der einen Seite

00:20:00.540 --> 00:20:01.780
<v Jochen>in irgendwie ein neuronales Netz

00:20:01.780 --> 00:20:02.960
<v Jochen>und dann wieder Audio auch wieder raus.

00:20:02.960 --> 00:20:06.740
<v Jochen>Hat sich das da eigentlich in die Richtung schon entwickelt?

00:20:06.740 --> 00:20:09.160
<v Jochen>Weil ich habe da ehrlich gesagt ja keine Ahnung von.

00:20:09.160 --> 00:20:13.460
<v Georg>Ja, so funktioniert es im Moment eigentlich.

00:20:13.460 --> 00:20:18.040
<v Georg>Also, wie gesagt, wenn man jetzt von der Geschichte her kommt,

00:20:18.040 --> 00:20:22.100
<v Georg>von NumPy, SciPy und CKitLearn und so weiter,

00:20:23.300 --> 00:20:26.720
<v Georg>dann sind immer weitere Algorithmen gekommen.

00:20:26.720 --> 00:20:29.180
<v Georg>Also ich habe zum Beispiel meine Diplomarbeit damals

00:20:29.180 --> 00:20:31.720
<v Georg>auch schon mit so neuronalen Netzen gemacht.

00:20:31.720 --> 00:20:34.240
<v Georg>Das war 2007 oder 2008.

00:20:34.240 --> 00:20:38.080
<v Georg>Da war das noch ganz am Anfang, vor allem im Audio-Bereich.

00:20:38.080 --> 00:20:42.200
<v Georg>Und am Anfang von der Phonik haben wir das jetzt noch nicht gehabt,

00:20:42.200 --> 00:20:45.280
<v Georg>weil es ja einfach nur zu aufwendig war zum Rechnen.

00:20:45.280 --> 00:20:50.500
<v Georg>Aber dann sind wir eh gleich in diese Richtung einmal gegangen.

00:20:50.500 --> 00:20:53.280
<v Georg>Also, ich meine, schon in beiden Podcasts,

00:20:53.300 --> 00:20:55.200
<v Georg>zehn, kann man eh von den Tools auch ein bisschen reden.

00:20:55.200 --> 00:20:59.140
<v Georg>Zuerst war dann das Dancerflow sehr, sehr beliebt am Anfang.

00:20:59.140 --> 00:21:04.160
<v Georg>Vor allem mit diesem Keras, dieser Keras-Library.

00:21:04.160 --> 00:21:06.960
<v Georg>Das war damals so ein Wrapper für Dancerflow im Prinzip,

00:21:06.960 --> 00:21:12.360
<v Georg>einfach mit einer einfacheren API, also einfacher zu verwenden.

00:21:12.360 --> 00:21:14.540
<v Jochen>Ja, inzwischen ist es, glaube ich, die offizielle API-Aufwand.

00:21:14.540 --> 00:21:16.740
<v Georg>Ja, die haben es, glaube ich, irgendwie,

00:21:16.740 --> 00:21:19.660
<v Georg>oder der Typ bei Keras ist dann, glaube ich, irgendwann zu Google

00:21:19.660 --> 00:21:21.560
<v Georg>und dann haben sie das gleich dazu einbaut.

00:21:21.560 --> 00:21:22.040
<v Georg>Ja.

00:21:22.040 --> 00:21:22.980
<v Georg>Ja.

00:21:22.980 --> 00:21:25.680
<v Georg>Wie auch immer, zuerst haben wir viel mit Keras eben gemacht

00:21:25.680 --> 00:21:29.860
<v Georg>und dann irgendwann sind wir dann eh so wie alle auch auf PyTorch.

00:21:29.860 --> 00:21:32.680
<v Georg>Mittlerweile machen wir eigentlich alles mit PyTorch,

00:21:32.680 --> 00:21:33.320
<v Georg>also eh schon lang.

00:21:33.320 --> 00:21:36.580
<v Georg>Aber jetzt zu den Algorithmen, wie funktioniert das jetzt?

00:21:36.580 --> 00:21:39.920
<v Georg>Also, eigentlich ziemlich anders.

00:21:39.920 --> 00:21:43.500
<v Georg>Also, wie du gesagt hast, mittlerweile kommt eigentlich

00:21:43.500 --> 00:21:46.800
<v Georg>einfach nur mehr Audio rein und Audio raus dann.

00:21:46.800 --> 00:21:48.880
<v Georg>Also, es ist viel mehr Blackbox als vorher.

00:21:48.880 --> 00:21:52.880
<v Georg>Und wie funktioniert das?

00:21:52.980 --> 00:21:57.560
<v Georg>Das heißt, man ist jetzt natürlich hauptsächlich damit beschäftigt,

00:21:57.560 --> 00:22:00.480
<v Georg>oder mit vielen Sachen beschäftigt, aber ein großer Punkt ist natürlich,

00:22:00.480 --> 00:22:04.080
<v Georg>dass man jetzt die ganzen Datensätze eben zusammenstellt.

00:22:04.080 --> 00:22:09.020
<v Georg>Nehmen wir noch mal den Beispiel mit Denoising, also Störgeräusche weglöschen.

00:22:09.020 --> 00:22:13.920
<v Georg>Dazu braucht man natürlich ganz viele Audio-Sprachfiles,

00:22:13.920 --> 00:22:17.780
<v Georg>die, wenn wir jetzt nur Sprache betrachten, braucht man ganz viele Sprachfiles,

00:22:17.780 --> 00:22:21.780
<v Georg>die gut klingen, also ganz viele Sprecher, verschiedene Sprachen,

00:22:21.780 --> 00:22:22.780
<v Georg>verschiedene Geschlechter.

00:22:22.820 --> 00:22:26.720
<v Georg>Verschiedene Ausdrucksweisen, verschiedene Sprachstile,

00:22:26.720 --> 00:22:31.720
<v Georg>emotionale Sprache, Fadesprache, was auch immer man sich flüstern,

00:22:31.720 --> 00:22:34.720
<v Georg>was immer man sich denken kann, also alles Mögliche, was es dazu gibt.

00:22:34.720 --> 00:22:37.720
<v Georg>Und das natürlich in einer guten Qualität, ohne viel Rauschen.

00:22:37.720 --> 00:22:43.720
<v Georg>Dann braucht man natürlich ganz große Datensätze von verschiedenen Noise-Daten,

00:22:43.720 --> 00:22:46.720
<v Georg>also statisches Rauschen, dann ein Auto, das hinten vorbeifährt,

00:22:46.720 --> 00:22:52.560
<v Georg>oder irgendwelche Klopfgeräusche am Computer und so weiter.

00:22:52.660 --> 00:22:54.560
<v Georg>Alles, was man sich irgendwie vorstellen kann.

00:22:54.560 --> 00:22:57.560
<v Georg>Musik natürlich auch, falls man Musik auch wegrechnen will.

00:22:57.560 --> 00:23:01.560
<v Georg>Baby schreien, Hunde bellen.

00:23:01.560 --> 00:23:07.560
<v Georg>Und dann mischt man diese Daten eben zusammen, also dass man aus diesen schönen Daten

00:23:07.560 --> 00:23:09.560
<v Georg>eben das Rauschen dazurechnet.

00:23:09.560 --> 00:23:14.560
<v Georg>Das ist dann quasi das schlechte Signal, das ist das Input von dem Netzwerk.

00:23:14.560 --> 00:23:17.560
<v Georg>Und als Target hat man dann einfach das schöne Signal.

00:23:17.560 --> 00:23:21.560
<v Georg>Und dann trainiert man eben dieses Model, das Netzwerk an.

00:23:21.660 --> 00:23:23.560
<v Georg>Also ihr kennt das wahrscheinlich ja alle.

00:23:23.560 --> 00:23:28.560
<v Georg>Und dann hat das eben einen bestimmten Lernalgorithmus,

00:23:28.560 --> 00:23:32.560
<v Georg>das die Gewichte in diesem neuronalen Netzwerk eben updatet

00:23:32.560 --> 00:23:37.560
<v Georg>und dadurch versucht es eben zu lernen, wenn man das reinschickt, kommt das raus.

00:23:37.560 --> 00:23:41.560
<v Georg>Und versucht eben zu generalisieren für alle möglichen anderen Sachen,

00:23:41.560 --> 00:23:44.560
<v Georg>die dazwischen sind, die man eben nicht explizit gelernt hat.

00:23:44.560 --> 00:23:51.400
<v Georg>Zusätzlich zu diesen Daten und Model gibt es ja noch so Transformationen,

00:23:51.500 --> 00:23:56.400
<v Georg>also das Audio wird nicht nur durch das Zumischen von Neues schlechter gemacht,

00:23:56.400 --> 00:23:58.400
<v Georg>sondern man kann auch noch alles mögliche andere machen.

00:23:58.400 --> 00:24:04.400
<v Georg>Man kann Filter-Artefakte draufrechnen, die das Netzwerk dann wegrechnen soll

00:24:04.400 --> 00:24:08.400
<v Georg>oder das Audio Clippen zum Beispiel und das versucht es wieder wegzurechnen

00:24:08.400 --> 00:24:12.400
<v Georg>oder irgendwelche Kompressoren am Target oder am Input drauflegen.

00:24:12.400 --> 00:24:17.400
<v Georg>Also alles, was man früher so eigentlich an Signalbearbeitungsalgorithmen gehabt hat

00:24:17.400 --> 00:24:21.240
<v Georg>und direkt angewendet hat, ist jetzt für einen End-User,

00:24:21.340 --> 00:24:25.240
<v Georg>quasi weg, aber die ganzen Algorithmen braucht man trotzdem immer noch,

00:24:25.240 --> 00:24:30.240
<v Georg>weil man damit im Endeffekt jetzt die ganzen Transformationen von den Daten macht,

00:24:30.240 --> 00:24:35.240
<v Georg>damit man sie so zusammenbasteln kann, damit sie eben möglichst variantenreich sind

00:24:35.240 --> 00:24:40.240
<v Georg>und damit man alle möglichen Sachen abbilden kann, die das Model dann eben machen soll.

00:24:40.240 --> 00:24:44.240
<v Georg>Aber man wendet die Algorithmen nicht mehr direkt auf die Daten an,

00:24:44.240 --> 00:24:49.240
<v Georg>sondern einfach auf den Trainingsdaten und damit modelliert man sozusagen die Trainingsdaten,

00:24:49.240 --> 00:24:51.080
<v Georg>so wie es dann eben fürs Model sein soll.

00:24:51.180 --> 00:24:57.080
<v Jochen>Mhm. Ja, interessant. Ich hätte mir schon mal überlegt, irgendwie, keine Ahnung,

00:24:57.080 --> 00:25:05.080
<v Jochen>ob man nicht sowas machen könnte, wie wenn man jetzt, angenommen man hätte irgendwie ganz viel hochqualitatives Audio irgendwo her,

00:25:05.080 --> 00:25:10.080
<v Jochen>keine Ahnung, hat ein Archiv von einem Radiosender gefunden oder irgendwelchen Medien

00:25:10.080 --> 00:25:17.080
<v Jochen>und man spielt das jetzt irgendwie in einem Raum ab und legt dann irgendwie ein Handy irgendwie in die Mitte oder sowas

00:25:17.080 --> 00:25:21.000
<v Jochen>und nimmt das dann auf, dann könnte man ja eigentlich sozusagen, kann man dann nicht ein gutes Audio

00:25:21.020 --> 00:25:24.920
<v Jochen>aus irgendwie einer Handy-Mikrofon-Aufnahme generieren? Könnte man nicht ein neuronales Netz trainieren,

00:25:24.920 --> 00:25:28.920
<v Jochen>das halt irgendwie quasi dann halt auch, wenn ich dann selber wieder das Handy nehme oder reinspreche,

00:25:28.920 --> 00:25:30.920
<v Jochen>dann quasi da einen guten Klang draus macht?

00:25:30.920 --> 00:25:32.920
<v Jochen>Das ist, glaube ich, das, was Georg versucht, diese Folge.

00:25:32.920 --> 00:25:34.920
<v Jochen>Genau das. Genau das machen wir.

00:25:34.920 --> 00:25:37.920
<v Jochen>Aber da lernst du doch nur einen Filter, oder?

00:25:37.920 --> 00:25:43.920
<v Georg>Genau. Im Prinzip gibt es genau so Datensätze von, du meinst jetzt zum Beispiel Impuls-Responses,

00:25:43.920 --> 00:25:50.760
<v Georg>also Impuls-Antworten von Räumen zum Beispiel, wo eben, keine Ahnung, 100.000 Impulse,

00:25:50.860 --> 00:25:55.760
<v Georg>Impuls-Responses von verschiedenen Geometrien von Räumen, das heißt in dem Fall,

00:25:55.760 --> 00:26:00.760
<v Georg>in dem Fall hättest du ein Handy halt immer an einem anderen Punkt, in einem anderen Raum liegen,

00:26:00.760 --> 00:26:08.760
<v Georg>das sind eben genau diese Transformations, in dem Fall rechnet man dann so eine Impuls-Response drauf auf das Input-Signal

00:26:08.760 --> 00:26:12.760
<v Georg>und am Target soll das dann eben wieder weggerechnet werden.

00:26:12.760 --> 00:26:18.760
<v Georg>Dann, in deinem Fall, hättest du noch so nicht-lineare Verzerrungen drinnen vom Handy-Mikrofon zum Beispiel,

00:26:18.760 --> 00:26:20.600
<v Georg>das kann man natürlich auch mit so einem nicht-linearen,

00:26:20.700 --> 00:26:24.600
<v Georg>also Verzerrungen ganz einfach simulieren, zusätzlich hast du noch Rauschen dabei,

00:26:24.600 --> 00:26:28.600
<v Georg>also man kann da noch ein neues dazu mischen und mit diesen ganzen Dingen,

00:26:28.600 --> 00:26:35.600
<v Georg>dann hat es vielleicht noch spektrale Effekte drinnen, also man kann noch so EQ-Dinger auf den Input drauflegen

00:26:35.600 --> 00:26:42.600
<v Georg>und wenn man diese ganzen Effekte zusammen mischt, dann kommt halt irgendein schlechtes Audio sozusagen raus,

00:26:42.600 --> 00:26:44.600
<v Georg>das man dann verwenden kann.

00:26:44.600 --> 00:26:50.520
<v Jochen>Ja, ja und das kann man natürlich dann deutlich flexibler machen, als wenn man das jetzt irgendwie tatsächlich physisch

00:26:50.540 --> 00:26:55.440
<v Jochen>irgendwie machen müsste, ja. Man braucht ja auch viele Daten irgendwie wahrscheinlich, nehme ich mal an.

00:26:55.440 --> 00:27:05.440
<v Jochen>Was heißt denn viele Daten? Wie viele Daten braucht man denn? Braucht man da 10 Stunden oder 100 Stunden oder 1000 Stunden oder 100.000 Stunden?

00:27:05.440 --> 00:27:12.440
<v Georg>Naja, mehr wie 1000, also es kommt drauf an, wie gut das sollte oder welcher Algorithmus jetzt und wie gut das funktionieren soll.

00:27:12.440 --> 00:27:20.280
<v Georg>Also für so ein neues Redaction-Sachen brauchst du schon einige Tausend Stunden an Audio-Material, sage ich mal.

00:27:20.380 --> 00:27:27.280
<v Johannes>Okay, also so ein, sage ich mal, Podcast-Archiv aus 150 Stunden Audio kommt nicht weit.

00:27:27.280 --> 00:27:33.280
<v Georg>Naja, vor allem, wenn du jetzt ein Podcast-Archiv hast, das ist halt sehr einseitig.

00:27:33.280 --> 00:27:35.280
<v Georg>Ja, okay, das ist zu gleich für mich.

00:27:35.280 --> 00:27:41.280
<v Georg>Du hast natürlich verschiedenste Podcast-Archive von verschiedenen Ländern, von verschiedenen Ausdrucksweisen.

00:27:41.280 --> 00:27:44.280
<v Georg>Dann kommt natürlich noch die Qualität vom Audio dazu.

00:27:44.280 --> 00:27:50.120
<v Georg>Also es ist ja nicht so leicht, wirklich gute Sprache zum Beispiel zu finden, wo jetzt kein Rauschen drin ist,

00:27:50.220 --> 00:27:54.120
<v Georg>weil sonst trainierst du dich auch erst wieder an, dass du Rauschen dabei hast.

00:27:54.120 --> 00:27:55.120
<v Georg>Okay, klar.

00:27:55.120 --> 00:27:57.120
<v Georg>Also wir machen das meistens so ein bisschen rekursiv.

00:27:57.120 --> 00:28:03.120
<v Georg>Also man hat natürlich einmal ein Modell, dann findet man wieder neue Daten, die ein bisschen verrauscht sind,

00:28:03.120 --> 00:28:08.120
<v Georg>die neueste man mit dem alten Modell, damit trainiert man dann das neue Modell und so weiter,

00:28:08.120 --> 00:28:12.120
<v Georg>damit man die Daten auch ein bisschen besser aufbereiten kann.

00:28:12.120 --> 00:28:19.960
<v Georg>Weil, was ja ganz interessant ist, welche Effekte wir immer gehabt haben, also wenn man natürlich schon mal Daten gehabt hat,

00:28:20.060 --> 00:28:25.960
<v Georg>mit denen man ein Modell trainiert hat und da will man dann danach noch einmal die Neues mit dem gleichen Modell,

00:28:25.960 --> 00:28:30.960
<v Georg>dann funktioniert das natürlich nicht, weil das Modell hat ja schon gelernt, dass in den Daten Neues drinnen ist

00:28:30.960 --> 00:28:34.960
<v Georg>und das reproduziert das Neues ganz einfach wieder.

00:28:34.960 --> 00:28:38.960
<v Georg>Also irgendwie ist das wirklich drinnen gespeichert dann.

00:28:38.960 --> 00:28:49.800
<v Georg>Na gut, aber was bei uns auch noch so ein Ding ist, weil wir ja vorher von der klassischen DSB-Welt,

00:28:49.900 --> 00:28:56.800
<v Georg>Maschinen-Learning-Welt gekommen sind, also der Vorteil dort ist natürlich, dass man Parameter zur Kontrolle hat,

00:28:56.800 --> 00:29:00.800
<v Georg>was oft ein Vorteil, oft ein Nachteil ist, weil es komplizierter werden kann.

00:29:00.800 --> 00:29:04.800
<v Georg>Ein Vorteil, weil man verschiedene Use Cases damit abbilden kann.

00:29:04.800 --> 00:29:15.800
<v Georg>Und dieses Prinzip wollten wir jetzt halt auch nicht ganz aufgeben in der ganzen neuen Deep-Learning-Welt sozusagen,

00:29:15.800 --> 00:29:19.640
<v Georg>weil man kann natürlich auch so ein Modell machen, das jetzt auch,

00:29:19.740 --> 00:29:23.640
<v Georg>alle diese Transformationen und was auch immer drinnen hat und da kommt dann irgendwas raus

00:29:23.640 --> 00:29:28.640
<v Georg>und mit dem kann man dann leben oder nicht, aber oft will man halt auch mehr Kontrolle haben,

00:29:28.640 --> 00:29:30.640
<v Georg>was genau man mit dem Audio machen will.

00:29:30.640 --> 00:29:35.640
<v Georg>Man will zum Beispiel nur gewisse Störgeräusche rausrechnen oder man will Musik auch rausrechnen

00:29:35.640 --> 00:29:41.640
<v Georg>oder Atmer wegrechnen oder gewisse Sachen wegschneiden oder Lautstärken labeln,

00:29:41.640 --> 00:29:44.640
<v Georg>Lautstärken nicht labeln, Filtering anwenden oder nicht.

00:29:44.640 --> 00:29:49.480
<v Georg>Also insofern haben wir da jetzt, es ist unser Weg,

00:29:49.580 --> 00:29:53.480
<v Georg>dass wir verschiedene Stemmodels haben, die wir dann kombinieren.

00:29:53.480 --> 00:29:56.480
<v Georg>Also zum Beispiel haben wir so ein Modell, das im Filtering macht.

00:29:56.480 --> 00:30:01.480
<v Georg>Das nennt sich der Auto-EQ-Model, was auf das Filtering spezialisiert ist.

00:30:01.480 --> 00:30:07.480
<v Georg>Dann haben wir verschiedene denoising Models, die verschiedene Teile von Audio weglöschen können oder überlassen können,

00:30:07.480 --> 00:30:14.480
<v Georg>damit man dann die so kombinieren kann, um noch ein bisschen eine Kontrolle darüber zu haben.

00:30:14.480 --> 00:30:19.480
<v Georg>Um auch verschiedene Use Cases, was ist das zum Beispiel?

00:30:19.520 --> 00:30:25.420
<v Georg>In einem Radio-Play, also in einem Hörspiel im Radio will man natürlich alle möglichen Soundeffekte hinten haben.

00:30:25.420 --> 00:30:29.420
<v Georg>Also in einem Wasserfall, der plätschert oder der Knall, wenn die Tür aufgeht.

00:30:29.420 --> 00:30:35.420
<v Georg>Oder in einem Yoga-Video will man natürlich das ganze Atmen im Hintergrund haben und nicht rauslöschen.

00:30:35.420 --> 00:30:40.420
<v Georg>Jetzt in einem reinen Sprach-Podcast will man viel mehr natürlich rauslöschen.

00:30:40.420 --> 00:30:49.260
<v Georg>Also alles, was Tippen ist oder das Plätschern vom Bach im Hintergrund oder der Vögel oder Atmen von mir aus,

00:30:49.360 --> 00:30:54.260
<v Georg>kann man auch rauslöschen, alle Pausen rauslöschen, wenn man es ganz extrem machen will.

00:30:54.260 --> 00:30:56.260
<v Georg>Insofern.

00:30:56.260 --> 00:31:00.260
<v Jochen>Also es ist quasi sehr kontextabhängig, also sehr auch davon abhängig.

00:31:00.260 --> 00:31:06.260
<v Jochen>Also man kann nicht ein Modell für alle Sachen verwenden oder das Modell muss er halt selber erkennen, was jetzt.

00:31:06.260 --> 00:31:12.260
<v Jochen>Eigentlich müsste man ihm das ja sagen, das kann er ja gar nicht wissen, ob jetzt das Atmen oder schwierig wahrscheinlich.

00:31:12.260 --> 00:31:15.260
<v Jochen>Ob das Atmen jetzt erwünscht ist oder nicht.

00:31:15.260 --> 00:31:17.260
<v Jochen>Ja, klar.

00:31:17.260 --> 00:31:19.200
<v Jochen>Ja, das Multitracking.

00:31:19.300 --> 00:31:20.200
<v Jochen>Das Multitrack-Interface.

00:31:20.200 --> 00:31:23.200
<v Jochen>Ich meine, das ist ja auch schön, dass das alles geht, genau.

00:31:23.200 --> 00:31:25.200
<v Jochen>Aber ja, das ist nicht so ganz einfach einzustellen, das stimmt.

00:31:25.200 --> 00:31:26.200
<v Jochen>Ja.

00:31:26.200 --> 00:31:29.200
<v Georg>Ja, Multitrack ist nochmal besonders komplex, vor allem vom Interface.

00:31:29.200 --> 00:31:36.200
<v Georg>Weil für jede Track kannst du alle Settings halt einstellen und dann wird es halt natürlich gleich einmal viel.

00:31:36.200 --> 00:31:37.200
<v Georg>Ja.

00:31:37.200 --> 00:31:39.200
<v Jochen>Ja, gar nicht so einfach.

00:31:39.200 --> 00:31:40.200
<v Jochen>Oder.

00:31:40.200 --> 00:31:42.200
<v Johannes>Ja, ich glaube, wir sind so ein bisschen überfahren, oder?

00:31:42.200 --> 00:31:49.200
<v Johannes>Von diesen ganzen Möglichkeiten, die es da gibt und von den ganzen coolen Sachen, die jeder macht.

00:31:49.240 --> 00:31:56.140
<v Johannes>Und als Außenstehender, also so ich als, sag ich mal, Feld, Wald und Wiesen-Informatiker, mir fehlt da so ein bisschen der Bezug dazu.

00:31:56.140 --> 00:32:05.140
<v Johannes>Also für mich ist es so ein bisschen so, ja, ich habe hier eine Audiodatei und da gibt es irgendwelche magischen Tools, die irgendwelche magischen Sachen machen und hinterher hört es sich besser an.

00:32:05.140 --> 00:32:09.140
<v Georg>Ja, aber es ist ja auch okay, oder? Als User willst du eh nicht mehr wissen im Endeffekt.

00:32:09.140 --> 00:32:10.140
<v Georg>Klar.

00:32:10.140 --> 00:32:12.140
<v Georg>Jetzt hast du ja alles auf den User degradiert.

00:32:12.140 --> 00:32:17.140
<v Georg>Idealerweise möchte ich nicht mehr wissen, das stimmt natürlich.

00:32:17.240 --> 00:32:24.140
<v Johannes>Aber wir wollen ja da schon gerne einen Blick reinwerfen und das ist irgendwie so eine ganz eigene Welt, diese Audiosachen.

00:32:24.140 --> 00:32:32.140
<v Johannes>Ich meine, da gibt es spezielle Hardware und dann sehen die Knöpfe alle anders aus und dann sind die Interfaces so kompliziert, dass wir nicht damit klarkommen.

00:32:32.140 --> 00:32:45.140
<v Johannes>Und ich finde es total faszinierend, wie tief das so ist, weil das so auf der Ebene, die der User damit interagiert ist, ist ja wirklich nur so.

00:32:45.240 --> 00:32:49.140
<v Johannes>Ich habe eine Datei und die soll besser klingen und jetzt ist es so.

00:32:49.140 --> 00:32:55.140
<v Georg>Das war natürlich auch der Punkt, warum wir angefangen haben mit Affonic überhaupt.

00:32:55.140 --> 00:33:01.140
<v Georg>Weil Audiothechnik einfach vor allem vor 10, 15 Jahren sehr kryptisch war.

00:33:01.140 --> 00:33:03.140
<v Georg>Das ist ja heute schon total anders.

00:33:03.140 --> 00:33:11.140
<v Georg>Also früher hast du echt wissen müssen immer, was ein Kompressor ist, was ein Limiter ist, wie du den einstellst, wie du die ganzen Filterparameter einstellst.

00:33:11.140 --> 00:33:15.140
<v Georg>Wo man, wenn man eigentlich nicht wirklich Ahnung davon hat, viel leichter, viel besser ist.

00:33:15.240 --> 00:33:18.140
<v Georg>Was man mehr schlecht machen kann, als gut machen kann.

00:33:18.140 --> 00:33:23.140
<v Georg>Und das war eigentlich der Ausgangspunkt von uns.

00:33:23.140 --> 00:33:32.140
<v Georg>Weil wir halt gedacht haben oder ich damals gedacht habe, dass man kann einfach einem normalen Menschen unter Anführungszeichen sowas einfach nicht zumuten.

00:33:32.140 --> 00:33:35.140
<v Georg>Der, wie du sagst, nur ein besseres Audio haben will.

00:33:35.140 --> 00:33:38.140
<v Georg>Das war einfach alles viel zu kompliziert.

00:33:38.140 --> 00:33:43.140
<v Johannes>Ja, ganz oft ist es ja auch so, dass gerade in dieser Audio-Welt,

00:33:43.240 --> 00:33:48.140
<v Johannes>dass man als normaler Benutzer viele Dinge gar nicht hört oder gar nicht versteht.

00:33:48.140 --> 00:33:53.140
<v Johannes>Man hat ja da gelegentlich Kontakt dazu.

00:33:53.140 --> 00:34:00.140
<v Johannes>Und wenn man dann so sieht, da sitzt einer hier an seinem Mischpult und dann dreht er an irgendwelchen Reglern und es passiert eigentlich gar nichts.

00:34:00.140 --> 00:34:02.140
<v Johannes>So erster Eindruck.

00:34:02.140 --> 00:34:06.140
<v Johannes>Aber dann am Ende hört es sich doch irgendwie wesentlich besser an, als es sich vorher angehört hat.

00:34:06.140 --> 00:34:10.140
<v Johannes>Und diese Intransparenz ist so für mich als Benutzer.

00:34:10.140 --> 00:34:13.140
<v Johannes>Ich zähle mich da durchaus zu den Benutzern.

00:34:13.240 --> 00:34:20.140
<v Johannes>Super interessant, weil ich verstehe überhaupt gar nicht, was es da für, ich verstehe noch nicht mal, was es für Parameter gibt.

00:34:20.140 --> 00:34:24.140
<v Johannes>Und dann gibt es aber Experten, die gucken sich das an und sagen, ja, nee, so kannst du es nicht machen.

00:34:24.140 --> 00:34:27.140
<v Johannes>Und hier musst du diesen das hochdrehen und das runterdrehen.

00:34:27.140 --> 00:34:30.140
<v Johannes>Und dann am Ende denkst du ja, verrückt.

00:34:30.140 --> 00:34:32.140
<v Johannes>Und ich habe einmal so eine Erfahrung gemacht.

00:34:32.140 --> 00:34:37.140
<v Johannes>Da haben wir bei einem ehemaligen Arbeitgeber, wir haben ein Marketingvideo gedreht.

00:34:37.140 --> 00:34:40.140
<v Johannes>Es war ein großer Spaß für einen Programmiertwettbewerb.

00:34:40.140 --> 00:34:43.140
<v Johannes>Und der war auch so ein Audio-Wettbewerb.

00:34:43.140 --> 00:34:45.040
<v Johannes>Und der war so ein Fan.

00:34:45.040 --> 00:34:48.040
<v Johannes>Da hat er sich selber in seinem Wohnzimmer ein kleines Studio reingebaut.

00:34:48.040 --> 00:34:51.040
<v Johannes>Auch mit so Schallschutzwänden und so Zeugs.

00:34:51.040 --> 00:34:55.040
<v Johannes>Und da hat er dann mit seiner Band, was man halt so macht.

00:34:55.040 --> 00:34:57.040
<v Johannes>Und dann hat er da so ein Stück Audio von mir aufgenommen.

00:34:57.040 --> 00:35:02.040
<v Johannes>Und ich meine, jeder, der schon mal Audio von sich selber gehört hat, der weiß, dass das ganz schrecklich ist, wenn man sich das anhört.

00:35:02.040 --> 00:35:05.040
<v Johannes>Weil die eigene Stimme, die hört sich gruselig an.

00:35:05.040 --> 00:35:07.040
<v Johannes>Aber dann hat er das da so reingetan und hat so ein paar Knöpfe gedreht.

00:35:07.040 --> 00:35:11.040
<v Johannes>Und auf einmal habe ich mich angehört wie ein Radiomoderator.

00:35:11.040 --> 00:35:12.940
<v Johannes>Und so eine richtig sonore Stimme.

00:35:13.040 --> 00:35:14.940
<v Johannes>Mit Volumen drin.

00:35:14.940 --> 00:35:17.940
<v Johannes>Und er hat das Reverb aufgedreht.

00:35:17.940 --> 00:35:20.940
<v Johannes>Ja, und vielleicht auch ein bisschen die Bässe hochgedreht.

00:35:20.940 --> 00:35:22.940
<v Johannes>Und, keine Ahnung, einen Kompressor reingemacht.

00:35:22.940 --> 00:35:24.940
<v Johannes>Weiß ich, was das bedeutet.

00:35:24.940 --> 00:35:27.940
<v Johannes>Jedenfalls einige magische Regler.

00:35:27.940 --> 00:35:29.940
<v Johannes>Und auf einmal war es viel, viel, viel besser.

00:35:29.940 --> 00:35:34.940
<v Johannes>Und ich finde das super faszinierend, dass es so eine Welt gibt, die eigentlich so intransparent ist.

00:35:34.940 --> 00:35:36.940
<v Johannes>Aber die doch irgendwie jeder hört.

00:35:36.940 --> 00:35:39.940
<v Johannes>Weil man hört ja schon, ob sich Audio gut anhört oder nicht.

00:35:39.940 --> 00:35:42.840
<v Dominik>Und wer meint es jetzt, wenn du das Audio auffällig hörst?

00:35:42.940 --> 00:35:44.840
<v Dominik>Wenn du es auf dem Telefon als Podcast hörst?

00:35:44.840 --> 00:35:46.840
<v Dominik>Oder wenn du das bei deiner Serienanlage hörst?

00:35:46.840 --> 00:35:48.840
<v Dominik>Oder im Auto?

00:35:48.840 --> 00:35:52.840
<v Johannes>Wenn ich das in meinen Bluetooth-Lautsprechern 10 Meter von meinem Handy anhöre.

00:35:52.840 --> 00:35:57.840
<v Dominik>Entschuldigung, ich wollte gerade, weil ich finde nämlich, dass die Sachen alle auf unterschiedlichen Geräten immer ganz anders klingen.

00:35:57.840 --> 00:35:59.840
<v Dominik>Und das ist total nicht rausgekommen.

00:35:59.840 --> 00:36:00.840
<v Dominik>Ja, das ist natürlich so.

00:36:00.840 --> 00:36:03.840
<v Johannes>Aber ich meine, so die ganz alten Sachen waren ja alle für Radio.

00:36:03.840 --> 00:36:05.840
<v Johannes>Und auch da hat es sich sehr gut angehört.

00:36:05.840 --> 00:36:07.840
<v Johannes>Also besser als ohne.

00:36:07.840 --> 00:36:08.840
<v Johannes>Ja.

00:36:08.840 --> 00:36:10.840
<v Jochen>Ja, wobei ich glaube, das muss man auch so ein bisschen lernen.

00:36:10.840 --> 00:36:12.740
<v Jochen>Also ich habe jedenfalls irgendwie,

00:36:12.840 --> 00:36:15.740
<v Jochen>zum Beispiel bei den ersten Podcast-Episoden jetzt hier,

00:36:15.740 --> 00:36:17.740
<v Jochen>dachte ich auch, das klingt ja eigentlich ganz gut.

00:36:17.740 --> 00:36:20.740
<v Jochen>Und wenn ich mir die heute anhöre, denke ich mir so, ah, das klingt aber eigentlich ganz schön schlecht.

00:36:20.740 --> 00:36:22.740
<v Jochen>Und das war auch so ein Lernprozess.

00:36:22.740 --> 00:36:24.740
<v Jochen>Das ging nicht von Anfang an.

00:36:24.740 --> 00:36:28.740
<v Dominik>Und dann hat der Jochen sich ein ganz großes Mischpult gekauft, das wir immer noch nicht ordentlich bedienen können.

00:36:28.740 --> 00:36:30.740
<v Dominik>Und damit ist es viel besser geworden.

00:36:30.740 --> 00:36:31.740
<v Dominik>Ja, nee.

00:36:31.740 --> 00:36:32.740
<v Dominik>Viel einfacher.

00:36:32.740 --> 00:36:33.740
<v Dominik>Ja.

00:36:33.740 --> 00:36:34.740
<v Dominik>Aber ich höre jetzt auch...

00:36:34.740 --> 00:36:39.740
<v Johannes>Was die Hörer nicht wissen, ist ja, dass wir vorher eine Dreiviertelstunde gebraucht haben, um die Aufnahme zu starten.

00:36:39.740 --> 00:36:42.740
<v Johannes>Das war tatsächlich das Nächste zum Vorbereiten.

00:36:42.740 --> 00:36:44.640
<v Johannes>Was wir selber hatten, ja.

00:36:44.640 --> 00:36:45.640
<v Johannes>Matrix.

00:36:45.640 --> 00:36:50.640
<v Jochen>Ja, aber es ist auch irgendwie so ein gewisserweise gebührender Einstieg, ob man es nicht schon mal...

00:36:50.640 --> 00:36:51.640
<v Jochen>In die Audio-App.

00:36:51.640 --> 00:36:55.640
<v Jochen>Ja, dass man dann schon mal so nicht denkt, dass es zu einfach wäre alles.

00:36:55.640 --> 00:36:59.640
<v Johannes>Ich finde es auch sehr schön, Georg, dass du gleich als Profi gesagt hast,

00:36:59.640 --> 00:37:05.640
<v Johannes>wisst ihr was, diese ganze Audio-Technik, alles weg, einfach nur ein Mikrofon, ein Kabel.

00:37:05.640 --> 00:37:07.640
<v Johannes>Sehr sicher.

00:37:07.640 --> 00:37:12.540
<v Georg>Aber nochmal zu deinem Punkt, dass es besser geklungen hat.

00:37:12.640 --> 00:37:15.540
<v Georg>Weil der hat ein paar Regler gedreht und dass es besser geklungen hat.

00:37:15.540 --> 00:37:17.540
<v Georg>Das stimmt natürlich.

00:37:17.540 --> 00:37:30.540
<v Georg>Aber man muss ja immer vor, in dem Fall vor Ohren führen, dass das natürlich sehr subjektiv ist und eigentlich von deiner Wahrnehmung vom Radio her geprägt ist.

00:37:30.540 --> 00:37:35.540
<v Georg>Da gibt es natürlich ganz unterschiedliche Stile in unterschiedlichen Ländern, auch wie man das handhabt.

00:37:35.540 --> 00:37:42.440
<v Georg>Also du bist ja, du bist jetzt einem bestimmten Radiosound vielleicht gewohnt, was deine Radiosender da bei dir in Deutschland jetzt haben.

00:37:42.540 --> 00:37:46.440
<v Georg>In Amerika ist es meistens ganz anders oder in anderen Ländern.

00:37:46.440 --> 00:37:54.440
<v Georg>Das heißt, wenn jetzt irgendwer deine Stimme so regelt, dass er möglichst ähnlich an deiner Referenz sozusagen ist,

00:37:54.440 --> 00:38:00.440
<v Georg>was du als guten Sound verstehst oder gewohnt bist zu hören, ganz einfach, dann klingt es für dich gut.

00:38:00.440 --> 00:38:06.440
<v Georg>Wenn der jetzt zum Beispiel, wenn das jetzt ein Südamerikaner gemacht hätte und die haben eine andere Referenz,

00:38:06.440 --> 00:38:09.440
<v Georg>dann hätte es vielleicht für dich gar nicht so gut geklungen.

00:38:09.440 --> 00:38:12.340
<v Georg>Also das ist auch sehr subjektiv.

00:38:12.440 --> 00:38:14.340
<v Georg>Das ist auch sehr subjektiv.

00:38:14.340 --> 00:38:16.340
<v Georg>Das ist auch sehr subjektiv.

00:38:16.340 --> 00:38:18.340
<v Georg>Das ist auch sehr subjektiv.

00:38:18.340 --> 00:38:20.340
<v Georg>Das ist auch sehr subjektiv.

00:38:20.340 --> 00:38:22.340
<v Georg>Das ist auch sehr subjektiv.

00:38:22.340 --> 00:38:24.340
<v Georg>Das ist auch sehr subjektiv.

00:38:24.340 --> 00:38:26.340
<v Georg>Das ist auch sehr subjektiv.

00:38:26.340 --> 00:38:28.340
<v Georg>Das ist auch sehr subjektiv.

00:38:28.340 --> 00:38:30.340
<v Georg>Das ist auch sehr subjektiv.

00:38:30.340 --> 00:38:32.340
<v Georg>Das ist auch sehr subjektiv.

00:38:32.340 --> 00:38:34.340
<v Georg>Das ist auch sehr subjektiv.

00:38:34.340 --> 00:38:36.340
<v Georg>Das ist auch sehr subjektiv.

00:38:36.340 --> 00:38:38.340
<v Georg>Das ist auch sehr subjektiv.

00:38:38.340 --> 00:38:40.340
<v Georg>Das ist auch sehr subjektiv.

00:38:40.340 --> 00:38:42.240
<v Georg>Das ist auch sehr subjektiv.

00:38:42.340 --> 00:38:44.240
<v Georg>Das ist auch sehr subjektiv.

00:38:44.240 --> 00:38:46.240
<v Georg>Das ist auch sehr subjektiv.

00:38:46.240 --> 00:38:48.240
<v Georg>Das ist auch sehr subjektiv.

00:38:48.290 --> 00:38:50.530
<v Georg>sehr subjektiv natürlich

00:38:50.530 --> 00:38:51.430
<v Georg>diese Übernehmung.

00:38:51.430 --> 00:38:53.890
<v Georg>Das kommt immer auf die Referenz drauf an.

00:38:53.890 --> 00:38:56.350
<v Dominik>Diese Bilder, wenn man das zwar über Ton

00:38:56.350 --> 00:38:57.990
<v Dominik>spricht, aber vom Klangbild auch redet,

00:38:57.990 --> 00:39:00.570
<v Dominik>schon auch ein bisschen

00:39:00.570 --> 00:39:01.270
<v Dominik>einordnen, oder?

00:39:01.270 --> 00:39:03.690
<v Dominik>Es gibt schönere Bilder

00:39:03.690 --> 00:39:05.670
<v Dominik>von besseren Künstlern und es gibt

00:39:05.670 --> 00:39:07.890
<v Dominik>ästlichere Bilder vielleicht.

00:39:07.890 --> 00:39:09.910
<v Dominik>Selbst wenn sie unterschiedlich sind und wenn es

00:39:09.910 --> 00:39:12.050
<v Dominik>verschiedene Stilrichtungen gibt,

00:39:12.050 --> 00:39:13.790
<v Dominik>kann man schon, glaube ich,

00:39:13.790 --> 00:39:15.890
<v Dominik>eine Qualität

00:39:15.890 --> 00:39:17.370
<v Dominik>eines Stückes hören.

00:39:18.190 --> 00:39:20.090
<v Dominik>Es ist auch ein bisschen bei Musik, ja, ich höre

00:39:20.090 --> 00:39:22.390
<v Dominik>relativ einseitige Musik,

00:39:22.390 --> 00:39:24.210
<v Dominik>obwohl ich auch von vielen Genres

00:39:24.210 --> 00:39:26.370
<v Dominik>durchaus anerkennen kann, wenn es da gute

00:39:26.370 --> 00:39:28.650
<v Dominik>Musik gibt, die man gut hören kann, die man nicht so gut hören kann.

00:39:28.650 --> 00:39:30.490
<v Dominik>Und ich höre auch, ob eine Musik einfacher

00:39:30.490 --> 00:39:32.430
<v Dominik>produziert ist oder komplexer, unabhängig jetzt von

00:39:32.430 --> 00:39:34.010
<v Dominik>meinem Geschmack vielleicht dafür.

00:39:34.010 --> 00:39:35.390
<v Dominik>Wenn ihr wisst, was ich meine, ja?

00:39:35.390 --> 00:39:37.510
<v Dominik>Und ich finde, das ist auch bei Audio so.

00:39:37.510 --> 00:39:40.490
<v Dominik>Insbesondere halt bei dem, was du gesagt hast,

00:39:40.490 --> 00:39:42.190
<v Dominik>wie du dieses Signal bearbeitest,

00:39:42.190 --> 00:39:44.070
<v Dominik>was halt der Tontechniker,

00:39:44.070 --> 00:39:46.170
<v Dominik>also ich weiß nicht, kann man das so sagen?

00:39:46.170 --> 00:39:48.090
<v Dominik>Ist Harphonik ein virtuelles Ton

00:39:48.090 --> 00:39:49.230
<v Dominik>Technik-Instrument?

00:39:49.230 --> 00:39:50.710
<v Dominik>Ist das so?

00:39:50.710 --> 00:39:52.410
<v Georg>Virtueller Ton-Techniker, ja.

00:39:52.410 --> 00:39:56.110
<v Dominik>Und ja, was er dann tut, was er da machen kann,

00:39:56.110 --> 00:39:56.490
<v Dominik>um

00:39:56.490 --> 00:40:00.370
<v Dominik>ich weiß nicht, wie die Bildsprache bleibt,

00:40:00.370 --> 00:40:02.230
<v Dominik>den Pinsel zu führen, ja, also tatsächlich

00:40:02.230 --> 00:40:03.870
<v Dominik>diesen Ton zu skypen und

00:40:03.870 --> 00:40:06.110
<v Dominik>ja, also klar,

00:40:06.110 --> 00:40:08.050
<v Dominik>gibt es da vielleicht verschiedene Meinungen oder

00:40:08.050 --> 00:40:10.350
<v Dominik>ich weiß nicht, ob du sowas hast wie Presets,

00:40:10.350 --> 00:40:12.130
<v Dominik>die du sagen kannst, Harphonik, hey, das ist

00:40:12.130 --> 00:40:13.450
<v Dominik>jetzt Taste,

00:40:13.450 --> 00:40:15.850
<v Dominik>du hast eben Südamerika erwähnt

00:40:15.850 --> 00:40:17.750
<v Dominik>und das ist Taste Europe oder

00:40:17.990 --> 00:40:20.010
<v Dominik>so oder das ist Taste Radio und

00:40:20.010 --> 00:40:21.510
<v Dominik>das ist Taste Big Cinema.

00:40:21.510 --> 00:40:24.110
<v Dominik>Kann ja sein, dass du das auch machen kannst, aber

00:40:24.110 --> 00:40:25.990
<v Dominik>der Trick wäre ja, genau das

00:40:25.990 --> 00:40:28.170
<v Dominik>auch bauen zu können, als Tontechniker

00:40:28.170 --> 00:40:30.090
<v Dominik>sich quasi dieses Zielbild

00:40:30.090 --> 00:40:31.910
<v Dominik>oder diesem Stil anzupassen

00:40:31.910 --> 00:40:33.970
<v Dominik>und das dann halt auf einen gewissen

00:40:33.970 --> 00:40:35.770
<v Dominik>Qualitätsgrad zu bringen. Und das

00:40:35.770 --> 00:40:37.930
<v Dominik>aus Algorithmen zu denken, finde ich spannend, weil ich versuche

00:40:37.930 --> 00:40:39.770
<v Dominik>auch überhaupt erstmal zu verstehen, wie das

00:40:39.770 --> 00:40:41.470
<v Dominik>überhaupt geht, weil dieses

00:40:41.470 --> 00:40:43.510
<v Dominik>Klang zu

00:40:43.510 --> 00:40:45.650
<v Dominik>visualisieren, ist halt da wieder auch

00:40:45.650 --> 00:40:47.890
<v Dominik>der falsche Begriff, ja, aber sich das so

00:40:47.890 --> 00:40:49.830
<v Dominik>vorstellen zu können, wie man einen Klang überhaupt

00:40:49.830 --> 00:40:51.770
<v Dominik>schafft, das ist irgendwie, also eine der großen

00:40:51.770 --> 00:40:53.890
<v Dominik>Herausforderungen, die ich jetzt persönlich habe, wenn ich jetzt

00:40:53.890 --> 00:40:55.050
<v Dominik>an Musik denke, auch

00:40:55.050 --> 00:40:57.850
<v Dominik>was ich höre, überhaupt umzusetzen, dafür

00:40:57.850 --> 00:41:00.110
<v Dominik>muss ich relativ viel üben

00:41:00.110 --> 00:41:01.390
<v Dominik>oder so, ja, dass ich

00:41:01.390 --> 00:41:03.850
<v Dominik>das hinkriege oder halt auch in die Musikschule gehen

00:41:03.850 --> 00:41:05.870
<v Dominik>und Theorie lernen und so und das ist

00:41:05.870 --> 00:41:07.830
<v Dominik>durchaus, glaube ich, die spannende

00:41:07.830 --> 00:41:08.630
<v Dominik>Sache dahinter vielleicht.

00:41:08.630 --> 00:41:11.470
<v Dominik>Und warum es so einem Nutzer wie dir, Johannes,

00:41:11.470 --> 00:41:13.950
<v Dominik>dann vielleicht schwerfällt, weil du sonst nicht so viel mit

00:41:13.950 --> 00:41:15.630
<v Dominik>Ton machst. Absolut, blutiger Nutzer.

00:41:15.630 --> 00:41:17.790
<v Johannes>Ich habe da überhaupt

00:41:17.790 --> 00:41:19.730
<v Johannes>gar keinen Connect dazu. Ich bin, ich habe

00:41:19.730 --> 00:41:21.230
<v Johannes>da, glaube ich, eine sehr visuelle Ansicht.

00:41:21.230 --> 00:41:23.690
<v Johannes>Sobald man mir eine FFT

00:41:23.690 --> 00:41:25.790
<v Johannes>zeigt, dann komme

00:41:25.790 --> 00:41:27.850
<v Johannes>ich damit klar, aber solange nur die Geräusche

00:41:27.850 --> 00:41:29.630
<v Johannes>da sind oder die Wellen formen, dann

00:41:29.630 --> 00:41:31.610
<v Johannes>bin ich völlig

00:41:31.610 --> 00:41:33.210
<v Johannes>verloren. Ja,

00:41:33.210 --> 00:41:35.210
<v Jochen>ich weiß es nicht genau.

00:41:35.210 --> 00:41:37.770
<v Jochen>Ich habe mal irgendwann auch ein Podcast

00:41:37.770 --> 00:41:39.010
<v Jochen>Episode gehört mit

00:41:39.010 --> 00:41:41.710
<v Jochen>Rick Rubin und der meinte so,

00:41:41.710 --> 00:41:43.050
<v Jochen>ach, das mit dem

00:41:43.050 --> 00:41:44.890
<v Jochen>irgendwie produzieren und so,

00:41:44.890 --> 00:41:47.770
<v Jochen>eigentlich kann man es immer nur kaputt machen und

00:41:47.790 --> 00:41:49.490
<v Jochen>wenn man das nicht kaputt macht, dann ist das schon

00:41:49.490 --> 00:41:51.310
<v Jochen>sehr, sehr, dann ist das schon sehr, sehr gut.

00:41:51.310 --> 00:41:53.470
<v Jochen>Ich weiß gar nicht, ob man tatsächlich so viel

00:41:53.470 --> 00:41:55.690
<v Jochen>an Mastering

00:41:55.690 --> 00:41:59.810
<v Jochen>kann man damit tatsächlich prägen.

00:41:59.810 --> 00:42:01.450
<v Jochen>Ja, also ich

00:42:01.450 --> 00:42:03.430
<v Dominik>bin jetzt ja totaler Amateur, was

00:42:03.430 --> 00:42:05.290
<v Dominik>Musik auch angeht und so, aber wenn ich jetzt

00:42:05.290 --> 00:42:07.370
<v Dominik>mit einem Kumpel jetzt Musik mache

00:42:07.370 --> 00:42:09.470
<v Dominik>und ich schaffe es halt schon, bestimmte Sachen

00:42:09.470 --> 00:42:11.610
<v Dominik>da rauszuholen oder bestimmte Töne

00:42:11.610 --> 00:42:13.470
<v Dominik>an der richtigen Stelle leiser oder lauter zu machen

00:42:13.470 --> 00:42:15.510
<v Dominik>oder halt Raum zu schaffen für den

00:42:15.510 --> 00:42:17.730
<v Dominik>Bass oder so, irgendeinen Ducking hinzukriegen, das ist ja schon,

00:42:17.730 --> 00:42:19.610
<v Dominik>das sind ja eher so Basics, ja, aber

00:42:19.610 --> 00:42:21.630
<v Dominik>das, also ich kann das

00:42:21.630 --> 00:42:23.650
<v Dominik>überhaupt nicht vorstellen mit Sprache, weil ich damit überhaupt gar keine

00:42:23.650 --> 00:42:25.690
<v Dominik>Erfahrung habe, ja, mit Podcasts oder

00:42:25.690 --> 00:42:27.490
<v Dominik>sowas, also wir machen jetzt Vereine, aber

00:42:27.490 --> 00:42:29.570
<v Dominik>als Hohentechniker jetzt würde ich sagen, würde ich mich jetzt auch

00:42:29.570 --> 00:42:31.270
<v Dominik>nicht bezeichnen und das ist halt

00:42:31.270 --> 00:42:33.470
<v Dominik>schon nochmal eine andere Herausforderung und wenn man

00:42:33.470 --> 00:42:35.690
<v Dominik>gerade diese Klangbilder vor Uhren

00:42:35.690 --> 00:42:36.830
<v Dominik>hat, ja,

00:42:36.830 --> 00:42:39.610
<v Dominik>da kommt man vielleicht so ein bisschen näher

00:42:39.610 --> 00:42:41.070
<v Dominik>dran, also das ist das, was Johannes meinte.

00:42:41.070 --> 00:42:43.530
<v Dominik>Er hat genauso geklungen, wie er dachte, dass er im Radio

00:42:43.530 --> 00:42:45.750
<v Dominik>steht und wenn ich jetzt weiß, okay, ich möchte

00:42:45.750 --> 00:42:47.610
<v Dominik>das Audio-Klangbild

00:42:47.610 --> 00:42:47.710
<v Dominik>haben, dann kann ich das auch so machen.

00:42:47.710 --> 00:42:48.210
<v Dominik>Wenn ich das so haben, wie

00:42:48.210 --> 00:42:51.490
<v Dominik>das hier mal so im Radio steht, dann weiß ich vielleicht

00:42:51.490 --> 00:42:53.490
<v Dominik>in welche, vielleicht wenn ich das Klang

00:42:53.490 --> 00:42:55.650
<v Dominik>habe, das richtige Wort dafür, ich weiß nicht,

00:42:55.650 --> 00:42:57.690
<v Dominik>ich das Ganze bringen möchte,

00:42:57.690 --> 00:42:59.690
<v Dominik>ob ich jetzt, welche Frequenzen

00:42:59.690 --> 00:43:00.850
<v Dominik>ich bewege und

00:43:00.850 --> 00:43:03.610
<v Dominik>was ich jetzt spannend finde, ist, was kann ich denn noch machen

00:43:03.610 --> 00:43:05.610
<v Dominik>eigentlich als Audio-Tontechniker

00:43:05.610 --> 00:43:07.070
<v Dominik>außer Frequenzen

00:43:07.070 --> 00:43:09.470
<v Dominik>bewegen und Lautstärke

00:43:09.470 --> 00:43:11.430
<v Dominik>mit, was ist das, Envelopes

00:43:11.430 --> 00:43:13.090
<v Dominik>modifizieren?

00:43:13.090 --> 00:43:15.150
<v Jochen>Sie ausleveln.

00:43:15.150 --> 00:43:17.050
<v Dominik>Ja, das ist ja, der Envelope ist ja

00:43:17.050 --> 00:43:17.530
<v Dominik>quasi, okay.

00:43:17.690 --> 00:43:19.590
<v Georg>Im Endeffekt ist alles

00:43:19.590 --> 00:43:21.570
<v Georg>Frequenzen und Lautstärken, mehr gibt es ja nicht.

00:43:21.570 --> 00:43:23.190
<v Dominik>Ja, genau, aber ja.

00:43:23.190 --> 00:43:26.150
<v Georg>Ich frage jetzt nur, wie man diese

00:43:26.150 --> 00:43:27.310
<v Georg>Regeln hat.

00:43:27.310 --> 00:43:31.590
<v Georg>Grafiks sind auch nur ein paar Pixel, das ist jetzt

00:43:31.590 --> 00:43:33.350
<v Georg>zu kurz geschaut.

00:43:33.350 --> 00:43:35.550
<v Georg>Ja, ein paar Farben

00:43:35.550 --> 00:43:36.810
<v Georg>an die richtige Stelle getan.

00:43:36.810 --> 00:43:39.510
<v Georg>Na, du meinst jetzt, welche

00:43:39.510 --> 00:43:41.530
<v Georg>Algorithmen es jetzt sozusagen

00:43:41.530 --> 00:43:42.330
<v Georg>noch gibt, oder was?

00:43:42.330 --> 00:43:45.070
<v Georg>Da können wir vielleicht gleich noch drauf eingehen, ich finde es gar nicht so unangenehm.

00:43:45.070 --> 00:43:47.330
<v Jochen>Ich glaube, der Dominik möchte einfach in dem

00:43:47.330 --> 00:43:48.890
<v Jochen>komplizierten Interface

00:43:48.890 --> 00:43:51.110
<v Jochen>noch ein paar mehr Knöpfe haben, wo er dann

00:43:51.110 --> 00:43:52.910
<v Jochen>sagen kann, jetzt lieber irgendwie

00:43:52.910 --> 00:43:55.010
<v Jochen>Radio-Style oder lieber

00:43:55.010 --> 00:43:57.210
<v Jochen>Musik. Nee, er möchte wissen, welche Knöpfe

00:43:57.210 --> 00:43:58.930
<v Jochen>mehr er drehen muss um den Radio-Style.

00:43:58.930 --> 00:44:00.990
<v Dominik>Ja, also ich würde tatsächlich, also ich würde gerne,

00:44:00.990 --> 00:44:02.850
<v Dominik>wenn ich jetzt so ein perfektes

00:44:02.850 --> 00:44:05.050
<v Dominik>Tonstudio-Ding mir vorstelle, wo es

00:44:05.050 --> 00:44:07.070
<v Dominik>diese ganzen einzelnen Regelungen gibt,

00:44:07.070 --> 00:44:08.870
<v Dominik>ja, dann möchte ich gerne wissen, welche Regelung ich denn überhaupt

00:44:08.870 --> 00:44:09.670
<v Dominik>machen möchte.

00:44:09.670 --> 00:44:12.930
<v Jochen>Aber das ist jetzt halt ein neuronales Netz mit

00:44:12.930 --> 00:44:14.930
<v Jochen>einer Milliarde Knöpfe, die du drehen kannst.

00:44:14.930 --> 00:44:16.970
<v Jochen>Die kannst du gar nicht mehr selber drehen,

00:44:17.050 --> 00:44:17.730
<v Jochen>da musst du es vorher drehen.

00:44:17.730 --> 00:44:21.130
<v Dominik>Ungefähr zu wissen, welche Richtung ich da möchte,

00:44:21.130 --> 00:44:22.690
<v Dominik>ist vielleicht ja schon mal der

00:44:22.690 --> 00:44:24.190
<v Dominik>erste Schritt.

00:44:24.190 --> 00:44:27.130
<v Dominik>Also ich glaube, es ist schon klar, dass jetzt die

00:44:27.130 --> 00:44:29.010
<v Dominik>Spur nicht... Habt ihr euch selber neuronale

00:44:29.010 --> 00:44:29.830
<v Dominik>Netze trainiert, Georg?

00:44:29.830 --> 00:44:32.890
<v Georg>Wie meinst du, ob wir unsere

00:44:32.890 --> 00:44:34.810
<v Georg>Netze selber trainieren? Ja.

00:44:34.810 --> 00:44:36.450
<v Georg>Ja, sicher. Wir benutzen ja irgendwas

00:44:36.450 --> 00:44:38.850
<v Georg>Vorgefertigtes und... Nein, nein, bei uns ist

00:44:38.850 --> 00:44:41.050
<v Georg>alles selber gemacht.

00:44:41.050 --> 00:44:42.170
<v Georg>Alles selber gemacht?

00:44:42.170 --> 00:44:44.590
<v Georg>Also alles natürlich nicht, aber

00:44:44.590 --> 00:44:46.230
<v Georg>die Algorithmen, so muss man sagen.

00:44:46.230 --> 00:44:47.030
<v Georg>Sci-Pi und NumPy.

00:44:47.050 --> 00:44:49.670
<v Georg>Und wie viele

00:44:49.670 --> 00:44:51.450
<v Georg>Parameter habt ihr da

00:44:51.450 --> 00:44:54.010
<v Georg>drin? Über welche Größe

00:44:54.010 --> 00:44:55.650
<v Georg>sprechen wir da? Also ich meine, das ist ja eine dieser

00:44:55.650 --> 00:44:57.810
<v Johannes>Kenngrößen, die man so sagt. Hier, GPT-X

00:44:57.810 --> 00:44:59.650
<v Johannes>hat eine Milliarde Parameter.

00:44:59.650 --> 00:45:01.110
<v Johannes>Ja,

00:45:01.110 --> 00:45:03.770
<v Georg>das kann ich dir so gar nicht sagen,

00:45:03.770 --> 00:45:05.730
<v Georg>weil... Also

00:45:05.730 --> 00:45:07.650
<v Georg>diese Netze im

00:45:07.650 --> 00:45:09.490
<v Georg>Audi-Bereich funktionieren ein bisschen anders,

00:45:09.490 --> 00:45:10.190
<v Georg>weil

00:45:10.190 --> 00:45:12.870
<v Georg>ich meine, im Prinzip

00:45:12.870 --> 00:45:15.550
<v Georg>hat es schon ähnliche Elemente.

00:45:15.550 --> 00:45:16.590
<v Georg>Also man hat halt meistens

00:45:17.050 --> 00:45:19.290
<v Georg>irgendwelche rekursiven

00:45:19.290 --> 00:45:21.670
<v Georg>Elemente oder Transformers drinnen, also

00:45:21.670 --> 00:45:23.490
<v Georg>bei uns meistens

00:45:23.490 --> 00:45:25.050
<v Georg>LSDMs oder

00:45:25.050 --> 00:45:27.650
<v Georg>Transformer eben, oder beides meistens

00:45:27.650 --> 00:45:29.790
<v Georg>und dann noch so Convolution-Layer

00:45:29.790 --> 00:45:31.390
<v Georg>natürlich und alle

00:45:31.390 --> 00:45:33.550
<v Georg>die Elemente sind eh ähnlich,

00:45:33.550 --> 00:45:35.570
<v Georg>aber es gehen

00:45:35.570 --> 00:45:37.530
<v Georg>einfach viel mehr Daten rein und raus

00:45:37.530 --> 00:45:39.750
<v Georg>natürlich, weil Audio eine viel höhere

00:45:39.750 --> 00:45:41.750
<v Georg>Sampling-Rate hat und in einer

00:45:41.750 --> 00:45:43.610
<v Georg>kürzeren Zeit viel mehr Daten

00:45:43.610 --> 00:45:44.510
<v Georg>rein und raus müssen.

00:45:44.510 --> 00:45:47.010
<v Georg>Aber was wir jetzt eigentlich

00:45:47.050 --> 00:45:49.290
<v Georg>raus, Anzahl Parameter, Größe,

00:45:49.290 --> 00:45:50.970
<v Georg>also wir haben natürlich

00:45:50.970 --> 00:45:52.710
<v Georg>verschiedene Models, also von

00:45:52.710 --> 00:45:55.170
<v Georg>manche Gigabyte

00:45:55.170 --> 00:45:56.070
<v Georg>bis zu

00:45:56.070 --> 00:45:59.010
<v Georg>ein paar hundert Megabyte, also

00:45:59.010 --> 00:46:00.270
<v Georg>in der Größenordnung.

00:46:00.270 --> 00:46:02.650
<v Georg>Also nicht so riesige Models wie irgendeine

00:46:02.650 --> 00:46:05.110
<v Georg>Sprachmodelle, aber doch

00:46:05.110 --> 00:46:05.950
<v Georg>schon ein bisschen was.

00:46:05.950 --> 00:46:09.290
<v Georg>Und ja, die Herausforderung

00:46:09.290 --> 00:46:11.230
<v Georg>ist natürlich auch, wie man

00:46:11.230 --> 00:46:12.870
<v Georg>die alle trainiert, weil es

00:46:12.870 --> 00:46:15.110
<v Georg>natürlich viel Rechenleistung braucht.

00:46:15.110 --> 00:46:17.010
<v Georg>Insofern, wir

00:46:17.050 --> 00:46:18.690
<v Georg>bauen uns halt hauptsächlich unsere eigenen

00:46:18.690 --> 00:46:20.450
<v Georg>Trainingserver auf,

00:46:20.450 --> 00:46:23.070
<v Georg>beziehungsweise mieten teilweise eben

00:46:23.070 --> 00:46:24.950
<v Georg>an, was aber leider halt sehr

00:46:24.950 --> 00:46:27.150
<v Georg>teuer ist, wenn man da versucht auf Amazon

00:46:27.150 --> 00:46:28.470
<v Georg>oder sonst irgendwo anzumieten.

00:46:28.470 --> 00:46:31.330
<v Georg>Bei den eigenen Rechnern

00:46:31.330 --> 00:46:32.850
<v Georg>ist wieder die Herausforderung, dass man die

00:46:32.850 --> 00:46:34.070
<v Georg>Kühlung halt hinbekommt,

00:46:34.070 --> 00:46:36.930
<v Georg>dass man im Büro das

00:46:36.930 --> 00:46:38.730
<v Georg>irgendwie aushaltet oder sonst wo

00:46:38.730 --> 00:46:40.870
<v Georg>die entsprechende Kühlung schafft

00:46:40.870 --> 00:46:43.110
<v Georg>und natürlich die Kosten

00:46:43.110 --> 00:46:44.270
<v Georg>von der Anschaffung,

00:46:44.270 --> 00:46:46.970
<v Georg>weil die GPUs sind

00:46:47.050 --> 00:46:48.370
<v Georg>natürlich heiß begehrt im Moment

00:46:48.370 --> 00:46:50.370
<v Georg>und jeder will die kaufen.

00:46:50.370 --> 00:46:53.250
<v Georg>Aber, ja, das ist natürlich

00:46:53.250 --> 00:46:56.030
<v Georg>zusätzlich zu den Daten eben,

00:46:56.030 --> 00:46:57.870
<v Georg>dass man gute Daten

00:46:57.870 --> 00:46:59.590
<v Georg>bekommt und vor allem

00:46:59.590 --> 00:47:01.670
<v Georg>im Audi-Bereich sind die Daten

00:47:01.670 --> 00:47:03.550
<v Georg>ja auch sehr subjektiv, wie wir

00:47:03.550 --> 00:47:05.250
<v Georg>vorher schon geredet haben und das muss man

00:47:05.250 --> 00:47:07.570
<v Georg>irgendwie einordnen trotzdem

00:47:07.570 --> 00:47:09.250
<v Georg>und das ist nicht immer so ganz klar.

00:47:09.250 --> 00:47:11.310
<v Georg>Also man kann dieses

00:47:11.310 --> 00:47:13.230
<v Georg>Data Labeling jetzt nicht einfach nach Indien

00:47:13.230 --> 00:47:14.890
<v Georg>auslagern und da gibt es jetzt ein paar

00:47:14.890 --> 00:47:16.690
<v Georg>Clickworker, die das einfach

00:47:16.690 --> 00:47:19.050
<v Georg>kategorisieren, sondern da muss man

00:47:19.050 --> 00:47:20.430
<v Georg>wirklich ein gutes Gehör haben dafür

00:47:20.430 --> 00:47:22.810
<v Georg>und zusätzlich eben

00:47:22.810 --> 00:47:25.030
<v Georg>die ganze Computer-Hardware

00:47:25.030 --> 00:47:26.750
<v Georg>ist eine Herausforderung,

00:47:26.750 --> 00:47:29.130
<v Georg>dass man diese eben beschafft.

00:47:29.130 --> 00:47:30.730
<v Georg>Okay, aber

00:47:30.730 --> 00:47:33.110
<v Johannes>trotzdem betreibt ihr ja ein System,

00:47:33.110 --> 00:47:35.490
<v Johannes>wo ich als Endkunde

00:47:35.490 --> 00:47:37.410
<v Johannes>eine Audiodatei hochladen kann

00:47:37.410 --> 00:47:39.170
<v Johannes>und die wird in 10-facher

00:47:39.170 --> 00:47:40.950
<v Johannes>Geschwindigkeit verarbeitet.

00:47:40.950 --> 00:47:43.370
<v Johannes>Allein

00:47:43.370 --> 00:47:45.350
<v Johannes>das ist ja schon eine massive Leistung,

00:47:45.350 --> 00:47:45.850
<v Johannes>dass ihr

00:47:45.850 --> 00:47:48.870
<v Johannes>da einen Service hinstellt, der einfach

00:47:48.870 --> 00:47:50.390
<v Johannes>so funktioniert und dann auch noch

00:47:50.390 --> 00:47:52.790
<v Johannes>ungeheuer schnell ist. Also ich meine, wenn man

00:47:52.790 --> 00:47:54.930
<v Johannes>sich die Leistung

00:47:54.930 --> 00:47:56.910
<v Johannes>von solchen Systemen vor 5 oder vor 10

00:47:56.910 --> 00:47:58.810
<v Johannes>Jahren anschaut, würde man erwarten, dass es 10-mal so

00:47:58.810 --> 00:48:00.910
<v Johannes>lange dauert, wie das Audio ist. Aber jetzt ist es

00:48:00.910 --> 00:48:02.690
<v Johannes>gerade umgekehrt, es ist 10-mal so schnell,

00:48:02.690 --> 00:48:04.430
<v Johannes>wie das Audio ist.

00:48:04.430 --> 00:48:06.790
<v Johannes>Wie kriegt ihr das hin, Georg? Ich habe mir das vorhin auf eurer

00:48:06.790 --> 00:48:08.750
<v Johannes>Webseite durchgeschaut und habe mir gedacht, wie kriegt

00:48:08.750 --> 00:48:09.350
<v Johannes>ihr das hin?

00:48:09.350 --> 00:48:12.790
<v Georg>Naja, also du redest jetzt natürlich nicht vom

00:48:12.790 --> 00:48:14.810
<v Georg>Training, sondern von der Influenz, also

00:48:14.810 --> 00:48:15.530
<v Georg>das, was dann

00:48:15.530 --> 00:48:16.550
<v Georg>anwendet wird. Aber trotzdem.

00:48:16.550 --> 00:48:18.870
<v Georg>Ja, trotzdem.

00:48:18.870 --> 00:48:21.330
<v Georg>Es gibt halt mittlerweile gute

00:48:21.330 --> 00:48:23.190
<v Georg>GPUs, um das kurz zu fassen.

00:48:23.190 --> 00:48:24.730
<v Georg>Okay.

00:48:24.730 --> 00:48:27.230
<v Johannes>Ihr habt ein paar horizontal

00:48:27.230 --> 00:48:29.150
<v Johannes>skaliert. Dicke Rechner.

00:48:29.150 --> 00:48:31.490
<v Georg>Naja, geht halt in dem Fall

00:48:31.490 --> 00:48:33.530
<v Georg>leider nicht anders, weil du musst

00:48:33.530 --> 00:48:35.410
<v Georg>die Models halt auf GPUs ausführen,

00:48:35.410 --> 00:48:37.630
<v Georg>weil GPUs sind halt einfach zu langsam.

00:48:37.630 --> 00:48:39.410
<v Georg>Bei uns, wir sind

00:48:39.410 --> 00:48:41.570
<v Georg>in einer glücklichen Lage, dass wir eben nicht so riesige

00:48:41.570 --> 00:48:43.610
<v Georg>Modelle haben, wie die ganzen Language Models.

00:48:43.610 --> 00:48:45.510
<v Georg>Also wir können das auch auf einzelne GPUs,

00:48:45.530 --> 00:48:47.610
<v Georg>ausführen und brauchen dann nicht GPU-Cluster

00:48:47.610 --> 00:48:48.710
<v Georg>für ein Modell.

00:48:48.710 --> 00:48:50.550
<v Georg>Das ist schon mal viel einfacher.

00:48:50.550 --> 00:48:53.350
<v Georg>Aber das Schwierige ist natürlich

00:48:53.350 --> 00:48:55.470
<v Georg>die Rechenleistung beim Training, weil du halt da

00:48:55.470 --> 00:48:57.650
<v Georg>wochenlang das System

00:48:57.650 --> 00:48:59.490
<v Georg>rechnen lassen musst und

00:48:59.490 --> 00:49:01.230
<v Georg>ja, da brauchst du halt einfach viel mehr

00:49:01.230 --> 00:49:03.330
<v Georg>Rechenleistung. Die Influenz ist jetzt

00:49:03.330 --> 00:49:04.750
<v Georg>eh okay. Also es gibt

00:49:04.750 --> 00:49:07.370
<v Georg>die Standard-Anbieter

00:49:07.370 --> 00:49:09.350
<v Georg>wie Hetzna und so weiter, die bieten eh

00:49:09.350 --> 00:49:11.130
<v Georg>GPU-Server auch an mittlerweile

00:49:11.130 --> 00:49:13.630
<v Georg>und da kann man sich einfach einmieten und

00:49:13.630 --> 00:49:15.370
<v Georg>das war es dann im Endeffekt. Wie viel musst du mieten bei

00:49:15.370 --> 00:49:16.970
<v Dominik>Hetzna für dein Modelltrainieren-Training?

00:49:16.970 --> 00:49:18.810
<v Dominik>Ist das einfach den einen? Kostet das 200 Euro oder was?

00:49:18.810 --> 00:49:21.410
<v Georg>Für das Trainieren haben wir nichts bei Hetzna, das wäre

00:49:21.410 --> 00:49:21.950
<v Georg>zu teuer.

00:49:21.950 --> 00:49:25.390
<v Georg>Nur für die Influenz, würde ich sagen.

00:49:25.390 --> 00:49:26.450
<v Georg>Okay.

00:49:26.450 --> 00:49:28.190
<v Georg>Da haben wir keine Ahnung.

00:49:28.190 --> 00:49:31.210
<v Georg>So, zwischen 10 und 20 herum.

00:49:31.210 --> 00:49:33.150
<v Georg>Ja, das ist schon eine ganz schön

00:49:33.150 --> 00:49:35.050
<v Johannes>ordentliche Operation, was ihr da betreibt.

00:49:35.050 --> 00:49:35.270
<v Johannes>Ja.

00:49:35.270 --> 00:49:41.190
<v Johannes>Ist auch vom Betrieb her eine

00:49:41.190 --> 00:49:42.610
<v Johannes>gewisse Herausforderung, weil

00:49:42.610 --> 00:49:45.230
<v Johannes>da werden dann doch die Datenmengen

00:49:45.230 --> 00:49:47.110
<v Johannes>auch, also ich meine, Audio

00:49:47.110 --> 00:49:48.350
<v Johannes>ist jetzt nicht so schlimm wie Video,

00:49:48.350 --> 00:49:50.970
<v Johannes>aber trotzdem kriegst du ja doch

00:49:50.970 --> 00:49:53.130
<v Johannes>Dateien, die eine gewisse Megabyte-Größe

00:49:53.130 --> 00:49:54.710
<v Johannes>haben und die du dann verarbeiten musst

00:49:54.710 --> 00:49:56.430
<v Johannes>und

00:49:56.430 --> 00:49:58.870
<v Johannes>auch, soll ich mal, richtig

00:49:58.870 --> 00:49:59.810
<v Johannes>verarbeiten musst.

00:49:59.810 --> 00:50:03.310
<v Johannes>Also höchster Respekt

00:50:03.310 --> 00:50:05.170
<v Georg>hier. Und vor allem, man braucht

00:50:05.170 --> 00:50:06.330
<v Georg>halt natürlich auch Rechenleistung.

00:50:06.330 --> 00:50:08.410
<v Georg>Das kostet halt auch.

00:50:08.410 --> 00:50:10.970
<v Georg>Das ist dann der Punkt im Endeffekt.

00:50:10.970 --> 00:50:11.910
<v Georg>Ja.

00:50:11.910 --> 00:50:14.810
<v Georg>Das war halt früher schon viel günstiger.

00:50:15.070 --> 00:50:16.730
<v Georg>Also da haben wir das nur auf

00:50:16.730 --> 00:50:18.250
<v Georg>CPUs sozusagen laufen gehabt.

00:50:18.250 --> 00:50:20.830
<v Georg>Hat natürlich auch ähnlich

00:50:20.830 --> 00:50:22.730
<v Georg>lange gedauert, also weil

00:50:22.730 --> 00:50:24.810
<v Georg>die Algorithmen halt auch für damalige

00:50:24.810 --> 00:50:26.290
<v Georg>Verhältnisse relativ aufwendig waren.

00:50:26.290 --> 00:50:28.950
<v Georg>Aber war halt um einiges günstiger.

00:50:28.950 --> 00:50:30.810
<v Georg>Ja, das ist so ein bisschen

00:50:30.810 --> 00:50:32.830
<v Johannes>die Kehrseite, oder, von dieser ganzen

00:50:32.830 --> 00:50:34.990
<v Johannes>neuronale Netze-Geschichte.

00:50:34.990 --> 00:50:36.830
<v Johannes>Auf der einen Seite

00:50:36.830 --> 00:50:38.250
<v Johannes>muss man wesentlich weniger

00:50:38.250 --> 00:50:40.950
<v Johannes>manuelle Arbeit reinstecken,

00:50:40.950 --> 00:50:42.750
<v Johannes>wobei das vielleicht auch gar nicht stimmt.

00:50:42.750 --> 00:50:44.590
<v Johannes>Ja, das ist auch nicht wahr.

00:50:44.590 --> 00:50:45.050
<v Johannes>Aber auf der anderen Seite muss man wesentlich weniger manuelle Arbeit reinstecken, wobei das vielleicht auch gar nicht stimmt.

00:50:45.050 --> 00:50:46.930
<v Johannes>Auf der anderen Seite bezahlt man es halt

00:50:46.930 --> 00:50:47.670
<v Johannes>mit Rechenzyklen.

00:50:47.670 --> 00:50:51.110
<v Jochen>Ach, dazu fällt mir

00:50:51.110 --> 00:50:52.950
<v Jochen>ein, genau, da war ich jetzt überrascht.

00:50:52.950 --> 00:50:54.830
<v Jochen>Ich habe jetzt letztens irgendwie so ein bisschen

00:50:54.830 --> 00:50:56.730
<v Jochen>mit Transkripten-Dicke gemacht.

00:50:56.730 --> 00:50:58.990
<v Jochen>Also, genau,

00:50:58.990 --> 00:51:00.890
<v Jochen>wir waren ja beide auf der

00:51:00.890 --> 00:51:02.710
<v Jochen>Subscribe, aber, und

00:51:02.710 --> 00:51:03.830
<v Jochen>da habe ich dann auch mit anderen

00:51:03.830 --> 00:51:06.850
<v Jochen>Leuten so geredet, wie die das mit

00:51:06.850 --> 00:51:08.250
<v Jochen>Transkripten machen,

00:51:08.250 --> 00:51:11.070
<v Jochen>Podcast-Hosting-Software.

00:51:11.070 --> 00:51:12.830
<v Jochen>Und ich habe mich dann mal so ein bisschen

00:51:12.830 --> 00:51:14.910
<v Jochen>vorgedrückt, weil ich dachte so, oh, das ist aber so viel

00:51:14.910 --> 00:51:16.790
<v Jochen>Arbeit, da weiß ich nicht genau, ob ich das

00:51:16.790 --> 00:51:18.910
<v Jochen>wirklich machen will. Und dann

00:51:18.910 --> 00:51:20.510
<v Jochen>meinten aber alle anderen, ach so, ja,

00:51:20.510 --> 00:51:22.790
<v Jochen>das war jetzt auch nicht so schlimm, das

00:51:22.790 --> 00:51:24.750
<v Jochen>ging schon. Und dann bin ich da rausgegangen

00:51:24.750 --> 00:51:26.290
<v Jochen>mit, okay, ich muss es wohl doch mal machen.

00:51:26.290 --> 00:51:27.850
<v Jochen>Und habe dann jetzt auch mal angefangen.

00:51:27.850 --> 00:51:30.190
<v Jochen>Und dabei...

00:51:30.190 --> 00:51:31.170
<v Jochen>Das ist ganz gut geworden, ne?

00:51:31.170 --> 00:51:34.730
<v Jochen>Ja, also tatsächlich irgendwie mit Whisper

00:51:34.730 --> 00:51:36.410
<v Jochen>hat man jetzt ein Modell, das tatsächlich

00:51:36.410 --> 00:51:37.490
<v Jochen>wirklich ganz gut

00:51:37.490 --> 00:51:40.790
<v Jochen>sozusagen, ja...

00:51:40.790 --> 00:51:42.610
<v Dominik>Also beim Pice-Spin hast du da

00:51:42.610 --> 00:51:43.770
<v Dominik>so ein paar Sachen ja gezeigt.

00:51:43.770 --> 00:51:44.730
<v Dominik>Ja, auf dem Heps-Spin.

00:51:44.730 --> 00:51:44.830
<v Dominik>Genau.

00:51:44.910 --> 00:51:47.650
<v Dominik>Du hast sogar einen Blog-Eintrag dazu geschrieben.

00:51:47.650 --> 00:51:48.210
<v Dominik>Ja.

00:51:48.210 --> 00:51:51.510
<v Dominik>Und man kann es in der CLI benutzen, um

00:51:51.510 --> 00:51:52.930
<v Dominik>Transkripte zu machen für Audio.

00:51:52.930 --> 00:51:55.790
<v Jochen>Genau, aber weswegen ich

00:51:55.790 --> 00:51:57.190
<v Jochen>das jetzt gerade erwähnt habe, ist,

00:51:57.190 --> 00:52:01.650
<v Jochen>wenn man das lokal laufen lässt, dann wird

00:52:01.650 --> 00:52:03.510
<v Jochen>auch das Laptop heiß und der Akku wird alle

00:52:03.510 --> 00:52:05.290
<v Jochen>und das funktioniert alles nur sehr langsam.

00:52:05.290 --> 00:52:07.290
<v Jochen>Und es macht keinen Spaß.

00:52:07.290 --> 00:52:09.050
<v Jochen>Aber es gibt da

00:52:09.050 --> 00:52:11.490
<v Jochen>einen Dienstleister

00:52:11.490 --> 00:52:13.670
<v Jochen>Drog, ich weiß gar nicht, wie man die ausspricht,

00:52:13.670 --> 00:52:14.830
<v Jochen>und die

00:52:14.830 --> 00:52:16.710
<v Jochen>machen ja, die haben sich irgendwie auf

00:52:16.710 --> 00:52:18.830
<v Jochen>Inferenz spezialisiert und machen das irgendwie

00:52:18.830 --> 00:52:20.730
<v Jochen>schnell. Die haben auch, sagen sie

00:52:20.730 --> 00:52:22.670
<v Jochen>jedenfalls, ich habe keine Ahnung, was sie wirklich machen, aber

00:52:22.670 --> 00:52:24.810
<v Jochen>dass sie da halt eigene Hardware

00:52:24.810 --> 00:52:26.630
<v Jochen>haben, die da

00:52:26.630 --> 00:52:27.270
<v Jochen>irgendwie,

00:52:27.270 --> 00:52:30.490
<v Jochen>wo man dann Modelle halt

00:52:30.490 --> 00:52:32.810
<v Jochen>für Inferenz drauflaufen lassen kann,

00:52:32.810 --> 00:52:34.570
<v Jochen>die dann halt noch schneller ist als, weiß ich nicht,

00:52:34.570 --> 00:52:36.750
<v Jochen>GPUs oder so. Und da

00:52:36.750 --> 00:52:39.010
<v Jochen>war es tatsächlich, also irgendwie Whisper V3

00:52:39.010 --> 00:52:40.910
<v Jochen>Large, also was halt

00:52:40.910 --> 00:52:42.530
<v Jochen>auf meinem Laptop echt

00:52:42.530 --> 00:52:44.670
<v Jochen>fies langsam ist, da geht

00:52:44.670 --> 00:52:46.610
<v Jochen>halt so zwei Stunden Episode, geht da halt so

00:52:46.610 --> 00:52:48.590
<v Jochen>in einer Minute ungefähr durch und ist

00:52:48.590 --> 00:52:51.050
<v Jochen>fertig. Und das hat mich schon

00:52:51.050 --> 00:52:52.030
<v Jochen>so, oh krass, also

00:52:52.030 --> 00:52:53.710
<v Jochen>das ging schon ganz gut.

00:52:53.710 --> 00:52:56.370
<v Georg>Naja, es gibt ja jetzt diese schnellere Whisper-Model, das

00:52:56.370 --> 00:52:58.550
<v Georg>Whisper Turbo. Ja, das habe ich, genau,

00:52:58.550 --> 00:53:00.270
<v Jochen>das habe ich auch probiert, das geht

00:53:00.270 --> 00:53:01.450
<v Jochen>schon ganz gut, aber

00:53:01.450 --> 00:53:04.470
<v Jochen>bei Drog,

00:53:04.470 --> 00:53:06.430
<v Jochen>die machen wohl das wirklich, das große

00:53:06.430 --> 00:53:08.050
<v Jochen>Whisper V3 Large.

00:53:08.050 --> 00:53:10.310
<v Jochen>Und das ist aber so schnell. Ja, wir haben ja auch das

00:53:10.310 --> 00:53:12.350
<v Georg>V3 Large.

00:53:12.350 --> 00:53:14.090
<v Georg>Ja, das haben wir auch,

00:53:14.090 --> 00:53:14.470
<v Georg>das haben wir auch.

00:53:14.470 --> 00:53:16.570
<v Georg>Auf den GPUs

00:53:16.570 --> 00:53:17.290
<v Georg>kann es einfach laufen.

00:53:17.290 --> 00:53:18.870
<v Georg>Ah ja, ja.

00:53:18.870 --> 00:53:21.770
<v Georg>Ja, genau. Das ist super, ja.

00:53:21.770 --> 00:53:24.250
<v Jochen>Ja, weil das hat auch, ich habe auch die so ein bisschen

00:53:24.250 --> 00:53:25.130
<v Jochen>verglichen,

00:53:25.130 --> 00:53:28.190
<v Jochen>V2 versus V3 und

00:53:28.190 --> 00:53:30.190
<v Jochen>tatsächlich für Deutsch macht es, bei Englisch macht es gar nicht

00:53:30.190 --> 00:53:31.950
<v Jochen>so einen Riesenunterschied, oder dachte ich jedenfalls jetzt so,

00:53:31.950 --> 00:53:34.370
<v Jochen>aber bei Deutsch macht es halt noch schon einen Unterschied.

00:53:34.370 --> 00:53:36.130
<v Jochen>Also V3 ist nochmal ein gutes Stückchen besser.

00:53:36.130 --> 00:53:38.330
<v Jochen>Also bei Namen

00:53:38.330 --> 00:53:39.930
<v Jochen>oder auch bei Python oder auch

00:53:39.930 --> 00:53:41.770
<v Jochen>das geht eigentlich,

00:53:41.770 --> 00:53:43.770
<v Jochen>da oft das V2

00:53:43.770 --> 00:53:45.550
<v Jochen>versteht es halt nicht so richtig

00:53:45.550 --> 00:53:47.590
<v Jochen>und V3 meistens

00:53:47.590 --> 00:53:49.230
<v Jochen>dann schon, es sind auch immer noch Fehler drin, aber

00:53:49.230 --> 00:53:51.430
<v Jochen>also merkbarer Unterschied für mich.

00:53:51.430 --> 00:53:52.610
<v Jochen>Ja.

00:53:52.610 --> 00:53:55.350
<v Georg>Ja, ich weiß jetzt nicht mehr, welche Version, aber

00:53:55.350 --> 00:53:57.410
<v Georg>ob irgendeine Version ist dann

00:53:57.410 --> 00:53:59.490
<v Georg>auf einmal immer auf Phonic richtig erkannt worden.

00:53:59.490 --> 00:54:01.130
<v Georg>Ja, auch.

00:54:01.130 --> 00:54:03.630
<v Georg>Weil wir haben immer so ein Test-File

00:54:03.630 --> 00:54:05.350
<v Georg>und auf Phonic war zuerst

00:54:05.350 --> 00:54:07.270
<v Georg>immer falsch und dann auf einmal hat es funktioniert.

00:54:07.270 --> 00:54:09.370
<v Georg>Dann werden sich wohl die Daten geändert haben.

00:54:09.370 --> 00:54:10.270
<v Georg>Ja.

00:54:10.270 --> 00:54:13.570
<v Georg>Ihr seid einfach so bekannt, dass ihr jetzt in den Referenzen

00:54:13.570 --> 00:54:14.490
<v Georg>ganz datenvoll kommt.

00:54:14.490 --> 00:54:15.150
<v Georg>Ja, genau.

00:54:15.150 --> 00:54:19.050
<v Jochen>Ich finde das auch total komisch, dass man

00:54:19.050 --> 00:54:21.510
<v Jochen>einem Street-to-Text-Model, dem kann man

00:54:21.510 --> 00:54:23.410
<v Jochen>ja dann auch ein Prompt geben, dass man

00:54:23.410 --> 00:54:25.610
<v Jochen>dem sagen kann, was es tun soll

00:54:25.610 --> 00:54:27.650
<v Jochen>und wie Leute heißen und das funktioniert dann plötzlich.

00:54:27.650 --> 00:54:29.290
<v Jochen>Das fand ich auch sehr eigenartig.

00:54:29.290 --> 00:54:31.430
<v Jochen>Ich weiß jetzt auch noch nicht, dass man das wirklich einstellen

00:54:31.430 --> 00:54:33.290
<v Jochen>kann, aber ich verwende jetzt immer das gleiche Prompt

00:54:33.290 --> 00:54:35.310
<v Jochen>oder muss es halt umkonfigurieren, aber

00:54:35.310 --> 00:54:37.690
<v Jochen>das geht ja auch und das ist auch ganz eigenartig.

00:54:37.690 --> 00:54:39.070
<v Jochen>Also, ja.

00:54:39.070 --> 00:54:41.470
<v Jochen>Ist irgendwie anders als früher.

00:54:43.570 --> 00:54:45.290
<v Georg>Ja, das hat beim Whisper leider

00:54:45.290 --> 00:54:46.610
<v Georg>Seiteneffekte, also

00:54:46.610 --> 00:54:49.310
<v Georg>der, sagen wir mal so,

00:54:49.310 --> 00:54:51.210
<v Georg>das fördert

00:54:51.210 --> 00:54:52.830
<v Georg>Halluzinationen. Ja,

00:54:52.830 --> 00:54:54.250
<v Georg>das kann natürlich sein, ja.

00:54:54.250 --> 00:54:57.290
<v Georg>Deswegen verwenden wir die Prompt im Moment

00:54:57.290 --> 00:54:59.410
<v Georg>eigentlich nicht. Ah, okay.

00:54:59.410 --> 00:55:01.270
<v Jochen>Ja, ich habe mir auch die Transkripte

00:55:01.270 --> 00:55:02.350
<v Jochen>nicht so komplett durchgelesen.

00:55:02.350 --> 00:55:05.170
<v Jochen>Wer weiß, was da jetzt so komische Sachen

00:55:05.170 --> 00:55:06.470
<v Jochen>für Dinge

00:55:06.470 --> 00:55:08.670
<v Jochen>auf die Kontrast-Seite noch schreiben.

00:55:08.670 --> 00:55:10.030
<v Jochen>Es gilt das gesprochene Wort.

00:55:10.030 --> 00:55:13.250
<v Jochen>Liebe Zuhörer, schauen Sie

00:55:13.250 --> 00:55:14.530
<v Jochen>jetzt die Untertitel an.

00:55:14.530 --> 00:55:16.810
<v Jochen>Ja, könnte auch sein, dass das

00:55:16.810 --> 00:55:18.730
<v Jochen>vielleicht nicht so...

00:55:18.730 --> 00:55:18.930
<v Jochen>Ja.

00:55:18.930 --> 00:55:22.610
<v Jochen>Müssen wir jetzt ein paar exotische Wörter sagen, um das,

00:55:22.610 --> 00:55:24.550
<v Johannes>um deine Transkriptionen zu verwirren.

00:55:24.550 --> 00:55:26.130
<v Johannes>Ja.

00:55:26.130 --> 00:55:28.690
<v Georg>Nein, es ist gar nicht so bei Wörtern. Es ist meistens eben,

00:55:28.690 --> 00:55:30.770
<v Georg>wenn nicht gesprochen wird

00:55:30.770 --> 00:55:31.790
<v Georg>oder wenn Pausen sind,

00:55:31.790 --> 00:55:34.830
<v Georg>dass sie dann irgendeine Halluzinationen

00:55:34.830 --> 00:55:36.510
<v Georg>bilden und dann Wörter für Wörter

00:55:36.510 --> 00:55:37.870
<v Georg>abgespult werden, sozusagen.

00:55:37.870 --> 00:55:39.010
<v Georg>Ah.

00:55:39.010 --> 00:55:42.930
<v Johannes>Das hört sich so ein bisschen an, als ob das Modell nur erotisch

00:55:42.930 --> 00:55:43.390
<v Johannes>wäre, oder?

00:55:43.390 --> 00:55:45.150
<v Dominik>Dann machen wir jetzt eine kurze Schweigeminute

00:55:45.150 --> 00:55:46.450
<v Dominik>für...

00:55:46.450 --> 00:55:48.910
<v Dominik>Eine Schweigeminute für Whisper V3.

00:55:48.910 --> 00:55:50.290
<v Dominik>Wisst man auch mal,

00:55:50.290 --> 00:55:52.890
<v Jochen>genau, das Mikrofon hier.

00:55:52.890 --> 00:55:53.950
<v Jochen>Jetzt kommt Whisper zu Wort.

00:55:53.950 --> 00:55:57.230
<v Jochen>Mal schauen, was da so rauskommt, wenn man das einfach mal

00:55:57.230 --> 00:55:58.270
<v Jochen>so vor sich hin

00:55:58.270 --> 00:56:00.450
<v Jochen>generieren lässt.

00:56:00.450 --> 00:56:02.650
<v Jochen>Ja, schon

00:56:02.650 --> 00:56:03.970
<v Jochen>interessant.

00:56:03.970 --> 00:56:07.230
<v Jochen>Ja, ich befürchte aber, Jochen,

00:56:07.230 --> 00:56:09.410
<v Johannes>dass wir die nächste Episode einfach eine komplette

00:56:09.410 --> 00:56:11.130
<v Johannes>Episode machen müssen, wo wir die ganzen

00:56:11.130 --> 00:56:12.850
<v Johannes>Abkürzungen erklären, die wir heute...

00:56:12.930 --> 00:56:14.350
<v Johannes>Abkürzungen, haben wir gehört haben.

00:56:14.350 --> 00:56:16.830
<v Dominik>Wir können auch einfach die ganze Zeit schweigen in der nächsten Episode

00:56:16.830 --> 00:56:18.950
<v Dominik>und dann lassen wir bis bei den Texten...

00:56:18.950 --> 00:56:19.790
<v Dominik>Ja, das geht auch.

00:56:19.790 --> 00:56:22.050
<v Georg>Und dann den Text wieder viel delizieren.

00:56:22.050 --> 00:56:23.730
<v Georg>Ja, genau.

00:56:23.730 --> 00:56:25.570
<v Georg>Mit unseren Stimmen.

00:56:25.570 --> 00:56:28.570
<v Johannes>Und das ein paar Mal im Kreis.

00:56:28.570 --> 00:56:29.830
<v Johannes>Und dann schauen wir mal, was rauskommt.

00:56:29.830 --> 00:56:31.070
<v Johannes>Ja.

00:56:31.070 --> 00:56:34.690
<v Jochen>Ja, ansonsten, genau, ich weiß nicht,

00:56:34.690 --> 00:56:36.790
<v Jochen>haben wir, genau, jetzt haben wir schon

00:56:36.790 --> 00:56:38.890
<v Jochen>eine ganze Weile über so Modelle und Dinge.

00:56:38.890 --> 00:56:40.870
<v Jochen>Der Rest der Infrastruktur

00:56:40.870 --> 00:56:42.130
<v Jochen>ist ja vielleicht auch ganz interessant.

00:56:42.610 --> 00:56:44.990
<v Jochen>Was so Web-Geschichten

00:56:44.990 --> 00:56:45.730
<v Jochen>zum Beispiel angeht.

00:56:45.730 --> 00:56:48.230
<v Jochen>Django, ja, natürlich. Ja, machen wir auch.

00:56:48.230 --> 00:56:50.010
<v Jochen>Nein, wir machen Django wirklich?

00:56:50.010 --> 00:56:50.750
<v Jochen>Ja.

00:56:50.750 --> 00:56:54.990
<v Georg>Ja, wie gesagt, wir verwenden Django.

00:56:54.990 --> 00:56:56.130
<v Georg>Das ist schon

00:56:56.130 --> 00:56:57.950
<v Georg>seit 2013,

00:56:57.950 --> 00:57:00.070
<v Georg>wann das halt gestartet ist.

00:57:00.070 --> 00:57:02.690
<v Georg>Und was verwenden wir dann oft dabei?

00:57:02.690 --> 00:57:05.610
<v Georg>Ja, so Frontend-mäßig.

00:57:05.610 --> 00:57:08.450
<v Georg>Ein paar Sachen haben wir mit Vue gemacht.

00:57:08.450 --> 00:57:10.390
<v Georg>Das ist ein Audio-Inspektor,

00:57:10.390 --> 00:57:12.130
<v Georg>nenne ich das, oder Transcript-Editor,

00:57:12.290 --> 00:57:13.210
<v Georg>der ist mit Vue gemacht.

00:57:13.210 --> 00:57:16.150
<v Georg>Dann, prinzipiell,

00:57:16.150 --> 00:57:17.690
<v Georg>verwenden wir so HTMX

00:57:17.690 --> 00:57:19.850
<v Georg>und solche Sachen mittlerweile

00:57:19.850 --> 00:57:22.390
<v Georg>für so einfachere Interface-Elemente.

00:57:22.390 --> 00:57:24.210
<v Georg>Also für alles, was jetzt nicht

00:57:24.210 --> 00:57:25.250
<v Georg>der Audio-Editor ist.

00:57:25.250 --> 00:57:28.170
<v Georg>Und am Frontend verwenden wir noch

00:57:28.170 --> 00:57:29.990
<v Georg>Tailwind-CSS.

00:57:29.990 --> 00:57:31.630
<v Georg>Was gibt's noch?

00:57:31.630 --> 00:57:34.110
<v Georg>Ja, Alpine teilweise

00:57:34.110 --> 00:57:34.990
<v Georg>für so kleine Charts.

00:57:34.990 --> 00:57:36.650
<v Dominik>Das hört sich genau nach dem an, was wir auch machen.

00:57:36.650 --> 00:57:38.870
<v Georg>Ja, machen jetzt alle, gell?

00:57:38.870 --> 00:57:40.130
<v Georg>Ja, machen irgendwie auch alle.

00:57:40.130 --> 00:57:42.130
<v Jochen>Wahrscheinlich gibt's einen Grund,

00:57:42.130 --> 00:57:43.130
<v Jochen>dafür, warum es so ist.

00:57:43.130 --> 00:57:46.190
<v Jochen>Ja, weil man sich halt nicht

00:57:46.190 --> 00:57:48.830
<v Georg>die geholfenen Frameworks einhandeln will.

00:57:48.830 --> 00:57:50.310
<v Georg>Ja, natürlich.

00:57:50.310 --> 00:57:52.270
<v Georg>Gut, was gibt's noch

00:57:52.270 --> 00:57:53.130
<v Georg>zum Erzählen? Dann

00:57:53.130 --> 00:57:56.310
<v Georg>Backend-mäßig verwenden wir eben

00:57:56.310 --> 00:57:57.830
<v Georg>so eine Task-Queue,

00:57:57.830 --> 00:58:00.270
<v Georg>die diese ganzen Audit-Protesting

00:58:00.270 --> 00:58:01.970
<v Georg>und Encoding-Tasks verteilt.

00:58:01.970 --> 00:58:03.630
<v Georg>Dafür verwenden wir Celery.

00:58:03.630 --> 00:58:06.230
<v Georg>Und die Celery

00:58:06.230 --> 00:58:08.170
<v Georg>läuft dann eben auf verschiedene

00:58:08.170 --> 00:58:09.090
<v Georg>Server verteilt.

00:58:09.090 --> 00:58:11.890
<v Georg>Das sind unsere Worker,

00:58:11.970 --> 00:58:12.450
<v Georg>Rechner.

00:58:12.450 --> 00:58:19.120
<v Georg>Wir haben einen Hauptrechner, wo das Websystem läuft und der verteilt die ganzen Jobs dann auf die Worker-Rechner.

00:58:19.120 --> 00:58:21.380
<v Dominik>Und magst du Celery? Funktioniert es gut?

00:58:21.380 --> 00:58:27.360
<v Georg>Mögen ist übertrieben, aber es funktioniert seit 13 Jahren.

00:58:27.360 --> 00:58:38.500
<v Georg>Aber mittlerweile gibt es auch modernere Tools, schätze ich mal.

00:58:38.500 --> 00:58:42.880
<v Dominik>Wir hoffen, dass Django das Native kann, aber ich weiß nicht, ob das mit dem Distributed da gut geht.

00:58:42.880 --> 00:58:47.500
<v Jochen>Ja, da kommt jetzt was, aber das kann nicht so viel wie Celery.

00:58:47.500 --> 00:58:53.420
<v Jochen>Wenn man wirklich da Last hat und da viele Dinge macht, dann ist es wahrscheinlich.

00:58:53.420 --> 00:58:56.420
<v Jochen>Wenn für einen Celery funktioniert, dann sollte man das wahrscheinlich so lassen.

00:58:56.420 --> 00:59:00.720
<v Jochen>Aber ich glaube auch, es gibt sonst nicht viel Konkurrenz da.

00:59:00.720 --> 00:59:03.880
<v Jochen>Das ist irgendwie für komplexere Geschichten in Celery immer noch.

00:59:03.880 --> 00:59:06.720
<v Jochen>Inzwischen gibt es ja schon einige Task-Queues.

00:59:06.720 --> 00:59:08.380
<v Jochen>Ja, auch mit Django.

00:59:08.500 --> 00:59:12.380
<v Johannes>Mit der Integration, aber Celery ist halt so der bekannte alte Platzhirsch.

00:59:12.380 --> 00:59:18.380
<v Jochen>Ja, aber es ist auch schwer zu benutzen. Das ist so ein bisschen wie das Mischpult hier.

00:59:18.380 --> 00:59:19.600
<v Jochen>Nein.

00:59:19.600 --> 00:59:22.560
<v Jochen>Das liegt doch in der Natur der Sache, oder?

00:59:22.560 --> 00:59:26.480
<v Jochen>Wenn man nicht hinguckt, dreht sich das immer so mit dem Lauf Richtung Fuß.

00:59:26.480 --> 00:59:34.260
<v Jochen>Ja, da braucht man doch noch eine Ausrede. Das ist die Kinderwahn oder jemand anders.

00:59:34.260 --> 00:59:35.140
<v Jochen>Genau.

00:59:35.140 --> 00:59:37.620
<v Jochen>Und dann war man es doch selber. Vielleicht, das kann schon sein.

00:59:37.620 --> 00:59:38.320
<v Jochen>Ja, vor allem.

00:59:38.500 --> 00:59:41.700
<v Dominik>Weil eigentlich musste man ja klicken in deiner DAW.

00:59:41.700 --> 00:59:43.340
<v Dominik>Oder es riecht bei einer DAW, ich weiß nicht.

00:59:43.340 --> 00:59:47.840
<v Dominik>Ja, das hat gar nichts mit dem Mischpult zu tun.

00:59:47.840 --> 00:59:49.340
<v Dominik>Na ja, egal.

00:59:49.340 --> 00:59:50.500
<v Dominik>Na, Task-Queues sind kompliziert.

00:59:50.500 --> 00:59:52.300
<v Georg>Ja, wir haben dann auch verschiedene Task-Queues.

00:59:52.300 --> 00:59:53.420
<v Georg>Das macht es mal komplizierter.

00:59:53.420 --> 00:59:58.600
<v Georg>Also einerseits diese ganzen CPU-Server, die funktionieren eben über Celery.

00:59:58.600 --> 01:00:02.820
<v Georg>Dann haben wir eben noch GPU-Server, die funktionieren dann wiederum,

01:00:02.820 --> 01:00:08.420
<v Georg>die werden dann wiederum von den CPU-Servern angesprochen mit den ganzen Audioabstellungen.

01:00:08.500 --> 01:00:15.080
<v Georg>Die haben so ein, das nennt sich so ein NVIDIA Triton, das ist so ein NVIDIA-System,

01:00:15.080 --> 01:00:20.380
<v Georg>wo man eben so Models hosten kann am GPU, der verteilt das relativ effizient im Speicher,

01:00:20.380 --> 01:00:27.780
<v Georg>weil der hat wiederum eine eigene Task-Queue integriert, wie so kleine GPU-Jobs verteilt werden.

01:00:27.780 --> 01:00:34.360
<v Georg>Weil das Problem bei den Models ist, dass man kann jetzt nicht für jeden Request das Model,

01:00:34.360 --> 01:00:38.460
<v Georg>oder es wäre nicht sehr effizient, wenn man für jeden Request das Model jetzt neu ladet,

01:00:38.500 --> 01:00:44.140
<v Georg>in den Speicher, also in den GPU-Rahmen, weil das Laden an sich von so ein paar Gigabyte-Models

01:00:44.140 --> 01:00:46.420
<v Georg>dann schon mal ziemlich lang dauert.

01:00:46.420 --> 01:00:53.620
<v Georg>Deswegen gibt es eben zum Beispiel das NVIDIA Triton, der versucht, das eben möglichst effizient zu managen,

01:00:53.620 --> 01:01:02.880
<v Georg>dass die Models halt immer im V-Rahmen sind, beziehungsweise nur wenn notwendig halt ein anderes Laden und so weiter.

01:01:02.880 --> 01:01:07.840
<v Georg>Und das ist dann sozusagen die zweite Task-Queue hinter der ersten Task-Queue.

01:01:08.500 --> 01:01:14.220
<v Georg>Und dann kommt das von den GPU-Servern eben wieder Druck zur Celery-Task-Queue auf den CPU-Servern.

01:01:14.220 --> 01:01:20.100
<v Georg>Und dort gibt es dann, dort wird dann noch verschiedene Files, also wenn das Audio-Processing fertig ist,

01:01:20.100 --> 01:01:26.840
<v Georg>gibt es dann File-Encoding-Tasks und dann Speech-Recognition-Tasks, dann wird es wiederum zum GPU-Server, zum anderen geschickt.

01:01:26.840 --> 01:01:32.220
<v Georg>Dann, was gibt es noch, dann eben so ein Verteil-Task, der das auf verschiedene Server dann schickt,

01:01:32.220 --> 01:01:34.860
<v Georg>also Netzwerk-Tasks oder auf YouTube oder was auch immer.

01:01:34.860 --> 01:01:38.220
<v Georg>Und so sickert das von Task zu Task dahin.

01:01:38.500 --> 01:01:41.160
<v Georg>Im Celery und im Nvidia Triton.

01:01:41.160 --> 01:01:44.360
<v Dominik>Und den Status erfasst du irgendwie in einem Dango-Modell.

01:01:44.360 --> 01:01:46.620
<v Dominik>Genau, ja.

01:01:46.620 --> 01:01:50.620
<v Georg>Die Tasks rufen sich dann eben so seriell auf.

01:01:50.620 --> 01:01:54.440
<v Georg>Also es gibt ja bei Celery also Chord-Tasks, nennen sie das.

01:01:54.440 --> 01:01:58.920
<v Georg>Also da kann man verschieden, wenn jetzt zum Beispiel ein Audio-Processing fertig ist

01:01:58.920 --> 01:02:03.660
<v Georg>und man will daraus fünf verschiedene File-Formate erstellen, dann kann man so ein Chord-Task machen.

01:02:03.660 --> 01:02:07.840
<v Georg>Der macht dann diese fünf File-Formate parallel und dann sagt man,

01:02:08.500 --> 01:02:12.120
<v Georg>wenn jetzt alle von diesen fünf fertig sind, dann ruft er den nächsten Task auf.

01:02:12.120 --> 01:02:15.180
<v Georg>Also das ist zum Beispiel dann der Finish-Task.

01:02:15.180 --> 01:02:18.400
<v Georg>Der wird dann aufgerufen, wenn diese ganzen Tasks fertig sind.

01:02:18.400 --> 01:02:20.160
<v Georg>Oder der Distribution-Task.

01:02:20.160 --> 01:02:26.460
<v Georg>Und so kann man so Ketten bauen, die sich dann also quasi parallel verbreiten

01:02:26.460 --> 01:02:28.720
<v Georg>und dann wieder irgendwann zusammenführen, hoffentlich.

01:02:28.720 --> 01:02:30.080
<v Georg>Ja.

01:02:30.080 --> 01:02:32.040
<v Georg>Bis das irgendwann fertig ist.

01:02:32.040 --> 01:02:35.820
<v Jochen>Ja, man hat dann so ganze Task-Grafen oft irgendwie.

01:02:35.820 --> 01:02:37.820
<v Jochen>Ja.

01:02:38.500 --> 01:02:38.800
<v Jochen>Ja.

01:02:38.800 --> 01:02:43.720
<v Jochen>Ist dann manchmal so ein bisschen schwierig, wenn man es testen will.

01:02:43.720 --> 01:02:48.940
<v Jochen>Und manchmal hat man so komische Probleme, wenn das an einer unerwarteten Stelle schief geht.

01:02:48.940 --> 01:02:51.020
<v Jochen>Aber ja, man kann damit viel machen.

01:02:51.020 --> 01:02:53.600
<v Georg>Aber testen ist auch nicht so schlimm.

01:02:53.600 --> 01:02:56.900
<v Georg>Also man kann natürlich die Tasks einzeln testen.

01:02:56.900 --> 01:02:59.180
<v Georg>Mit Unit-Tests ganz einfach.

01:02:59.180 --> 01:03:02.980
<v Georg>Das Gesamtsystem ist wieder ein bisschen komplexer zum Testen, ja.

01:03:02.980 --> 01:03:03.680
<v Georg>Ja.

01:03:03.680 --> 01:03:06.060
<v Dominik>Ich hatte immer das Hauptproblem, was ich mal hatte,

01:03:06.060 --> 01:03:08.320
<v Dominik>das war irgendwie aufzuräumen, wenn da irgendwas kaputt gegangen ist.

01:03:08.500 --> 01:03:09.980
<v Dominik>Dass da irgendwelche Geister-Tasks irgendwann waren,

01:03:09.980 --> 01:03:13.120
<v Dominik>weil irgendwie noch irgendwas geklickt hat und dann nicht genau klar war,

01:03:13.120 --> 01:03:15.700
<v Dominik>wo jetzt welcher Task in welchem Status hing oder so.

01:03:15.700 --> 01:03:16.920
<v Dominik>Ja, klar.

01:03:16.920 --> 01:03:21.180
<v Dominik>Und da war das im Ganzen echt so ein Ding, das ist irgendwie schwierig zu verstehen

01:03:21.180 --> 01:03:25.740
<v Dominik>und dann irgendwo noch so Reste drum hängen, wo die dann prozessiert werden wollen.

01:03:25.740 --> 01:03:28.560
<v Dominik>Aber ich glaube, wenn man so ein stabiles System hat,

01:03:28.560 --> 01:03:29.900
<v Dominik>vielleicht raucht das ja gar nicht so oft ab.

01:03:29.900 --> 01:03:34.180
<v Georg>Nein, das ist eigentlich relativ stabil.

01:03:34.180 --> 01:03:37.620
<v Georg>Außer wir machen wieder irgendwas Komisches oder so,

01:03:37.620 --> 01:03:38.480
<v Georg>was ja manchmal passiert.

01:03:38.500 --> 01:03:40.500
<v Georg>Diverse Updates oder Features.

01:03:40.500 --> 01:03:46.100
<v Georg>Aber prinzipiell läuft das eigentlich sehr stabil.

01:03:46.100 --> 01:03:48.900
<v Georg>Das läuft bei uns jetzt natürlich auch sehr lang.

01:03:48.900 --> 01:03:51.240
<v Georg>Also wir haben alle möglichen Dinge drinnen,

01:03:51.240 --> 01:03:54.020
<v Georg>wie das Fail-Checking und so weiter.

01:03:54.020 --> 01:03:56.440
<v Georg>Aber das funktioniert ganz gut.

01:03:56.440 --> 01:04:00.540
<v Johannes>Ja, ich glaube, das ist einfach auch so ein Thema, was man lernen muss.

01:04:00.540 --> 01:04:05.500
<v Johannes>Das ist halt einfach noch eine weitere Ebene von dieser Async-Sache.

01:04:05.500 --> 01:04:08.320
<v Johannes>Ja, das ist immer ein Abspiel.

01:04:08.320 --> 01:04:09.320
<v Johannes>Es gibt viele Ebenen inzwischen.

01:04:09.320 --> 01:04:11.840
<v Johannes>Ganz unten hast du Async, dann hast du Threads,

01:04:11.840 --> 01:04:13.740
<v Johannes>dann hast du Multiprocessing und oben drüber.

01:04:13.740 --> 01:04:15.340
<v Georg>Ja, wir verwenden es gar nicht Async,

01:04:15.340 --> 01:04:17.420
<v Georg>wir verwenden das wirklich Multiprocessing.

01:04:17.420 --> 01:04:20.460
<v Georg>Also du kannst das Sellerie mit Multiprocessing auch verwenden.

01:04:20.460 --> 01:04:21.640
<v Georg>Ja, ja, klar.

01:04:21.640 --> 01:04:24.320
<v Johannes>Das ist halt über mehrere Rechner verteilt.

01:04:24.320 --> 01:04:30.400
<v Johannes>Das ist die nächsthöhere Ebene von diesen ganzen Parallel-Compute-Sachen.

01:04:30.400 --> 01:04:33.440
<v Johannes>Und die sind alle kompliziert und dann kann man eigentlich irgendwie nicht erwarten,

01:04:33.440 --> 01:04:36.180
<v Johannes>dass das auf der Ebene auf einmal simpel wird.

01:04:36.180 --> 01:04:37.680
<v Johannes>Aber, ja gut.

01:04:38.320 --> 01:04:41.740
<v Johannes>Es ist halt was, was man lernen muss oder was man lernen kann.

01:04:41.740 --> 01:04:45.820
<v Johannes>Und ich habe da eigentlich ganz gute Erfahrungen gemacht.

01:04:45.820 --> 01:04:48.980
<v Johannes>Aber es hängt auch von der Systemart ab.

01:04:48.980 --> 01:04:53.340
<v Johannes>Und es hängt auch davon ab, wie man die Bauteile benutzt.

01:04:53.340 --> 01:04:55.560
<v Johannes>Die Bauteile an sich sind ja sehr, sehr stabil.

01:04:55.560 --> 01:04:58.560
<v Johannes>Wenn man jetzt ein Redis oder ein, was weiß ich, was ihr verwendet,

01:04:58.560 --> 01:05:00.940
<v Johannes>RabbitMQ oder ZeroMQ oder was auch immer.

01:05:00.940 --> 01:05:02.980
<v Johannes>Die sind ja extrem stabil.

01:05:02.980 --> 01:05:07.300
<v Johannes>Also bei einem anderen Kundenprojekt haben wir einen RabbitMQ-Server.

01:05:08.140 --> 01:05:11.860
<v Johannes>Der läuft seit, keine Ahnung, acht Jahren unterbrechungsfrei.

01:05:11.860 --> 01:05:15.120
<v Johannes>Und die Bauteile an sich sind schon stabil.

01:05:15.120 --> 01:05:20.000
<v Johannes>Nur, wie wir das alle wissen,

01:05:20.000 --> 01:05:23.160
<v Johannes>ich kann in jeder Programmiersprache schlechte Programme schreiben

01:05:23.160 --> 01:05:26.900
<v Johannes>und ich kann auch schlechte verteilte Programme schreiben, wenn es sein muss.

01:05:26.900 --> 01:05:30.400
<v Johannes>Auf alle Fälle, ja.

01:05:30.400 --> 01:05:32.080
<v Johannes>Ja.

01:05:32.080 --> 01:05:37.080
<v Jochen>Ja, vielleicht, genau.

01:05:38.140 --> 01:05:42.780
<v Jochen>Wie ist das eigentlich mit Benutzerfeedback?

01:05:42.780 --> 01:05:46.720
<v Jochen>Im Grunde, wenn man jetzt irgendwie Dinge verbessern will,

01:05:46.720 --> 01:05:48.900
<v Jochen>dann ist man ja darauf angewiesen,

01:05:48.900 --> 01:05:53.340
<v Jochen>diese ganzen subjektiven Geschichten, die wir eben auch schon da angesprochen hatten,

01:05:53.340 --> 01:05:55.160
<v Jochen>die spielen da ja auch eine große Rolle.

01:05:55.160 --> 01:05:58.160
<v Jochen>Und wenn jetzt, jetzt weiß man aber vielleicht gar nicht so genau,

01:05:58.160 --> 01:06:02.260
<v Jochen>wenn jetzt aus quasi Leute Feedback geben,

01:06:02.260 --> 01:06:04.500
<v Jochen>weil sie das anders gewohnt sind oder so,

01:06:04.500 --> 01:06:07.900
<v Jochen>wie man das unterscheidet von, da hat irgendwas nicht richtig funktioniert oder so.

01:06:07.960 --> 01:06:08.720
<v Jochen>Da muss man ja wahrscheinlich,

01:06:08.720 --> 01:06:13.240
<v Jochen>ich weiß auch gar nicht, in welchen Märkten oder wo Aufforderung überall benutzt wird.

01:06:13.240 --> 01:06:15.260
<v Jochen>Das ist ja dann wahrscheinlich auch unterschiedlich.

01:06:15.260 --> 01:06:17.740
<v Jochen>Auch je nach Kontext nochmal unterschiedlich.

01:06:17.740 --> 01:06:19.320
<v Jochen>Das ist wahrscheinlich gar nicht so einfach,

01:06:19.320 --> 01:06:21.620
<v Jochen>das dann wieder einfließen zu lassen.

01:06:21.620 --> 01:06:27.240
<v Georg>Ja, bei solchen Sachen ist es natürlich schwierig.

01:06:27.240 --> 01:06:29.500
<v Georg>Aber deswegen versuchen wir eigentlich natürlich,

01:06:29.500 --> 01:06:34.980
<v Georg>möglichst wenig subjektive oder künstlerische Sachen zu machen.

01:06:34.980 --> 01:06:37.400
<v Georg>Auch wenn das natürlich nicht wirklich geht.

01:06:37.940 --> 01:06:41.140
<v Georg>Aber gewisses Feedback ist natürlich leicht zu verstehen,

01:06:41.140 --> 01:06:44.700
<v Georg>wenn der sagt, okay, da ist da ein neues nicht rausgelöscht worden

01:06:44.700 --> 01:06:46.860
<v Georg>oder da ist irgendwas falsch rausgelöscht worden.

01:06:46.860 --> 01:06:49.000
<v Georg>Dann kann man das natürlich leicht nachvollziehen.

01:06:49.000 --> 01:06:54.060
<v Georg>Dass irgendwer subjektiv ein anderes EQing haben will,

01:06:54.060 --> 01:06:56.020
<v Georg>das kann es immer geben.

01:06:56.020 --> 01:06:58.320
<v Georg>Da werden wir auch nie was dagegen machen können.

01:06:58.320 --> 01:07:01.460
<v Georg>Wahrscheinlich, man kann nur eine gewisse Anzahl an Varianten anbieten

01:07:01.460 --> 01:07:03.280
<v Georg>und irgendwann ist halt einmal Schluss.

01:07:03.280 --> 01:07:05.560
<v Georg>Dann muss man es halt selber filtern.

01:07:05.560 --> 01:07:07.920
<v Georg>Und das geht ja bei uns auch, dass wir halt einfach,

01:07:07.920 --> 01:07:11.080
<v Georg>dass man das Filtering deaktiviert und man hat halt selber das gefiltert,

01:07:11.080 --> 01:07:11.660
<v Georg>wie man sagen will.

01:07:11.660 --> 01:07:17.120
<v Georg>Aber das kommt jetzt auch nicht so extrem oft vor, muss ich sagen.

01:07:17.120 --> 01:07:19.120
<v Jochen>Also es ist schon eher eindeutig dann quasi,

01:07:19.120 --> 01:07:20.980
<v Jochen>wenn Leute, ja, okay.

01:07:20.980 --> 01:07:26.960
<v Georg>Und aus dem Feedback, das ist für uns natürlich extrem wichtig.

01:07:26.960 --> 01:07:28.760
<v Georg>Also da lernen wir halt extrem viel.

01:07:28.760 --> 01:07:32.500
<v Georg>Wenn wir Fehler haben, dann führt man das wieder zu den Trainingsdaten dazu

01:07:32.500 --> 01:07:33.120
<v Georg>und so weiter.

01:07:33.120 --> 01:07:35.680
<v Georg>Können die Klassifikatoren wieder damit trainieren.

01:07:35.680 --> 01:07:37.900
<v Georg>Warum habt ihr das?

01:07:37.900 --> 01:07:39.580
<v Dominik>Warst du noch nicht live im Einsatz eigentlich?

01:07:39.580 --> 01:07:41.120
<v Georg>Warst du live im Einsatz?

01:07:41.120 --> 01:07:44.540
<v Dominik>Also jetzt beispielsweise auch von mir als Plugin in meiner DAW irgendwie.

01:07:44.540 --> 01:07:46.420
<v Jochen>So, den Weg können wir auch gehen, ja.

01:07:46.420 --> 01:07:51.700
<v Georg>Ja, weil wir eigentlich vom Offline-Konzept her kommen

01:07:51.700 --> 01:07:56.800
<v Georg>und unsere Algorithmen halt alle drauf aufgebaut sind,

01:07:56.800 --> 01:07:57.940
<v Georg>dass es offline funktioniert.

01:07:57.940 --> 01:08:01.360
<v Georg>Bei live bräuchtest du natürlich eine viel kleinere Latenz.

01:08:01.360 --> 01:08:05.220
<v Georg>Wäre mit einigen Algorithmen eh möglich.

01:08:05.220 --> 01:08:07.220
<v Georg>Also zum Beispiel, ja,

01:08:07.900 --> 01:08:11.100
<v Georg>zum Beispiel denoising oder solche Sachen.

01:08:11.100 --> 01:08:13.420
<v Georg>Oder Filtering natürlich.

01:08:13.420 --> 01:08:16.820
<v Georg>Aber, ja, alles können wir auch nicht machen.

01:08:16.820 --> 01:08:18.840
<v Georg>Das Problem ist eigentlich,

01:08:18.840 --> 01:08:19.860
<v Georg>das Problem ist eigentlich,

01:08:19.860 --> 01:08:22.000
<v Georg>dass du halt spezielle Hardware dafür brauchst.

01:08:22.000 --> 01:08:23.400
<v Georg>Wenn du es jetzt live machen willst,

01:08:23.400 --> 01:08:26.260
<v Georg>kannst du jetzt entweder einen Webservice anbieten,

01:08:26.260 --> 01:08:27.340
<v Georg>der das live macht,

01:08:27.340 --> 01:08:28.980
<v Georg>was wahrscheinlich nicht so interessant ist.

01:08:28.980 --> 01:08:32.180
<v Georg>Das heißt, wenn, dann müsstest du eine Standalone-Lösung haben.

01:08:32.180 --> 01:08:35.940
<v Georg>Die muss dementsprechend gut funktionieren,

01:08:35.940 --> 01:08:37.880
<v Georg>jetzt auf allen Systemen.

01:08:37.900 --> 01:08:40.320
<v Georg>Mit der beschränkten Hardware, die man dort eben hat.

01:08:40.320 --> 01:08:45.140
<v Georg>Oder man hat spezielle Systeme mit GPUs oder M3-Chips, was auch immer,

01:08:45.140 --> 01:08:46.680
<v Georg>wo das sicher ein bisschen besser geht.

01:08:46.680 --> 01:08:50.840
<v Georg>Aber es ist halt vor allem in der momentanen Phase noch ein bisschen schwieriger.

01:08:50.840 --> 01:08:53.260
<v Georg>Also im Moment entwickeln sich die Modelle ja so schnell weiter.

01:08:53.260 --> 01:08:55.260
<v Georg>Also man braucht so viel Hardware dafür.

01:08:55.260 --> 01:08:59.060
<v Georg>Das wird in ein paar Jahren sicher wieder anders ausschauen, glaube ich mal.

01:08:59.060 --> 01:09:01.160
<v Georg>Weil dann wird sich das so ein bisschen eingependelt haben.

01:09:01.160 --> 01:09:05.940
<v Georg>Dann wird da mehr Hardware dafür verfügbar sein auf normalen Stand rechnen.

01:09:05.940 --> 01:09:07.880
<v Georg>Dann wird sicher irgendwann wieder die Welt,

01:09:07.880 --> 01:09:12.880
<v Georg>wo diese ganzen Modelle dann auf den Personal Computer wieder überschwemmen.

01:09:12.880 --> 01:09:14.540
<v Georg>Oder überschwappen.

01:09:14.540 --> 01:09:17.240
<v Georg>Aber im Moment ist es halt noch ein bisschen schwierig.

01:09:17.240 --> 01:09:21.680
<v Jochen>Ja, also was ich schon gerne hätte, wäre sozusagen in den AirPods.

01:09:21.680 --> 01:09:23.080
<v Jochen>Da gibt es ja auch so einen Transparenzmodus.

01:09:23.080 --> 01:09:28.780
<v Jochen>Da jetzt, statt einfach nur, dass das ein bisschen lauter oder leiser wird,

01:09:28.780 --> 01:09:30.100
<v Jochen>wenn es Nebengeräusche gibt,

01:09:30.100 --> 01:09:32.300
<v Jochen>dass das dann so richtig schön klar wird.

01:09:32.300 --> 01:09:33.080
<v Jochen>Das wäre natürlich toll.

01:09:33.080 --> 01:09:34.540
<v Jochen>Man könnte ja auf dem Handy das auch irgendwie...

01:09:34.540 --> 01:09:35.040
<v Jochen>Podcast-Modus.

01:09:35.040 --> 01:09:35.780
<v Jochen>Ja, genau.

01:09:35.780 --> 01:09:37.720
<v Jochen>Da kann man natürlich auch die Modelle laufen lassen.

01:09:37.880 --> 01:09:40.620
<v Jochen>Aber ja gut, wahrscheinlich ist das alles nicht so ganz einfach.

01:09:40.620 --> 01:09:42.980
<v Dominik>Da tauscht man bestimmt auch von Nose-Canceling auch wieder, ne?

01:09:42.980 --> 01:09:44.460
<v Dominik>Wenn du es halt dann einfach umdrehst.

01:09:44.460 --> 01:09:46.200
<v Dominik>Ja, Hörgeräte.

01:09:46.200 --> 01:09:47.980
<v Georg>Ich meine, die sind voll in dieser Entwicklung dabei.

01:09:47.980 --> 01:09:48.400
<v Georg>Ja, Hörgeräte sind genau daraus.

01:09:48.400 --> 01:09:49.900
<v Georg>Die machen eh das.

01:09:49.900 --> 01:09:53.120
<v Georg>Aber halt, ich meine, da ist halt die Arbeit,

01:09:53.120 --> 01:09:55.700
<v Georg>dass du die Modelle, die es gibt,

01:09:55.700 --> 01:09:58.720
<v Georg>meistens so effizient wie möglich hinkriegst.

01:09:58.720 --> 01:10:03.020
<v Georg>Also da geht es halt eher mehr um Effizienz-Tuning

01:10:03.020 --> 01:10:04.720
<v Georg>für eine bestimmte Plattform.

01:10:04.720 --> 01:10:06.000
<v Georg>Und dann im Endeffekt für den Chip,

01:10:06.000 --> 01:10:07.860
<v Georg>was halt der in seinem Hörgerät hat.

01:10:08.840 --> 01:10:11.340
<v Georg>Und natürlich Akku schonen und so weiter,

01:10:11.340 --> 01:10:12.920
<v Georg>weil das ist natürlich wichtig für Hörgeräte.

01:10:12.920 --> 01:10:16.260
<v Georg>Aber ja, im Moment sind wir halt mehr so in einer Phase,

01:10:16.260 --> 01:10:17.820
<v Georg>dass wir gerade noch dabei sind.

01:10:17.820 --> 01:10:19.320
<v Georg>Also jetzt nicht nur wir persönlich,

01:10:19.320 --> 01:10:21.040
<v Georg>sondern generell schätze ich halt,

01:10:21.040 --> 01:10:24.640
<v Georg>dass man mehr dabei ist, die Modelle weiterzuentwickeln.

01:10:24.640 --> 01:10:25.980
<v Georg>Irgendwann wird es eh saturieren,

01:10:25.980 --> 01:10:28.200
<v Georg>weil dann werden ja alle einmal gut genug sein

01:10:28.200 --> 01:10:29.840
<v Georg>für die meisten Tasks, sage ich mal.

01:10:29.840 --> 01:10:32.720
<v Georg>Und dann wird sicher wieder die andere Welle kommen,

01:10:32.720 --> 01:10:35.440
<v Georg>wo das wieder zurückgeht, glaube ich.

01:10:35.440 --> 01:10:37.220
<v Georg>Aber wir werden sehen.

01:10:37.620 --> 01:10:39.880
<v Jochen>So Exploration versus Exploitation.

01:10:39.880 --> 01:10:41.660
<v Jochen>Und momentan sind wir im Exploration-Modus,

01:10:41.660 --> 01:10:42.980
<v Jochen>wo wir versuchen rauszufinden,

01:10:42.980 --> 01:10:45.140
<v Jochen>was man überhaupt alles denn noch damit machen kann.

01:10:45.140 --> 01:10:49.420
<v Georg>Und wenn es dann einmal gut genug ist,

01:10:49.420 --> 01:10:50.520
<v Georg>wird es abgespeckt,

01:10:50.520 --> 01:10:53.680
<v Georg>dass es auf allen möglichen Plattformen läuft wahrscheinlich.

01:10:53.680 --> 01:10:55.820
<v Johannes>Ja, also ich bin so ein, wie gesagt,

01:10:55.820 --> 01:10:57.820
<v Johannes>so ein bisschen erschlagen von diesem ganzen Thema.

01:10:57.820 --> 01:11:00.740
<v Johannes>Da gibt es irgendwie so viele Sachen,

01:11:00.740 --> 01:11:02.100
<v Johannes>wo man in die Tiefe gehen könnte,

01:11:02.100 --> 01:11:04.780
<v Johannes>wo ich aber jetzt gar nicht den,

01:11:04.780 --> 01:11:06.180
<v Johannes>wo ich gar nicht weiß,

01:11:06.180 --> 01:11:07.560
<v Johannes>wie man da in die Tiefe gehen könnte,

01:11:07.560 --> 01:11:08.820
<v Johannes>weil sie mir sich nicht erschließen.

01:11:08.820 --> 01:11:11.560
<v Johannes>Und ich finde es super spannend,

01:11:11.560 --> 01:11:15.900
<v Johannes>dass das einfach so ein ganzes Riesenfeld ist,

01:11:15.900 --> 01:11:18.900
<v Johannes>was es gibt und was man braucht

01:11:18.900 --> 01:11:20.240
<v Johannes>und wo es auch viele Leute gibt,

01:11:20.240 --> 01:11:21.140
<v Johannes>die da dran arbeiten

01:11:21.140 --> 01:11:23.180
<v Johannes>und auch viele Profis gibt,

01:11:23.180 --> 01:11:24.100
<v Johannes>die da dran arbeiten.

01:11:24.100 --> 01:11:26.100
<v Johannes>Ich habe selbst,

01:11:26.100 --> 01:11:28.560
<v Johannes>mein Cousin hat eine Konzertagentur,

01:11:28.560 --> 01:11:33.020
<v Johannes>also die machten da auch ganz viel im Live-Bereich

01:11:33.020 --> 01:11:35.400
<v Johannes>und im Analog-Bereich, sage ich mal.

01:11:35.400 --> 01:11:37.540
<v Johannes>Und ich habe,

01:11:37.540 --> 01:11:38.800
<v Johannes>ich habe da überhaupt keine Ahnung.

01:11:38.800 --> 01:11:41.300
<v Johannes>Ich habe so wenig Ahnung davon,

01:11:41.300 --> 01:11:43.160
<v Johannes>dass ich keine sinnvollen Fragen stellen kann.

01:11:43.160 --> 01:11:44.380
<v Johannes>Und ich glaube,

01:11:44.380 --> 01:11:45.880
<v Johannes>an dem Punkt sind wir jetzt irgendwie so, oder?

01:11:45.880 --> 01:11:49.180
<v Johannes>Dass wir so die grobe Form abgetastet haben

01:11:49.180 --> 01:11:50.020
<v Johannes>von diesem System

01:11:50.020 --> 01:11:51.940
<v Johannes>und dann haben wir uns schon mal mit der Task-View beschäftigt,

01:11:51.940 --> 01:11:53.220
<v Johannes>weil wir da alle was dazu sagen können.

01:11:53.220 --> 01:11:56.820
<v Johannes>Aber so die richtigen Fragen

01:11:56.820 --> 01:11:57.740
<v Johannes>kann man gar nicht mehr stellen.

01:11:57.740 --> 01:12:01.000
<v Johannes>So geht es mir jetzt gerade.

01:12:01.000 --> 01:12:02.000
<v Johannes>Ich weiß nicht, wie es euch geht.

01:12:02.000 --> 01:12:03.960
<v Jochen>Ja, also genau.

01:12:03.960 --> 01:12:05.420
<v Jochen>Ich würde dann eher so etwas fragen,

01:12:05.420 --> 01:12:06.320
<v Jochen>wie vielleicht,

01:12:06.320 --> 01:12:06.620
<v Jochen>wie,

01:12:06.620 --> 01:12:07.400
<v Jochen>was,

01:12:07.480 --> 01:12:08.100
<v Jochen>würdest du denn denken,

01:12:08.100 --> 01:12:09.540
<v Jochen>sind die interessanten Entwicklungen

01:12:09.540 --> 01:12:11.020
<v Jochen>in diesem ganzen Audio-Bereich,

01:12:11.020 --> 01:12:13.340
<v Jochen>in welche Richtung könntest du da gehen?

01:12:13.340 --> 01:12:14.480
<v Jochen>Oder gibt es irgendwelche,

01:12:14.480 --> 01:12:16.400
<v Jochen>wird es jetzt erstmal noch eine Weile

01:12:16.400 --> 01:12:17.520
<v Jochen>quasi

01:12:17.520 --> 01:12:19.480
<v Jochen>mehr Modelle

01:12:19.480 --> 01:12:21.000
<v Jochen>geben?

01:12:21.000 --> 01:12:22.580
<v Jochen>Ja, ich weiß nicht genau.

01:12:22.580 --> 01:12:23.720
<v Jochen>Ja.

01:12:23.720 --> 01:12:25.060
<v Jochen>Oder wird das,

01:12:25.060 --> 01:12:25.700
<v Jochen>ja,

01:12:25.700 --> 01:12:26.500
<v Jochen>wird das irgendwann

01:12:26.500 --> 01:12:28.940
<v Jochen>sowieso alles,

01:12:28.940 --> 01:12:30.300
<v Jochen>naja,

01:12:30.300 --> 01:12:30.740
<v Jochen>das,

01:12:30.740 --> 01:12:31.440
<v Jochen>ja, also,

01:12:31.440 --> 01:12:32.500
<v Jochen>ja, keine Ahnung.

01:12:32.500 --> 01:12:32.980
<v Jochen>Ich weiß gar nicht,

01:12:32.980 --> 01:12:33.940
<v Jochen>welche Frage ich stellen wollte.

01:12:33.940 --> 01:12:35.420
<v Jochen>Na, gerne.

01:12:35.420 --> 01:12:35.840
<v Jochen>Also,

01:12:35.840 --> 01:12:36.640
<v Jochen>ja, klar,

01:12:36.640 --> 01:12:37.460
<v Jochen>es gibt jetzt natürlich,

01:12:37.460 --> 01:12:37.740
<v Jochen>viele,

01:12:37.740 --> 01:12:39.520
<v Georg>alle möglichen neuen Modelle

01:12:39.520 --> 01:12:40.780
<v Georg>von vielen Firmen.

01:12:40.780 --> 01:12:44.140
<v Georg>Was natürlich ein großes Thema ist,

01:12:44.140 --> 01:12:46.880
<v Georg>was wir jetzt gar nicht angegangen sind,

01:12:46.880 --> 01:12:47.400
<v Georg>bis jetzt,

01:12:47.400 --> 01:12:48.640
<v Georg>oder wahrscheinlich auch nicht klären,

01:12:48.640 --> 01:12:50.380
<v Georg>ist eben Audiosynthese,

01:12:50.380 --> 01:12:51.800
<v Georg>wie ihr sicher alle wisst.

01:12:51.800 --> 01:12:52.400
<v Georg>Ja.

01:12:52.400 --> 01:12:53.860
<v Georg>Eleven Labs und so weiter.

01:12:53.860 --> 01:12:54.280
<v Georg>Oh ja.

01:12:54.280 --> 01:12:54.680
<v Georg>Also,

01:12:54.680 --> 01:12:57.300
<v Georg>funktioniert ja schon echt extrem gut.

01:12:57.300 --> 01:12:58.840
<v Georg>Und,

01:12:58.840 --> 01:12:59.980
<v Georg>ja,

01:12:59.980 --> 01:13:01.420
<v Georg>wird sicher viel,

01:13:01.420 --> 01:13:02.260
<v Georg>viel Content

01:13:02.260 --> 01:13:04.680
<v Georg>über solche Wege produziert werden.

01:13:07.400 --> 01:13:07.720
<v Georg>Dann,

01:13:07.720 --> 01:13:09.800
<v Georg>ein anderes großes Thema ist,

01:13:09.800 --> 01:13:12.480
<v Georg>natürlich Musik.

01:13:12.480 --> 01:13:15.020
<v Georg>Da gibt es relativ wenig im Moment.

01:13:15.020 --> 01:13:16.380
<v Georg>Also, im Moment stürzen sich alle

01:13:16.380 --> 01:13:18.100
<v Georg>auf die Sprachanwendungen.

01:13:18.100 --> 01:13:20.720
<v Georg>Bei Musik gibt es echt sehr wenig.

01:13:20.720 --> 01:13:22.400
<v Georg>Was es gibt,

01:13:22.400 --> 01:13:22.900
<v Georg>sind so,

01:13:22.900 --> 01:13:25.000
<v Georg>so Stem Separation Musikmodelle,

01:13:25.000 --> 01:13:25.340
<v Georg>also,

01:13:25.340 --> 01:13:27.200
<v Georg>wo man verschiedene Instrumente

01:13:27.200 --> 01:13:28.740
<v Georg>von einem Mix extrahiert.

01:13:28.740 --> 01:13:30.600
<v Georg>Funktioniert meistens auch nur gut,

01:13:30.600 --> 01:13:30.940
<v Georg>wenn man,

01:13:30.940 --> 01:13:33.100
<v Georg>wenn man so vier Instrumente extrahiert,

01:13:33.100 --> 01:13:34.440
<v Georg>oder vielleicht ein bisschen mehr,

01:13:34.440 --> 01:13:35.000
<v Georg>also Bass,

01:13:35.000 --> 01:13:35.740
<v Georg>Schlagzeug,

01:13:35.740 --> 01:13:36.920
<v Georg>Gesang,

01:13:37.400 --> 01:13:39.120
<v Georg>Klavier oder Gitarre halt.

01:13:39.120 --> 01:13:40.540
<v Georg>Das sind die klassischen,

01:13:40.540 --> 01:13:42.760
<v Georg>klassischen Setups.

01:13:42.760 --> 01:13:44.560
<v Georg>Dann auch,

01:13:44.560 --> 01:13:45.720
<v Georg>gibt es noch sehr wenig

01:13:45.720 --> 01:13:47.720
<v Georg>in der Richtung von Musik Restoration

01:13:47.720 --> 01:13:49.640
<v Georg>oder Musikaufbereitung.

01:13:49.640 --> 01:13:49.820
<v Georg>Ich meine,

01:13:49.820 --> 01:13:51.440
<v Georg>es gibt so Online Mastering Services

01:13:51.440 --> 01:13:52.160
<v Georg>schon sehr lang.

01:13:52.160 --> 01:13:52.580
<v Georg>Einige,

01:13:52.580 --> 01:13:54.000
<v Georg>die machen natürlich ein bisschen was

01:13:54.000 --> 01:13:54.780
<v Georg>in diese Richtung.

01:13:54.780 --> 01:13:55.720
<v Georg>Aber,

01:13:55.720 --> 01:13:57.360
<v Georg>jetzt so spezialisiertere Sachen,

01:13:57.360 --> 01:13:58.720
<v Georg>also im Prinzip das,

01:13:58.720 --> 01:14:00.300
<v Georg>was wir da bei Afonik machen,

01:14:00.300 --> 01:14:02.340
<v Georg>wirklich auf Musik umgelegt,

01:14:02.340 --> 01:14:04.740
<v Georg>gibt es eigentlich noch nicht so wirklich.

01:14:04.740 --> 01:14:06.080
<v Georg>Vielleicht gehen wir auch

01:14:06.080 --> 01:14:07.060
<v Georg>mal ein bisschen mehr in die Richtung.

01:14:07.060 --> 01:14:07.380
<v Georg>Mal schauen,

01:14:07.380 --> 01:14:11.460
<v Georg>dann bei Musik,

01:14:11.460 --> 01:14:13.240
<v Georg>was auch komisch ist,

01:14:13.240 --> 01:14:15.540
<v Georg>was es nicht so wirklich noch gibt,

01:14:15.540 --> 01:14:18.160
<v Georg>ist wiederum bei Sprache,

01:14:18.160 --> 01:14:19.440
<v Georg>ist ja Transkription natürlich

01:14:19.440 --> 01:14:20.700
<v Georg>das heiße Thema.

01:14:20.700 --> 01:14:22.500
<v Georg>Es ist jetzt sehr viel weitergegangen

01:14:22.500 --> 01:14:23.440
<v Georg>in den letzten Jahren.

01:14:23.440 --> 01:14:25.340
<v Georg>Analog dazu für Musik,

01:14:25.340 --> 01:14:27.440
<v Georg>Transkription gibt es wiederum

01:14:27.440 --> 01:14:28.500
<v Georg>sehr wenig.

01:14:28.500 --> 01:14:30.820
<v Georg>Also Noten erzeugen.

01:14:30.820 --> 01:14:31.460
<v Georg>Genau.

01:14:31.460 --> 01:14:34.140
<v Jochen>Macht ja nicht einer,

01:14:34.140 --> 01:14:37.360
<v Jochen>der ursprünglich

01:14:37.360 --> 01:14:39.060
<v Jochen>Entwickler von Django.

01:14:39.060 --> 01:14:39.340
<v Jochen>Der Jacob.

01:14:39.340 --> 01:14:40.540
<v Jochen>Nee, nee,

01:14:40.540 --> 01:14:42.600
<v Jochen>der Adrian Holowaty.

01:14:42.600 --> 01:14:43.880
<v Jochen>Ah, der Adrian.

01:14:43.880 --> 01:14:46.200
<v Jochen>Der macht OCR, glaube ich,

01:14:46.200 --> 01:14:47.100
<v Jochen>für Noten.

01:14:47.100 --> 01:14:49.540
<v Georg>Ja, OCR ist wieder ein anderes Thema.

01:14:49.540 --> 01:14:50.340
<v Georg>Ist nochmal ein anderes Thema,

01:14:50.340 --> 01:14:53.020
<v Jochen>aber möglicherweise auch Noten aus Musik.

01:14:53.020 --> 01:14:53.720
<v Jochen>Das weiß ich aber gar nicht,

01:14:53.720 --> 01:14:54.500
<v Jochen>ob sie das auch machen.

01:14:54.500 --> 01:14:55.340
<v Jochen>Ja.

01:14:55.340 --> 01:14:56.320
<v Jochen>Ich glaube nicht.

01:14:56.320 --> 01:14:57.640
<v Jochen>Ich glaube, das ist nur OCR.

01:14:57.640 --> 01:14:58.920
<v Jochen>Ah, okay.

01:14:58.920 --> 01:15:01.620
<v Jochen>Ja, dann habe ich es nur so quer gelesen,

01:15:01.620 --> 01:15:02.060
<v Jochen>aber ich glaube,

01:15:02.060 --> 01:15:02.980
<v Jochen>es ist hauptsächlich OCR.

01:15:02.980 --> 01:15:05.240
<v Jochen>Also ihr habt es jetzt

01:15:05.240 --> 01:15:06.300
<v Jochen>wieder mal getestet,

01:15:06.300 --> 01:15:06.580
<v Jochen>weil,

01:15:06.580 --> 01:15:07.020
<v Jochen>ich glaube,

01:15:07.360 --> 01:15:07.820
<v Jochen>einfach nur

01:15:07.820 --> 01:15:09.800
<v Georg>Band, Privat und so weiter

01:15:09.800 --> 01:15:10.280
<v Georg>habe ich gedacht,

01:15:10.280 --> 01:15:10.940
<v Georg>mal ein bisschen was

01:15:10.940 --> 01:15:11.820
<v Georg>transkribieren lassen,

01:15:11.820 --> 01:15:12.920
<v Georg>aber

01:15:12.920 --> 01:15:14.060
<v Georg>da habe ich irgendwie

01:15:14.060 --> 01:15:14.960
<v Georg>nichts Gescheites gefunden.

01:15:14.960 --> 01:15:16.700
<v Georg>Obwohl es ja ähnliche

01:15:16.700 --> 01:15:17.520
<v Georg>Techniken gibt.

01:15:17.520 --> 01:15:18.660
<v Georg>Packt der Jochen diesen Link

01:15:18.660 --> 01:15:19.360
<v Georg>in die Shownotes?

01:15:19.360 --> 01:15:19.880
<v Georg>Ja.

01:15:19.880 --> 01:15:20.940
<v Georg>Ja, das macht er sowieso.

01:15:20.940 --> 01:15:22.080
<v Georg>Ja.

01:15:22.080 --> 01:15:24.120
<v Georg>Ja, ich meine,

01:15:24.120 --> 01:15:25.420
<v Georg>genau,

01:15:25.420 --> 01:15:26.620
<v Georg>ich brauche mir ja nur

01:15:26.620 --> 01:15:27.720
<v Georg>irgendwie

01:15:27.720 --> 01:15:29.060
<v Georg>Eingabe, Ausgabe

01:15:29.060 --> 01:15:29.900
<v Georg>und ein bisschen GPU.

01:15:29.900 --> 01:15:30.780
<v Georg>Dann kann das

01:15:30.780 --> 01:15:31.620
<v Georg>Jochen,

01:15:31.620 --> 01:15:32.860
<v Georg>kann das sein?

01:15:32.860 --> 01:15:35.760
<v Georg>Ja.

01:15:35.760 --> 01:15:36.880
<v Georg>Der Schwergewichtige ist nur,

01:15:36.880 --> 01:15:37.340
<v Georg>was du da gesagt hast.

01:15:37.340 --> 01:15:38.080
<v Georg>Was du gerade gesagt hast.

01:15:38.080 --> 01:15:42.160
<v Georg>Und Noten mit Aufnahmen dazu

01:15:42.160 --> 01:15:43.540
<v Georg>sollte es eigentlich auch geben.

01:15:43.540 --> 01:15:44.500
<v Georg>Sollte es auch eine Menge geben, ja.

01:15:44.500 --> 01:15:46.000
<v Georg>Aber ja.

01:15:46.000 --> 01:15:47.320
<v Georg>Ja.

01:15:47.320 --> 01:15:48.860
<v Georg>Insofern.

01:15:48.860 --> 01:15:49.660
<v Georg>Ja.

01:15:49.660 --> 01:15:50.400
<v Georg>Spannend.

01:15:50.400 --> 01:15:51.640
<v Georg>Kann der ein neues Projekt machen.

01:15:51.640 --> 01:15:55.620
<v Dominik>Herzlichen Dank,

01:15:55.620 --> 01:15:56.320
<v Dominik>lieber Georg.

01:15:56.320 --> 01:15:57.200
<v Dominik>Ja, ich weiß nicht,

01:15:57.200 --> 01:15:57.900
<v Dominik>wollten wir noch irgendwie

01:15:57.900 --> 01:15:58.720
<v Dominik>was picken oder so?

01:15:58.720 --> 01:15:59.940
<v Dominik>Oder sparen wir uns das diesmal?

01:15:59.940 --> 01:16:01.800
<v Dominik>Wir sparen uns das diesmal.

01:16:01.800 --> 01:16:02.400
<v Dominik>Wir sind eh schon spät.

01:16:02.400 --> 01:16:02.880
<v Dominik>Genau.

01:16:02.880 --> 01:16:03.740
<v Dominik>Ach doch, nee,

01:16:03.740 --> 01:16:04.440
<v Dominik>ich mache noch ganz kurz.

01:16:04.440 --> 01:16:05.500
<v Dominik>Ich habe gesehen,

01:16:05.500 --> 01:16:06.580
<v Dominik>es gibt das Update von,

01:16:06.580 --> 01:16:06.900
<v Dominik>von,

01:16:07.340 --> 01:16:07.660
<v Dominik>ähm,

01:16:07.660 --> 01:16:08.080
<v Dominik>Django,

01:16:08.080 --> 01:16:08.900
<v Dominik>äh,

01:16:08.900 --> 01:16:09.360
<v Dominik>irgendwie,

01:16:09.360 --> 01:16:11.060
<v Jochen>Boost Your Django Developer Experience

01:16:11.060 --> 01:16:11.940
<v Jochen>von Adam Johnson.

01:16:11.940 --> 01:16:13.760
<v Jochen>Die E-Mail habe ich auch gekriegt.

01:16:13.760 --> 01:16:14.440
<v Jochen>Ja, ja, genau.

01:16:14.440 --> 01:16:15.120
<v Jochen>Und jetzt,

01:16:15.120 --> 01:16:16.000
<v Jochen>wenn man sich,

01:16:16.000 --> 01:16:16.400
<v Jochen>äh,

01:16:16.400 --> 01:16:17.600
<v Jochen>quasi da denkt,

01:16:17.600 --> 01:16:18.220
<v Jochen>äh,

01:16:18.220 --> 01:16:18.700
<v Jochen>irgendwie,

01:16:18.700 --> 01:16:19.600
<v Jochen>haben wir vielleicht mal

01:16:19.600 --> 01:16:20.280
<v Jochen>eine kurze Zeit nochmal,

01:16:20.280 --> 01:16:20.960
<v Jochen>das lohnt sich,

01:16:20.960 --> 01:16:22.000
<v Jochen>weil da ist doch einiges

01:16:22.000 --> 01:16:22.480
<v Jochen>dazugekommen.

01:16:22.480 --> 01:16:23.420
<v Jochen>Also es war ein großes Update.

01:16:23.420 --> 01:16:25.020
<v Jochen>Da ist jetzt auch so viel

01:16:25.020 --> 01:16:26.480
<v Jochen>Debugging drin und so.

01:16:26.480 --> 01:16:27.240
<v Jochen>Und, ähm,

01:16:27.240 --> 01:16:27.420
<v Jochen>ja,

01:16:27.420 --> 01:16:28.420
<v Jochen>das Buch fand ich,

01:16:28.420 --> 01:16:28.940
<v Jochen>ja,

01:16:28.940 --> 01:16:30.060
<v Jochen>hilft auch.

01:16:30.060 --> 01:16:31.160
<v Jochen>Und der verkauft auch gerade,

01:16:31.160 --> 01:16:31.720
<v Jochen>der macht gerade,

01:16:31.720 --> 01:16:33.620
<v Jochen>gibt es das Sonderangebot noch,

01:16:33.620 --> 01:16:34.480
<v Jochen>wo er irgendwie drei

01:16:34.480 --> 01:16:36.580
<v Jochen>solche Pakete zusammen hat?

01:16:37.320 --> 01:16:37.440
<v Jochen>Ja.

01:16:37.440 --> 01:16:38.460
<v Jochen>Stand in dieser E-Mail drin.

01:16:38.460 --> 01:16:39.020
<v Jochen>Keine Ahnung,

01:16:39.020 --> 01:16:40.440
<v Jochen>aber wenn man die Episode

01:16:40.440 --> 01:16:41.220
<v Jochen>im halben Jahr hört,

01:16:41.220 --> 01:16:42.500
<v Jochen>dann ist es wahrscheinlich nicht mehr.

01:16:42.500 --> 01:16:44.000
<v Jochen>Ja, gut.

01:16:44.000 --> 01:16:44.700
<v Jochen>Wenn,

01:16:44.700 --> 01:16:45.460
<v Jochen>wenn es das noch,

01:16:45.460 --> 01:16:46.780
<v Jochen>das jetzt für die schnellen Hörer,

01:16:46.780 --> 01:16:47.600
<v Jochen>das ist jetzt ein Anreiz,

01:16:47.600 --> 01:16:49.260
<v Johannes>unsere Episoden immer sofort zu hören.

01:16:49.260 --> 01:16:51.040
<v Johannes>Immer sofort.

01:16:51.040 --> 01:16:54.860
<v Johannes>Wir werden diesen Link finden,

01:16:54.860 --> 01:16:55.740
<v Johannes>sofern es ihn noch gibt.

01:16:55.740 --> 01:16:56.560
<v Johannes>Ja,

01:16:56.560 --> 01:16:57.160
<v Johannes>vielen Dank Georg

01:16:57.160 --> 01:16:58.240
<v Johannes>für deine Einblicke

01:16:58.240 --> 01:16:58.960
<v Johannes>in Auphonic.

01:16:58.960 --> 01:16:59.320
<v Johannes>Ja,

01:16:59.320 --> 01:16:59.960
<v Johannes>war großartig.

01:16:59.960 --> 01:17:00.580
<v Johannes>Vielen Dank, Georg.

01:17:00.580 --> 01:17:02.080
<v Georg>Vielen Dank für die Einladung, ja.

01:17:02.080 --> 01:17:03.660
<v Georg>Alles klar.

01:17:03.660 --> 01:17:04.520
<v Georg>Bleibt uns gewogen.

01:17:04.520 --> 01:17:05.980
<v Georg>Hallo at peisenpodcast.de

01:17:05.980 --> 01:17:06.640
<v Georg>für alles Feedback

01:17:06.640 --> 01:17:07.260
<v Georg>und kommt,

01:17:07.300 --> 01:17:07.900
<v Georg>zu unserem Treffen.

01:17:07.900 --> 01:17:08.280
<v Georg>Ja,

01:17:08.280 --> 01:17:09.720
<v Georg>wo wir noch ein bisschen rausfinden,

01:17:09.720 --> 01:17:10.620
<v Georg>wann und wo wir das machen,

01:17:10.620 --> 01:17:11.440
<v Georg>aber das machen wir dann.

01:17:11.440 --> 01:17:11.580
<v Georg>Nein,

01:17:11.580 --> 01:17:13.140
<v Dominik>es bleibt hier bei uns im Rheinland.

01:17:13.140 --> 01:17:13.660
<v Dominik>Tut mir leid,

01:17:13.660 --> 01:17:14.840
<v Dominik>die wollen uns anreisen.

01:17:14.840 --> 01:17:17.280
<v Dominik>Eine gute Gelegenheit,

01:17:17.280 --> 01:17:18.680
<v Dominik>deine alte Heimat kennenzulernen.

01:17:18.680 --> 01:17:20.780
<v Dominik>Aufruf an alle Hörer,

01:17:20.780 --> 01:17:22.720
<v Johannes>jetzt sofort abstimmen für Stuttgart.

01:17:22.720 --> 01:17:22.860
<v Johannes>Ja,

01:17:22.860 --> 01:17:24.860
<v Dominik>ihr könnt eine Mitfahrgelegenheit

01:17:24.860 --> 01:17:25.860
<v Dominik>und eine Fahrgemeinschaft

01:17:25.860 --> 01:17:26.980
<v Dominik>für den Gras anbieten.

01:17:26.980 --> 01:17:27.920
<v Dominik>Ja,

01:17:27.920 --> 01:17:29.460
<v Dominik>okay.

01:17:29.460 --> 01:17:30.440
<v Dominik>Dann kommen wir auch direkt

01:17:30.440 --> 01:17:31.140
<v Dominik>an die Adria.

01:17:31.140 --> 01:17:31.600
<v Dominik>Na gut,

01:17:31.600 --> 01:17:33.520
<v Dominik>viel Spaß,

01:17:33.520 --> 01:17:34.000
<v Dominik>hört uns,

01:17:34.000 --> 01:17:34.600
<v Dominik>bis bald.

01:17:34.600 --> 01:17:35.140
<v Dominik>Tschüss.

01:17:35.140 --> 01:17:35.340
<v Dominik>Ciao.

01:17:35.340 --> 01:17:36.140
<v Dominik>Tschüss.
