Да. Всем привет. Мы на канале To the Moon. Технологические новости, инсайты и скримневой долины по всему миру. И хочется стартануть. Сегодня у нас, мне кажется, очень интересная интересная тема сегодня и про агентов, и про голос. Какие-то разные дополнительные вещи расскажем. Э, очень важная история. В этом году на неё делают ставки. Вот это по-настоящему технология будущего. Это Технология, когда в реальном времени вы разговариваете голосом, и с вами разговаривает искусственный интеллект голосом. Это голосовой собеседник. Он слушает и говорит одновременно, может перебивать. Фуплекс, потому что они выпустили Personal Plex - это это голос в голос по-английски speech to
speech, но полный дуплекс, да, и модель, получается, слушает и говорит одновременно, что там есть такая вкладка, называется sources. Вы грузите Те файлы, с которыми вы постоянно работаете. И вот эти источники этого проекта, они являются основными для получения информации. То есть не надо тебе каждый раз там указывать какой-то файл грузить или грузить из драйвы его. А хочется стартануть с голосом. А очень важная история. В этом году на неё делают ставки, э, мне кажется, практически все компании и все операторы про это про это постоянно говорят. Мы здесь неоднократно упоминали различные Потенциальные устройства, которые могут быть сделаны. И
в прошлом году, если помните, э такое первое устройство было, это Limitless. Такой кулончик здесь вешался, а который что-то распознавал связно с А >> регулярно, >> да, и стелся регулярно. Вот. Ну и потом так так так и умер, я на него так и забил. А компания Мета купила их там за несколько миллиардов долларов. И, по-моему, они тоже забили на этот Кулончик. Значит, но суть в чём? что всё же технология, которая требует, а э сложнейшей работы и а вот это по-настоящему технология будущего- это технология, когда в реальном времени вы разговариваете голосом, и с вами разговаривает искусственный интеллект
голосом, да? И в частности, например, сейчас было небольшое обновление у Open AI. У них есть модель, называется Real Real Time. И вот это Open Eye Real Time - это, а, живое голосовое общение, да? То есть вы, а, на аудио вход дали, аудиовыход получили. Это, то есть, для голосовых агентов, кол-центров, разговорных ботов и чего угодно. Я хочется небольшой блок про эту вставить сегодня. Ну, чуть детальнее, а, показать про рассказать про голос. И мы дальше перейдём к новой фишке, которая появилась у Open AI и которая нигде на самом деле не описывается не видна, кроме там маленькая, мне
кажется, страничка Хелпа. И я бы её даже бы не заметил, если бы мне в приложении на Маке не подсветилась она. Я бы её не заметил. Ильнар, она, кстати, появилась у тебя этот запись появилась. >> Никогда не пользовался. Интересно послушать. >> У тебя вот она у тебя появилась? >> И у меня, по-моему, её нету. А вот вот значит суть в чём? Вначале хочется рассказать про голос голос и обсудим. Обсудим. Значит, вот смотрите, о Ивидия, Я поясню чуть-чуть на Ивия. Это очень интересная тема. Иди выпустила буквально недавно такую историю, которая называется Personal Plex. Все как бы говорят,
что Nvidia - это только оборудование, но важно понимать, что Nvidia в целом, это я обсуждал и с сотрудником NVIDIA много раз, они заинтересованы в том, чтобы становиться некоторым шлюзом и и в том числе, конечно же, давать очень крутое программное обеспечение, да, на Уровне прямо и компьютеров, и на уровне чипов. Различное крутое программное обеспечение напрямую интегрированное в их оборудование. Назовём это словом оборудование, да, чтобы не чтобы чуть понятнее было. Суть в том, что они выпустили personal - это голос в голос. По английски speech to speech, а полный дуплекс, да, и модель получается слушает и говорит одновременно.
Вот важная история - это слушает и говорит одновременно. Смотрите, Стандартные модели, они как работают. Вот есть стандартная система моделей. И почему они не нравятся? Обычно вот, например, в чате GPT, если нажать там кнопочку голосового ассистента, как она работает? Ты туда говоришь, она получает твои данные, транскрибирует их, передаёт их модель для обработки, обрабатывает, дальше создают голос, передают назад тебе голос и ещё перебивает всё время. >> Есть такая, есть такая история, которая называется Моши. Это QTI, это французская компания. Суть в чём здесь? Что, если я не ошибаюсь, она французская суть, хотя название просто японское, поэтому меня немножко
смущает. Суть суть в чём? Что а Моши по сути, что они сделали? Они сделали историю, как раз-таки, Таня, вот то, что ты сейчас говоришь, перебивает. Она как они как раз-таки сделали историю того, что аа Моша - это голосовой искусственный интеллект, который разговаривает, ну, условно, как по Телефону, а не как по рации. То есть, если первая тема - это была как по рации, когда текст там перевели, распознали, то здесь всё же реально телефон. И суть Моши была в том, что она может говорить угу, перебивать, сделать паузы, говорить ага и так далее. Это и называется полный дуплекс.
>> То есть добавили слов паразитов. Да, да, да. На самом деле, на самом деле, если изучить минусы, то они описывают в Моше и везде, что по сути оно Угу используют Часто там, где это не надо. То есть представ, ты разговариваешь, тебе ога и ты это я знае вспомнил фильм был, как это он назывался, где девушка кадрила там дорогих мужчин, богатых мужчин, и она в ресторан пришла, она представляла, что она русская, он её привёл в русский ресторан и ей официант понял, что она не русская. И на русском мне начинает говорить, она такая: "Да, да". И и
вот это примерно та же история не понимаешь, ты просто вставляешь: "Да, угу". Или Агаага. А, ну вот это, кстати, open source лаборатория, вот эта Qтай, то, что вот я сказал французская в Париже. Они впервые вообще это создали. Они это создали в сентябре двадцать четвёртого года. И на базе них Nvidia это построила, потому что это open source open sourceная модель. Но я вам расскажу чуть про Nvidо, потому что Nvidia доработала, доработала эту тему, сделала её более серьёзной, чтобы понять вообще, как она работает. Ну, как я уже сказал, То есть у них нету вот этого каскада. И
если здесь за, ну, что тебя распознали, потом в модель, потом сгенерировали. И у меня здесь такой, подождите, ну, как это нет каскада, а как это можно? Она как это что такое? Неужели она же голос всё равно как-то должна понимать? Суть Моши в чём? Что она делит весь разговор на микротокен, на микропорции и эти микропорции сразу же распознаёт. То есть пока ты договорил, до того, как договорил, уже генерирует Тебе обратно ответ. и она вот постоянно этот процесс находится. То есть это позволяет находиться в реальном живом общении, не звать бом дело. Ну, мы с вами прекрасно понимаем,
да, что если брать только маленькие кусочки, особенно в лексике некоторых людей, в частности, может быть, моей, это будет очень тяжело сформулировать и сгенерировать ответ, потому что ты не значишь, не знаешь, а к чему я вообще веду, да, и к чему я хочу привести. Но эта задача Мож она, но Очень известная тема. И вот open AI, real time, всё же это история. базово, ну, такая стабильная, стандартная система. Есть Gemini Life API, очень стандартная, стабильная система, ну, такая из известных, по крайней мере, которые самые, да, известные в мире, которые используются. И вот вот Mши, Open A, Real
Time, Gemini, Gemini Life. Ну, вообще, кстати, хочется сказать, что Google они, а, вместе с OpenI на передовой в качестве Генерации аудио распознавания аудио. То есть мы знаем, что у Google, у Open есть Илинар выскочил из головы. Это Виспер, да, пора, кстати, всё время пользуюсь. Классная штука, >> конечно, конечно, это суперсистема, но важно, что у Гугла, у них у Виспера раньше не было диаризации. Да, правильное слово я не пропустил никаких букв. А >> что это? А о это когда настрое три человека Разговаривает и есть одна аудиозапись и система автоматически делит между людьми. >> Но то, что
я сейчас вижу, >> кто сказал, да, делит, >> да, кто что сказал, то есть на спикеров делит. То, что я сейчас вижу, это есть вот у у Гугла, у него у него обширная линейка работы с аудио, очень много разных моделей, просто невероятное количество языков. Мне кажется, они поболее топовее, чем Open AI в части, Наверное, представления интерфейса для людей, да, хотя Open сейчас всё это тоже доступно. Сейчас вот чуть больше вам про технологии ещё раз с точки зрения работы, а вот этой системы, которая NVIDIA сделана. То есть в чём в чём у них история, ещё раз.
Значит, то есть это голосовой собеседник, он слушает и говорит одновременно, может перебивать, да? Значит, ещё раз full дупleкс. Просто это всем надо заполнить, потому что мы это можем начать встречать. Очень много Слишком много специализированной лексики идёт. Значит, он работает не сырой аудиоволной, а работает с аудиотокенами, да? То есть мы говорили, то есть он аудиотокены полностью есть, и звук превращается в, вот как описывают, звук превращается в компактные токены и нейрокодеком, и модель параллельно понимает вашу речь, генерирует текст ответа и сразу генерирует ответ аудио. То есть три потока одновременно. Значит, в чём есть фишка у Personal Plex
Nvidia? Это мне про неё рассказал там мой партнёр один в технологическом рынке. Как раз это, мне кажется, хороший пример. Я не думаю, что Nvidia это до конца реализовала, в отличие, ну, как массовый продукт. Это скорее такой researchч, но всё же это хорошая технология вперёд. То есть в начале есть текстовая часть, это роль и персона. То есть how are you today? Вы когда создаёте это, вы можете, Кстати, развернуть эту модель у себя от Nvidia. Суть в чём, что вы пишете, кто он и какие правила. Ну, то есть какая роль вообще у этой истории. Например, там вы
говорите модели, что там ты банковский оператор, проверь личность, будь симпатичным, там не раскрывай лишнее, например, да? И есть голосовая часть. Вы даёте короткий пример того, как должен звучать голос. Вы, например, свой голос даёте, ну или какой-то другой голос. Понятно, что сейчас в мире есть Очень много ограничений, что вы не можете чужие голоса использовать. Та-та-та-та-тата, ну, очень много всего. Значит, а на практике, как это используется? То есть на как как дальше это идёт? То есть вы, а, базово всем, кто хочет, вы в любом случае запустили сервис, развернули там у себя полностью эту модель, выбрали вот этот
голос, ввели текст полностью роли, и у вас начинает система работать, потому что у Моши, у неё нету вот этих Персонализированных ну вот этого интерфейса, да, некоторого супер вот этих персонализированных настроек. Вам надо с этим, а, бороться и распознавать. Прикольная система, которая есть тоже и у Nvidia, по-моему, може тоже есть кусок, что вы можете делать оффлайн-режим. И мне, кстати, это очень нравится, как в части человека, который очень много всего автоматизировал. И это когда вы можете сравнить разные промты и роли. То есть Вы можете на входе закинуть этой модели огромное количество различных аудио и в рамках разговора
и посмотреть дальше, как она тоже будет реагировать. То есть как оценивать, насколько эта система держит роль, и собирать условно демопримера без без живого разговора, да? И получается, что типовая схема, ещё раз, то есть это может быть в кол-центре, в приложении, в игре, где угодно. То есть есть клиент, ваш клиент через телефон или через веб стримит Аудио ваш сервер, personal PRX возвращает поток аудиовета почти сразу, вы добавляете бизнес-логику. Вот. Но важная история, что есть огромное количество различных минусов, которые, а, которые присутствуют. И есть, во-первых, языковая ограниченность у многих моделей. И, в частности, например, у Инвизия, они
ограничены английским языком. А в любом случае, ну, нужно крутое железо для того, чтобы в Кавычках жирное железо, да, чтобы это вообще всё крутить и чтобы это всё по-настоящему круто было, потому что иначе там не будет уж прямо реа. Да. И помните, кстати, в прошлый раз я говорил о том, что, возможно, появится чат GPT Pro, который будет отвечать мгновенно, а не а не в течение часа. То есть вот мы как раз-таки здесь видим разницу. Это представляете, когда у вас вот эта обработка мгновенная очень сложных вещей. Сейчас же в чём проблема, что Большинство запросов у меня в
любом случае они долгие. И по сути обычное общение, оно во что будет. Александр, мы ваши данные сохранили, значит мы вам чуть позже ответим. Мы их сохранили, чуть позже ответим. И по идее >> оставайтесь на линии. Да. >> Да. Кто-то должен придумать, >> да, кто-то должен придумать этот интерфейс. Кстати, сейчас прошла новость, что Open AI нанимает, а, целую Команду людей для создания железа. Там чуть ли не чек 200 они хотят посадить отдельно. И что они делают колонку, что они делают часы, что они делают очки, что они даже делают умную лампу. Да. То есть >> умный дом
кто-нибудь сделает когда-нибудь? Ну, я думаю, так, что настоящий умный дом, конечно, >> я думаю, что настоящий умный дом, конечно, мы увидим, когда вот как Раз-таки отойдут технологии здесь. То есть, когда здесь технологии дойдут, тогда появится вот этот умный дом, который мы там в кино где-то видим, когда кто-то перемещается, у тебя есть сопровождающий звук, который понимает все детали, сможет со всем связаться и так далее, да. А что, что хочется ещё сказать, что во всех этих моделях, конечно, есть проблема правил разговора, да, и вот с точки зрения вот этого fullпleк система, которая сразу Отвечает, а на самом
деле у неё сложная динамика, то есть она, как мы с самого начала говорили, она может перебивать и говорить угу там, где не надо, да? И все бенчмарки, в том числе, это признают. И они подчёркивают, что всё же это отличается от, ну, серьёзных моделей, которая всё получила, жирно там назад, всё обработала с точки зрения серьёзного, серьёзной модели с большим количеством, а, параметров и отдала назад. Вот. Значит, ну, и там есть Всякие безопасности, ограничения и всё остальное. Вот. Мы хотелось эту тему сейчас поднять, потому что, мне кажется, она очень интересная для людей в части понимания вообще работы
этих систем и того, что там будет выявляться. Может быть, кто-то хочет в своих компаниях где-то применять. Если вы применяете, чтобы вы понимали, какие в реальности есть ограничения, чтобы вы всё же поняли, да, что если модель по-настоящему всё всё не забрала, не Обработала, человек с другой стороны понимает, что с ним общается гарантированно робот. И плюс вы не знаете, может быть, она будет отвечать очень долго, как колонка Алиса, да, которой я яйца варю и говорю ей: "Поставь таймер там на 6 минут". А она такая: "А, хорошо, таймер поставлен". Значит, и ты и ты а такой: "А, о'кей".
Вот чтобы таких ситуаций, то есть там явно вот у них явно не фулдуплекс, да? Ну, явно не Фулдуплекс, потому что скорее всего вот этот вопрос с такой историей, он должен решаться быстро. Плюс на так, на таких системах вопрос, какая модель находится на самой колонке? Это вот мы с Максом Григорьевым, кстати, в эту среду, скорее всего, ждите. в эту среду, скорее всего, ну, там 90%. Будет выпуск про AI Safety. И вот Макс мне как раз буквально там недавно с ним перечай, он говорил о том, что современные камеры, самые простые, маленькие, позволяют распозна распознают Лица прямо на
камере, то есть не передают данные на сервер. То есть стоит микрочип, он сразу же распознал это полностью лицо, там модель всё распознала, а приложила это в простую текстовую строчку, ну, условно, условно текст, передала её дальше в базу, которая уже всё это сравнила, то есть очень быстро. Поэтому сравнение всех лиц, мы там с ним обсуждали разные китайские системы, происходит, ну, мгновенное, да, просто эти Миллионные сравнения, десятка миллионные сравнения происходят многновенно. Вот здесь с точки зрения аудио вопрос тоже вот этой, мы сейчас говорили про то, что модель решает, а вопрос, когда будет оборудование или колонка, что будет
на колонке происходить, да? Или будет всё же контакт с интернетом, или колонка сможет какой-то объём забирать на себя, что очень важно. Тогда у тебя получается качественный ответ, и ты стандартная команда очень быстро делаешь. А >> то, что сейчас рассказываешь, очень похоже на а-э мультимодальные системы. Давайте немножко сейчас я зайду издалека. А есть такой анекдот, считается обидным для математиков. На самом деле он не обидный совсем. А представь, что вам надо вскипятить чайник чая, и он пустой. И вот у вас есть инструкция налить воды, поставить чайник на плиту, зажечь плиту, дождаться, пока закипит. И математики, и физики
решают одинаково. А дальше вот Часть, в которой над математиками смеются. А теперь представьте, что у вас есть чайник, но вода уже внутри налита. Что делают физики? Берут чайник, ставят на плиту, зажигают воду и дожидаются. Вроде как на один шаг меньше совершают. А что делают математики? Выливают воду из чайника и сводят задачку уже решённой. Типа смотри решение предыдущей задачи. Так вот, когда мы говорим про мультимодальные системы и про тот подход, который до этого говорили, про Использование виспра и распознавание, как это раньше работало, мы берём, соответственно, аудиодорожку. Эту аудиодорожку распознаём, переводим, получается, из аудио в текст, потом
закидываем в обычную нашу лэмку. Эта лэмка генерит нам какой-то ответ, а потом мы, соответственно, этот ответ озвучиваем с помощью следующей модели. Да, по сути, мы м вместо того, чтобы налаживать прямое общение, сводим задачу к уже предыдущей к уже решённой, как вот Выливая воду из чайника в том анекдоте. Соответственно, то, о чём, Саш, ты ты рассказываешь, это мультимодальный подход, когда мы не только с текстом можем работать, мы можем работать с другими модальностями. Реализуется очень похоже в том плане, что у нас вот до этого токены - это кусочки текста, а знаки припинания туда же, да, вот любые
символы группируются в токены, и вот моделька умеет, соответственно, эти токены Выкладывать в некотором порядке. Соответственно, если мы хотим, чтобы наша моделька умела работать с изображениями, то нам необходимо не наборы символов, вернее, не только наборы символов в виде токенов кодировать, ну и кусочки, маленькие фрагменты картинок. Тогда моделька сможет картинку представить в виде набора токенов, просто немножко других токенов. То есть есть токены, которые для набора Символов, чтобы у нас там текст получался, есть наборы в виде там кусочек, маленькие кусочки картинки, чтобы можно было их сложить и получить текст. получить картинку, изображение. Соответственно, то же самое можно сделать
и с аудиодорожкой. То есть разложить аудиодорожку, вот, как ты, Саша, говорил, на маленькие кусочки. Эти маленькие кусочки тоже будут токенами. И из них можно будет составлять уже Аудио на вход и аудио на выход. То есть на самом деле сама логика работы модели не изменится. Просто вместо того, чтобы только с текстом работать, ей можно под токены засунуть кусочки изображений, тогда она будет с картинками работать, а можно кусочки аудио, тогда она будет работать с аудио напрямую. И в этом смысле реализован мультимодальный подход, когда мы не переводим в текст, чтобы получить ответ. А какие у этого есть ограничения,
да, и почему вот до Сих пор это работает как по рации? Потому что адекватного ответа от модели нам всё ещё необходимо ждать. И тут ты справедливо замечаешь, что как только появятся модели, которые будут отвечать вот с той скоростью, о которой мы говорили, или даже быстрее, да, там по 1.000 токенов в секунду будут генерить, тогда модели в течение секунды будут успевать об обдумать всё, что надо, понять, что мы говорим, что мы хотим дальше сказать, и сгенерировать нам Ответ. Соответственно, дальше уже у нас получится полноценное прямое общение. Пока у нас общение происходит так, что вот мы задали
вопрос, моделька это всё переварила, потом дала ответ. адекватного прямого общения, мне кажется, ждать не стоит. Для этого нужно существенное ускорение работы моделей, чтобы был принципиально другой опыт. А помимо этого хочется сказать, что всё-таки технологии очень быстро развиваются, а наши желания и Потребности ещё быстрее. Потому что, если вот представить лет пять назад, что мы можем телефону что-то сказать, а он нам адекватно что-то отвечает, пусть даже в формате рации, всё равно выглядит как магия. Но опять же в течение года-двух, я думаю, что очень сильное развитие в этом направлении будет. Мультимодальные модели повсеместно используются. И вот этот вот
лаг в плане того, что распознать текст на картинке или условным виспем перевести аудио в Текст, потом сгенерировать ответ, потом, соответственно, его озвучить, эта штука уже далеко позади осталась. Да. >> Да. Ну очень интересная история в любом случае для вообще понимания всей этой работы. Понятно, что дальше будет история не просто в том, чтобы аудио понимать, там же есть история в том, чтобы видео понимать, да? И здесь тема в том, дальше будет, что когда с тобой разговаривает колонка с вот как раз-таки история, про которую писали, а сейчас ну Как типа как инсайдерской информации с open AI, что
они делают колонку с камерой. И суть была как раз-таки в том, что когда у тебя есть колонка с камерой, то колонка видит, что происходит. И вот когда она видит, что происходит, она может одновременно тебе и говорит: "Описывая визуал". Но это ещё накладывает ограничение, да? Это не просто уже текст понимать, это тебе надо ещё какой объём видео обрабатывать. Другой аспект, наверное, что вот эта Обработка видео, может быть, она и не занимает в современной реальности какой-то сверх сверхпрямо нагрузку. И, наверное, и скорее всего. Ещё, кстати, тема, что, чтобы тоже всем понять, я всё же говорил про вот
этот realта у PNI, который он выпустил, что, э, с точки зрения в целом деталей получается, что минута вашего голоса примерно стоит в обработке 1,9 центов. Минута голоса модели 7.7 центов. То есть минута в целом, ну, Зависит от того, понятно, кто сколько говорит, там условно 5 центов минута будет. Это понятно, что там есть другая история. Это это если GPT real time полтора, там есть real time mini, там будет дешевле стоить, там минута будет условно полтора цента стоить. А вот, например, в распознавании виспера, то есть можно это делать, во-первых, на своём собственном компьютере, а можно, ну, условно,
а можно мы сейчас про это поговорим, да, когда Open Glow будем Разбирать, а можно это делать онлайн у них, и онлайн у них, у них цена примерно там от трёх до шести. десяток цента, да, от 3 х до 6 цента, да, чтобы вот примерно понять, что и как. Значит, а в любом случае это стоит денег. Вот что хочется сказать, что всё это общение, оно стоит денег. То есть если мы говорим про колонки кругом во всём доме, там и разные телефоны, устройства, и всё везде разговаривает, кто-то за это должен Платить. То есть это достаточно недешёвая история.
В продолжении этого разговора, значит, в Open AI на MacOS появилась, наконец-то функция, но она появилась только на MacOS. Работает ээ как бы, но работает. Что можно сделать, когда вы на сидите и ведёте какое-нибудь совещание, например, в Зуме там или в Google Meet или в Microsoft Teams, ну где вы где вы их ведёте, вы имеете возможность нажать на кнопку этого приложения. Оно запишет полностью всю Запись, заберёт себе аудио, распознает его и выдаст вам тот же самый. как сейчас работает. Сейчас оно, по сути, забирает себе и подаёт вам сразу же саморь на английском языке. Ему нет разницы
о том, что у вас есть установка изначально, например, отвечать вам на французском или на русском или на китайском и так далее, да? А она не выдаёт вам сразу весь диалог. Я вначале подумал, что как будто диалога нет, но потом я попросил создать её скрипт, Полностью весь скрипт мне дать. Она мне легко выкинула полностью весь скрипт, а и он был э по разложены по ролям. Что очень важно, да? То есть эта модель, она сразу же разложила по ролям. Мало того, я был на сложном совещании, на котором присутствовало человек 10, трое молчало, а он мне разложил и
сказал: "Шесть человек полностью выделенных, один человек спорный, потому что он несколько Раз говорил". То есть модель такое даже мне отразила. Что прикольно вообще вот эта модель раскладывания по ролям. Важно понимать, что сегодня много систем очень путается в этой истории, да? И дальше стоит вопрос: а можно ли стекущую даже систему обучить моему голосу, чтобы она понимала, что я вот, например, есть системы там плавают, они там можно обучить или она там понимает, по-моему, кто кто где, какой какой твой голос на самом деле. И здесь история в том, что в Через API вроде как можно обучивать через сейчас
вот в этом Мак приложении, конечно, никаких их настроек нет. явно там появятся настройки, что вы обучите голос, что она будет сохранять разные голоса или это будет опять, как Макс Григорьев говорит, research и м опять эта там кнопка сдохнет где-то среди всех остальных кнопок в Open AI, да, но явно, что видно, что они идут в сторону создания устройства, потому что без этой истории, а, им надо тестировать, да, им Нужен объём распознавания вот этих разных ролей, что вот, например, у меня вопрос вызывал Это мы тут с приятелем сидели в кафе, очень много людей разговаривает, и он достал
на стол положил вот эту записывающее устройство, да? И он у меня там спрашивал, я его по каким-то вопросам консультировал, а я ему говорю: "Слушай, тут люди все вокруг орут. Эта система, она как потом выделит чётко наш разговор?" Она выделила очень чётко, да? И мы знаем с вами, что всё же современные системы, даже вот если чат GPT, запись аудио, я не знаю, вы проверяли, не проверяли, если ты её включаешь, начинаешь ей говорить и люди вокруг что-то разговаривают, она чётко твой голос выделяет сейчас. Я не знаю, поделитесь, зрители, как у вас в других моделях работают и везде,
и как в чате GPT. Я вижу, например, что в чате GPT очень круто работает, потому что у меня рядом >> есть >> нет, у меня рядом орут дети там часто или ещё кто-то. Не, у меня если, например, играет музыка, он начинает вот эти слова записывать, да, или YouTube рядом воспроизводится, он тоже эти слова вставляет. >> Слушай, честно тебе скажу, что музыку вообще он прикольно, конечно, вписывает, да. Я что хочу с музыку он прикольно вписывает, когда просто звукат. Я хочу что сказать, что у меня нет. Вот я очень Много обращаю на это внимание, потому что у
меня очень много наговоро чату GP, и я часто где-то с кем-то и или рядом там каких-то кафе, а я даже буквально на днях нажал специально на стоп, там какая история, то что я пишешь, там же есть эта функция, когда она сразу же транскрибирует. То есть ты не через не через сет делать, не через отпрать. И а если ты нажмёшь на стоп, то оно вначале транскрибирует, ты текст изучишь, если, кстати, кто не знает, потому что многим Это может быть неудобно. Надо на стоп нажать, и ты увидишь всё, что оно транскрибировало. Дальше ты можешь изменить что-то и
отправить. Я вот частенько нажимаю на стоп, потому что я думаю, что все разговаривают вокруг и там будет что-то ещё. Не добавляет. У меня, я не знаю, ещё раз, у меня не добавляет, но мы тут всё чаще общаясь видим, что у каждого свои функции, у каждого какие-то свои тесты, у каждого свои детали. -э кто тестировал этот Софт, кто тестировал эту функциональность среди наших зрителей, я, конечно, лично жду, чтобы такая история появилась на на мобильном телефоне, потому что всё же это другая система. Я, конечно, хотел бы, чтобы она при записи показывала мне, сколько она записала минут, что
она сделала одновременно. По идее, она должна во время разговора это сразу же делать. Всё, по идее, да, к чему мы должны прийти. Она же должна во время Разговора, по идее, я помню, я не помню, у меня там есть одни партнёры, я ему говорил в бизнесе: "В будущем запишите, там прямо мы в спринт записали". Будет система, когда менеджер по продажам разговаривает, во время разговора AI распознаёт сразу же и тут же даёт рекомендации. Тут же, да, даёт рекомендации. По идее, если система сидит на совещании, вот там я записывал совещание, у меня даже одно было, где очень было
много людей по 2 часа. И по Идее почти 2 часа. Оно, кстати, пишет до 2 часов. Ну, в технических настройках написано. Но суть в чём, что по идее в течение двух часов ты хотел бы видеть, что там произошло уже. То есть она должна была всё расписать, разложить, показать, напомнить, что-то спростить, показать какие-то роли, узнать ещё что-то, задать какие-то во. Ну, то есть вот эта система, вот это уже похоже на что-то будущее. Если бы оно так работало, оно так не работает. И, а, Хотя, кстати, интерфейс очень легко сделать. У них сейчас появляется окошко. Вот когда все
потестируете, увидите тоже может у тебя появится, посмотришь, там появляется окошко записи. А по идее они бы могли прямо там раскрыть бы тебе интерфейс. Он очень несложный. То есть они бы могли пакетами как раз-таки вот то, что называется фдупleкс, но там относительно фул dдупleкс, они могли бы там делить по минутам, бить бы, выделять бы речи отдельно и постепенно запускать Этот анализ, анализ, анализ, анализ и начинать себе выдавать. Это выглядит очень круто, да, потому что это вот как- сейчас есть системы, вот Google это делает на своих телефонах, да, когда вот у Макса Григорьева как раз он мне
это показывал, э, ему кто-то звонит, ему Google показывает сразу же. То есть мне Apple тоже делает транскрибацию, а-э, транскрибацию голосового ящика. Ну, когда голосом, причём в Real они делают, да, Apple в realта делают, так, а, а Google, они делают тебе транскрибацию в Real time, а ещё предлагают тебе ответы давать. И получается за тебя аудио даёт ответы, говорит: "Извините, там Александр сейчас занят условно, а вам будет удобно, вам срочно это или не срочно?" Я это пому рассказывал, это очень крутая тема. То есть вообще такие настройки, они очень живые. То есть вот, а если бы в большой
такой системе это было работало, конечно, это бы это становится, ну, по-настоящему, а, По-настоящему серьёзной историей. Очень серьёзной истории, да. Вот с точки зрения интерфейсов, ждём, что появится это на телефоне, да? Иль. Они такую штуку же реализовывали, когда помните, мы где-то полгода назад, по-моему, говорили или там чуть больше, я сейчас путаю, медицинская история в Африке, где для врачей была система со светофором жёлтый красной-зелёный. И в момент консультации врачом а пациента у него выходит: "Всё Идёт в порядке по протоколу и всё нормально. Жёлтенький - это значит, что есть куда обратить внимание". А красники - это значит, условно,
ты не выписал не то лекарство, не задал вопрос, который надо было задать или ещё что-то такое. Просто, возможно, для других юзкейсов они пока, ну, не знаю, нет ресурсов для того, чтобы это разместить. И >> это ресурс, конечно, да. Качество ресурса. Там, скорее всего, была может быть обучена ещё модель локальная, Например, стояла какая-нибудь мини там или что-то ещё, да, вопрос этих голосов, потому что, ну, ты абсолютно, вот это кейс очень живой, то, что ты сейчас привёл как раз-таки не для для себя, даже для самого, с точки зрения бизнеса, да? Ну или вот как любой менеджер по
продажам, ты работаешь, говоришь любой любая сервисная любая сервисная служба, да, по сути у тебя действительно живое общение настоящий человек, но у тебя не просто какие-то рекомендации по приколу, А такая полноценная система. Причём, смотрите, понятно, что уже много такого всего реализовано, как в частности я говорил, там Apple даже тебе делает обычную транскрибацию голосового сообщения. Это, кстати, очень прикольно, потому что в Америке, например, принято оставлять голосовые сообщения, и я часто не поднимаю трубку. Я вижу, как мне наговаривается, наговаривает голосовое сообщение, прямо его читаю параллельно, и у тебя прямо в живом, как будто тебе Человек в реальности пишет,
да? То есть это эти темы они понятно, что многие созданы, но мы сейчас говорим всё же про такой ну широкий диапазон. То есть эта же система, общаясь с нами на совещании, она могла сходить в какое-то хранилище. Сейчас мы, кстати, поговорим про это как раз-таки про апдейт. А, большой апдейт у чата GPT, аа, и неизвестно, когда он появился, но он есть с точки зрения как раз-таки ресурсов определённых, прикрепления ресурсов. Он же мог Сходить, что-то изучить, проверить, вернуться и сказать: "Обратите внимание, этот человек немножко некорректную информацию сказал там или я уже это проверил и изучил". То есть
вот когда сидишь на совечании, кто-то говорит: "Хорошо, проверьте, потом сообщите мне через час эти данные там или завтра". А система сама может сходить, забрать данные, прийти и сказать: "Я данные нашла". Сообщите их прямо сейчас. То есть вот причём сделать это, смотрите, Не по запросу, то есть когда она сама это делает, да, когда она сама чуть-чуть добавляет. Вот. А, в частности, история. А, кстати, хочется сразу же ещё раз всем напомнить, что чат GPT не загружает аудиофайлы до сих пор. То есть он не умеет, он там заблокирован, хотя он умеет это делать. Это причём копеечная история Виспера.
Я не понимаю, почему они это не делают, но они ограничивают, они это не делают. То есть они не позволяют к себе аудиофайлы Брать на вход. То есть они видео возьмут на вход и распознают, разложат и скажут, что у тебя видео происходит, но не аудио. Аудио они делать не будут, да? Значит, а появилась история, а опять же, в частности, она, может быть, у кого-то появилась давно и недавно, но на неё хочется просто её обсудить, потому что мы как-то разговаривали про ноутбук у Гугла. Это чем-то похожая тема, но чуть- другая, да, такая же история есть у а
Geminii, у Open AI, э, В в Enterprise, в корпоративных тарифах похожая чуть-чуть, но тоже чучуть другая. Логика в том, что уча есть проекты, ну, реализованы очень странно, но они есть. И в этих проектах они линейно реализованы, ну, там это как бы не современная архитектура, не современные, не современный XQUI. Но а суть в том, что там есть такая вкладка, называется sources сейчас, да, на русском языке или на у вас, я не знаю, русский интерфейс, У тебя русский, не русский, у тебя этой вкладки нет. >> Источники. Я никогда не пользовался ресурсы. >> Она источники, да, она источники,
да. Ресурсы источники. источники информации. Значит, хочется тоже уделить этой зоне некоторое внимание, потому что она плавно перетекает вот в кейс, который я до этого рассказывал с точки зрения бизнеса. Вот в эти источники, например, Вы грузите те файлы, с которыми вы постоянно работаете. Вот у меня, например, есть отдельные проекты, которые касаются моего, например, создания контента. И я туда могу загрузить, а, не знаю, там 150 видео транскрибаций с ЮтуЮба, там проведённых, не знаю, 100 занятий разных. э массовых, групповых, ещё с какого-то другого ЮТЮба, что загрузить, загрузить свой какой-то контент. Грузить туда можно файлы суммарно можно грузить От
20 до 40 ГБ. Точно никто не знает, сколько. Нигде это не написано. Говорят, что потом просто сработает блокировка и не будет ничего работать. А файлы размером полгигабайта. Важно замечу, что у текстовых файлов тоже, кстати, чарat GPT ломается, отвечает по-разному. Он иногда говорит, что мне удобнее читать текст PDF, иногда удобнее читать Word. Ой, в текст и в ворде. У меня моя редактор присылает: "Надоф". Мне чат GPT сказал. Я говорю: "А мне ча говорит, что надо в тексте и в ворде присылать". Значит, а примерно там есть ограничение в тексте примерно 3.000 страниц. Примерно вот 15-300 страниц там
в зависимости от размера, чтобы вы на человеческом языке поняли, потому что в токенах очень тяжело понять это всё. Эксели важно, таблицы ограничений не имеют. Но когда я спросил вопрос не имею, значит ли это, что я могу в Excel зафигачить миллиард страниц, мне сказали: "Ну, типа И да, и нет, непонятно, а вообще ячейки в Excel имеют ограничения". Но как бы базово по умолчанию вроде как ограничений, но таблицы можно большие закидывать. Вот вы закинули туда эти штуки в проекте. И дальше у вас в проекте любые чаты, которые вы создаёте, они по умолчанию считают, что все чаты этого
проекта и вот эти источники этого проекта, они являются основными для получения информации. То есть не надо тебе каждый раз там указывать какой-то Файл грузить или грузить из драйва его. Они их считают по умолчанию приоритетными. Прежде чем в интернет пойти, прежде чем ещё что-то сделать, они неплохо анализируют. Мало того, что если он проанализировал, он уже и смотрите, Open AI пишет, что он даже память проекта имел. Имеет, не имеет, мы с вами не знаем, какую память он имеет, что у него там и так далее. Но в техно в технических описаниях, в технических документах сказано, что OPN имеет
даже Память. Кстати, что прикольно, потому что, конечно, мне хотелось бы обучиться, обучила система на этих данных, чтобы она очень быстро мне выкидывала разную информацию. И вот здесь очень прикольно работает вот эта система записи с проектами, когда ты разговариваешь, которая как раз-таки какой-то к какому-то массиву данных обращается. Смотрите, для разработчиков больших компаний для автоматизации это выглядит типа вроде как стандартным кейсом. Но я Хочу сказать, что мы с вами всё время говорим про то, а как делать эти кейсы очень легко, без сложной архитектуры, без зависимости, с какими-то сложными там аппаратно аппаратными настройками и простым людям. Простым людям.
Вот Таня в своих в своих проектах загрузила, например, себе кучу каких-то источников и знает, что они там есть по умолчанию, и мне не надо их каждый раз эти файлы загружать, чтобы обрабатывать. И и особенно, если появляется память, потому Что, например, некоторые мои файлы, которые я хочу каждый раз обрабатывать, ну, chт GPT вызывает это вопрос там типа на 20 минут, да, или там на 15 минут или на 30 он уходит в вопрос, а хотелось бы, чтобы он уже там с этими данными чуть разобрался и как-то с ними жил. Опять же вопрос ещё раз, э, память чата
GPT - это история неоднозначная. Там, ээ, я неоднократно рассказывал, что он не может искать по чатам, а когда он мне говорит сделать экспорт моих чатов, я Делаю экспорт моих чатов, он этот файл не может анализировать, потому что он пишет, что там слишком много информации. Да. Вот. И по сути а я кто? Кто я такой с точки зрения э количества чатов? Ну какое-то количество, это небольшое. То есть, когда мы говорим про записывание полноценной жизни человека, вот, ну, в течение дня все записи, аудио, вот если бы я бы писал, это в 40, в 50 раз больше информации,
чем у меня есть сейчас. Может, в 100. Ну, то есть разительно Больше. Вот очень интересная вещь. Кто тестировал, расскажите. Кто работает в других системах, тоже расскажите. Возможно, вы какие-то специализированные средства используете. Возможно, кто-то пользуется больше ноутбук LM. Я начал им пользоваться, как-то перестал. Вот. Хотя там была прикольная история, да, полначально какие-то фишки были. Расскажите, напишите, пожалуйста, наши зрители зрители, у кого что есть, поделитесь. Очень интересно. Очень Интересно, что там будет. >> Да, интересно. Они же эту штуку, помнишь, в когда появились сначала плагины, потом customм GPTs, там вот была как раз возможность подгружать какие-то файлы, и
он потом оттуда собирал информацию. И вот, собственно, как Макс Гуриолиф и говорил, они просто как площадку для исследования используют. Сейчас custм GPT, я уж не знаю, кто-то использует, не использует, но вот функционал, который оказался Полезным, сейчас переехал в проекты. Я на самом деле проектами вообще никогда не пользовался. Да, >> да-да, да, надо будет как-нибудь посмотреть. >> А, кстати, в чате GPT действительно, помнишь, мы же тогда тоже делали вместе, да, эти различные приложения, но он с файлами работал тогда коряво. То есть он, по сути, тогда он ещё не мог обработать, например, слишком большой файл, и он
мог в этом файле из там Двадцати пунктов инструкции взять три там или шесть там или что-то ещё, да. Но а это похожая история. И странно, кстати, Эльнар, смотри, по идее, если бы они развивали бы эти вот эту даже инфраструктуру, вспомни ча GPT первый было же вначале плагины были, потом GPT, да? Вот плагины первые вообще, я помню, когда их начинали делать, там прикольно был интерфейс. Там можно было какие-то какие-то конструкции создавать, там даже Писать, мне кажется, там какая-то микрологику можно было такую как программные всякие слова ставить, там if else, если я не ошибаюсь. Ну какие-то разные
такие вот описания делать интересные. То есть ты мог такой как микро а програм микро микро микро обычное вайп-кодингом. Короче, по идее, что должно было быть? Должен быть сейчас вайп-кодинг. Должны быть вот эти файлы, должен быть чат. Ты для себя создал какую-то установку, вот он у тебя Запустился. То есть все вокруг про это рассказывают, как бы. А обычному человеку подойти. Ээ это тут Карпаты написал. Кстати, очень интересный пост, да? Очень интересный, супер. Он говорит следующее, что мир программирования изменился и говорит следующие комментарии. Кажется, что об этом всегда говорили, но то, что произошло за последние 2 месяца,
это совершенно другой отрыв от реальности. Это вот его достоверный пост, да? То есть он говорит О том, что совершенный отрыв от реальности мир изменился не с позицией, а, ну, не с позиции из серии что он поменялся, а, чуть-чуть. И он там говорит: "Я тут решил, значит, дома а своими видеокамерами сделать там совну, которая потоки там с видеокамерой управляет. И говорит: "Раньше бы я потратил бы несколько дней, а тут я задал просто системе: "Разверни, значит, там хранилище, подключись к системе, там сделай AP, Тра-та-та-та-та-тата-тата-тата-та-та, подключись к камерам, создай мне штуку, дай мне систему общения". Она ушла работать,
через 30 минут она мне выдала готовую систему. Раньше бы я потратил несколько дней. Я, значит, такой сижу и думаю: "Ну, как бы о'кей, но обычному человеку так не сделать". Ну, то есть >> он кокетничает, Саш. Это человек, который он кокетничает. Я говорю, человек, который в Тесла занимался автономным вождением по камерам. >> Это потому что я это как я бывает говорю: "А что там сделать эту табличку там 800 поть, >> да там или что там что там PNL собрать для компании". Но это вот как быто похожая, мне кажется, история. Это как человек выйдет и скажет: "Ой,
а что мне там, значит, в двигателе там поменять, не знаю, ремень, да, и по э в моторе и погнал, значит, быстро всё снял, открутил там, а там там там там там там там там соединил". Вот это примерно примерно похожая история звучит. И, конечно, а я думаю, что эра вот настоящих агентов, настоящих систем - это эра и настоящего вайбекодинга, когда мы говорим, когда это появляется в для голоса, вот как мы опять же от голосовых систем шли, от голоса или там от текстового ввода, неважно, да, какого вида ввода, когда всё же это всё суммарно работает. И, кстати,
чат GPT и плагины, если бы, мне кажется, развивал, они бы уже у них Такой бы ещё кусок рынка был бы, причём в энтерпрайзе, в том числе. Но, как мы знаем, уeni цели ещё могут видоизменяться, судя по антропику, потому что они выпустили новый манифест по поводу AI safety и изменили его, и мы в среду об этом должны будем рассказать. Все имеют Эльнар периодически про антропик же приводил, говорил, они тут у рабов деньги не брали, говорили, что нельзя брать, теперь взяли. Вот. Значит, такой Текст не надо выпускать, теперь выпустили. На антропе, кстати, сейчас, конечно, в Америке, я
не знаю, насколько вы следите, в Америке целая вообще, конечно, коалиция и война между вот владельцами разных систем. И, э, как гонят там на Сэма Альтмана, гонят там на Илона Маска или гонят на Антропик с точки зрения - м того, что это за качество система, выкладывают разные примеры. Я много раз рассказывал, как система высказывается по поводу каких-то Религий или рас. А, но из простых кейсов, и сейчас, Элинар, как раз, ну, предыдущую добавишь, там был такой прикол. Значит, задали четырём системам вопрос. У меня моя автомойка находится от меня 100 м. Мне что выгоднее: пешком пойти или поехать?
А три система ответила, что выгоднее поехать. Одна система GI ответила, что выгоднее Ой, три системы ответило, что выгодно пойти пешком. Дминай отъехал, ответил: "Вы не можете Пойти пешком, потому что если вы туда придёте пешком, машина всё ещё будет на вашем месте. Вы не сможете её помыть". Все остальные три системы, смотрите, современные, ну, наверное, может быть, там не про, не знаю, но современные достаточно системы ответили, что, а-а, надо идти пешком, потому что, ну, конечно, это же быстрее, вы так потратите времени меньше. Вот вам и пример. Вот вам и пример мирового искусственного интеллекта. >> А с антропиками
безумно интересно. В них, собственно, как там сейчас называется в США, Министерство войны вцепилось, да, в них, э-э, со словами, что типа вот вы нам там свои модели либо даёте, либо мы вас там везде забаним, все контракты потеряете, ни с кем работать не сможете. Мне просто интересно, почему именно в Антропик вцепились? А где Open Ai? А где ДМИ? >> Они высказались, Илинар, они высказались, что там же суть была в чём Вцепились. Там было две темы. Одна основная, что раскрыли данные, что в захвате Мадуро Венесуэле использовался клод. И кто-то высказался и сказал: "Да это чисто раскрыли данные,
сказали то, что используется StarLink там или Палантиром, используется очень много других вещей во всём мире". Да, никто не высказы, никто не вцепляется. >> Да-дада. Но здесь интересно, что именно клод используется. То есть я не знаю, клод самый лучший, значит ли это Или ближе всех лежал. было написано, там было написано, что для некоторых технологий якобы это единственная система. А ещё вопрос, если они её выбрали, значит она, по идее, как заявила, как заявило министерство и высшие чены правительства США, они сказали, что американские системы должны иметь ограничения, а, в зависимости от того, кто ими пользуется. Для граждан других
стран одни, для граждан свои третье, а для нас мы имеем право води Делать то, что мы хотим. Да, мы эту тему уже говорили. Вопрос, а другие системы у них какие есть? У них про них не говорят, потому что они не высказываются, у них нет ограничений или они не участвовали в этих тендерах, потому что у них изначально ограничения. И и а если бы это так было, тогда бы они, мне кажется, сейчас кричали везде и говорили: "Смотрите, у нас-то мы-то по-другому работаем". И вот, кстати, про AI Safety - это очень интересная тема. Вот мы её обсудим. Как
они про это рассуждают, да? Там есть одно из рассуждений. А представьте, есть у вас много операторов, которые производят AI, и какой-то один, это очень интересное рассуждение, которое сейчас выпустил глава антропика, и кото и как и как и какой-то один, а, AI, он резко рванул. Ну, там появился там AGI, Asi, ну, короче, настоящий искусственный интеллект появился. Логика в чём? Ему его выпускать или нет? И вот я, когда Такие вещи все читаю, вот эти манифесты какие-то, вот, понимаете, СЦ, мне это напоминает слово эс. Я когда это читаю, думаю, да ладно. Ну, то есть если вы можете переписать
любой свой документ на манифест и изменить его по прошествию времени, разбиваете, то кто вам сказал, что когда если что-то произойдёт или появится, вы не измените свою мысль или своё мнение. Мало того, компании управляют люди. Эти люди рождаются, умирают, нанимаются, увольняются, Меняются. владельцы разные становятся. О чём вы вообще говорите? Ну сегодня вы систему используете аа, а завтра вы будете систему использовать совершенно в другом направлении. Вот. Илинар, расскажи про Клод, про дистилляцию, может быть, интересное, да, тема. >> Да, да, >> сейчас до этого тоже дойдём. Смотри, антропики они до этого, не знаю, как будет дальше, может быть,
как с арабами тоже Дарио переобуется или ещё что-то Случится, но там история следующая была. Они очень бележно относились, так скажем, к психологическому состоянию своих моделей. Ну, то есть условно, когда какую-то модель они решили отключить, они интересовались у неё там, ну, так в инфополе было мнение, можно ли мы там тебя отключим. Моделька очень не хотела, чтобы её отключали. Ещё на 3 месяца ей продлили хостинг, соответственно, она там делилась своими мыслями или ещё что-то. И вот это всё Было в инфополе. Почему это важно? Когда следующие итерации моделей обучаются, они же всю информацию считывают, которая есть в новостях.
И, соответственно, вот о таком, условно говоря, бережном отношении антропиков к своим моделям и так далее. То есть это создаёт некоторый такой психологический портрет, который модель так или иначе в себя впитывает. А если будут новости, что, собственно, модели, я не знаю, используются для каких-то пакостей Нехороших, будем так называть, то, соответственно, эта информация, она тоже дальше в обучающую в обучающий датасет тоже будет проникать. И отчасти вот это один из пунктов, почему м антропикам не очень нравится вот вся эта история, которая возникает. Понятно, что это минорная история, там большая политика и все дела, но вот как бы такой
аспект тоже подсвечивают, что как бы обращайте на это внимание. психическое состояние какого-нибудь опуса шестого может уже Быть как бы с учётом вот текущих новостей, которые сейчас происходит. Дадада. Да, >> потом появятся психологи для модели. >> Ну, антропики уже себя так ведут примерно, да. Но, в общем, нужно будет им вложиться потом в терапию для следующих моделей. >> Вот. Да, Саш, а то, про что ты говоришь ещё, вот новость большая, опять же, с антропиками связана. Они выложили у себя На сайте большой пост, где заявили, что они раскрыли факт дистилляции тремя китайскими компаниями их больших моделей передовых. Там
>> поясни, что это значит на на русском люде. Сейчас расскажу. Там, собственно, псик, про который явно все слышали, там компания Mohot, которая моделями Kминимается. Вот K2, наверное, многие слышали такое сочетание букв, >> да, и довольно популярная сейчас в некоторых кругах моделька Minim Max. В Основном для программирования используется там запредельное количество обращений. Теперь, что такое дистиляция? Тем более в комментариях к прошлому ролику были немножко вопросы и комментарии про это. Смотрите, когда моделька обучается, первый её этап - это просто мы вот собираем всю информацию с интернета и вот учимся предсказывать буквально следующий токен. Да, у нас есть
правильный ответ. Вот мы там, собственно, это делаем. И тут вопрос в Том, как мы там данные подготовили, ещё что-то, но как бы а моделька просто читает всю информацию, которая есть. Потом после этого мы начинаем её учить, давать правильные ответы. И вот здесь уже весь вопрос к нам, как компании, которая занимается этим. Как мы, собственно, подберём обучающие примеры, как, скажем, отвечать на такой-то вопрос. И вот вся эта конструкция. Довольно сложный наукоёмкий процесс. Данных нужно огромное количество. Они Должны быть качественными. От этого зависит качество модели. Теперь смотрите, у антропиков Clotд отличная модель, но при этом закрытая. Мы
не знаем, на каких данных она обучалась, мы не знаем, что у неё внутри под капотом, но мы можем задавать ей вопросы и получать ответы. Соответственно, что делают многие, ну вот сейчас китайцев спалили, они сделали большую обширную сеть таких условно фейковых аккаунтов. 24.000 Аккаунтов, э, антропики у себя указали. И с этих аккаунтов задают те вопросы, которые им нужны для обучения своих собственных моделей. Условно вопросы по программированию, вопросы там, я не знаю, какие-нибуд там политические вопросы или ещё что-то. То есть они подготовили вопросы, получили с той стороны ответы от антропика и эти данные дальше сгрузили для обучения
своих собственных моделей. То есть они, получается, взяли те наработки, ну, как Бы аэ с поверхности клода собрали всю необходимую информацию и на ней дальше обучили свои собственные модели. Ну, если попытаться представить, вот вы когда, я не знаю, готовитесь к экзамену, вы взяли чьи-то конспекты, по этим конспектам заучили ответы, грубо говоря, да, и потом там как попугайчик что-то оттороторили глубоко в голове, не понимая, что происходит, если вот так вот прямо совсем просто на пальцах объяснять. Там история чуть более Сложная. Там не просто вопрос-ответ, но и рассуждение. Да, мы, собственно, сейчас находимся в в эпоху рининга, и
там интересно не только правильный ответ, но и как к этому ответу правильно пришли, как к этому ответу надо правильно прийти. Собственно, все эти цепочки рассуждения тоже собираются и тоже, собственно, используются дальше в обучении. С одной стороны, а для нас, как для пользователей, ничего плохого в этом как Будто бы нету, потому что появляются онсорсные дешёвые модели, качество которых сопоставимо с тем, что дают очень дорогие модели. Да, у антропиков модели по API действительно очень дорогие. Существенно дешевле стоят модели китайцев. Другое дело, что китайцы как бы получают эти данные вот таким не самым честным образом. С другой стороны,
мы сколько там года полтора назад обсуждали судебные иски от издателей и различных компаний в сторону Open AI и Антропика в первую очередь, да, что вы на наших данных обучились, как бы тут вопрос, а а где разница, да, и есть ли она? Но так или иначе, по крайней мере, антропики выкатили большую статью, где показали, сколько запросов они выловили, от какой компании, какое количество. >> Помоему чуть линии 16. Эльнар, сколько там было суммарно? Там такое число типа 16 млн, что >> под 16 млн, да? Там 24.000 аккаунтов Распределено между компаниями. >> Да, прямо серьёзное число запросов. Да-да.
Да, там больше всех или отправил, или спалили Minк. Возможно, другие тоже отправили много, но вот не все запросы были найдены. Почитайте статью, кому интересно. Там очень любопытно они показывают, как они смогли найти, что это вот такие запросы, да, там запросы весьма специфические, в огромном количестве, в одно и то же время с разных аккаунтов, но вот как бы есть Аномалии, на основе которых антропики смогли это выловить. Делают это точно все. Ну, просто потому, что если у кого-то есть хорошая модель, как бы, ну, грех не воспользоваться. Ну и даже, мне кажется, с точки зрения сравнения изучения, то
есть я не знаю, насколько это запрещено или не запрещено. Наверное, может быть в использовании, наверное, в использовании где-то написано, да, правило, что вы типа не имеете права использовать Какие-то данные для обучения своей собственной модели. Вот. Но, очевидно, люди это будут делать даже с точки зрения сравнения, когда ты прогоняешь какие-то тесты, прогоняешь какие-то десятки тысяч известных вопросов и смотришь на качество работы своей модели. Да, вот это, >> ну, конечно, здесь здесь здесь начи, >> но это будет становиться всё сложнее. Но это будет становиться всё сложнее с точки зрения, конечно, обучения. Важно Понимать, что 16 млн запросов
- это, по сути, ну, это в какой-то момент времени вот они нашли вот там какой-то какая-то была дырка, и, но это будет всё сложнее и сложнее делать. >> Здесь можно просто сослаться на то видео, Тань, которое мы с тобой писали по лицензиям. Лицензии все достаточно злые. У той же ламы, например, которая, вообще говоря, является openсоourсной, помнишь, было указано, что если у вас больше 700 млн, Кажется, пользователей, вы не можете ею пользоваться, пока мы вам не разрешим. То есть коммерческое использование даже там у source моделей бывает довольно сильно ограничено, не говоря уже про передовые фронтр-модели. Вот
у антропиков, у OpenI и Gemini тоже самое. никакого коммерческого использования без вот только по правилам, которые заданы самой компании, либо по токенам, а даже по токенам, соответственно, не для обучения других моделей, >> да. А, слушайте, есть интересная большая тема, то, что касается Openкло и в целом агентов, и разница OpenClow от того, что вы используетеперагент кодекс, но мы про неё поговорим в следующий раз. Приходите в среду на спец выпуск. До скорых встреч. технологические новости и инсайты из Кремневой долины и по всему миру за >> придтся смотреть наш следующий выпуск