Максим Дорофеев. А почему у тебя интеллект не искусственный?

Когда большие языковые модели называют искусственным интеллектом, в ответ часто можно услышать, что это не вполне интеллект, а модель, предсказывающая наиболее вероятное следующее слово без понимания сути разговора. Мы не будем спорить на эту тему, а просто признаем, что живые люди действительно не всегда понимают, о чём говорят, и произносят некоторые фразы только потому, что они стали их автоматической речевой реакцией, лишённой какого-либо осознания. Можно ли определить: понимает говорящий то, что он вербализует, или озвучивает шаблонные конструкции? Как понять, что он понял? Этот вопрос особенно актуален, если вам нужно хоть как-то оценить уровень экспертности говорящего в той области, в которой вы сами слабо разбираетесь. И есть другой не менее важный вопрос: как понять, что ты сам понял? Можно ли отличить иллюзию понимания от понимания истинного? Универсального рецепта нет, но в некоторых случаях это можно сделать. CodeFest 16 #ИИ в разработке ПО Олег Бобриков. От публичных бенчмарков к модельной стратегии: как выбирать LLM для продуктов компании Публичные бенчмарки помогают увидеть общую картину, но плохо предсказывают, как модель поведёт себя в конкретном продукте. На реальных данных и task-specific метриках расстановка сил между моделями может заметно меняться: одни хуже работают с доменной терминологией, другие не выдерживают нужный формат ответа, третьи дают приемлемое качество, но выигрывают по стоимости или снижают зависимость от внешнего провайдера. В докладе расскажу, как мы в 2ГИС оцениваем и сравниваем LLM на задачах продуктовых сервисов — от классификации и извлечения фактов до function calling и SQL generation. Покажу, как учитывать не только качество, но и стоимость, ограничения по sensitive data, self-hosted сценарии и инфраструктурные риски. Обсудим, как разрабатывать внутренний benchmark-сервис и как он помогает принимать решения о выборе, замене и сочетании моделей, а также формировать модельную стратегию для большого числа сервисов. Презентация - https://links.mnogosdelal.ru/CodeFest Сайт - https://16.codefest.ru

Иконка канала CodeFest Russia
69 подписчиков
12+
611 просмотров
3 дня назад
12+
611 просмотров
3 дня назад

Когда большие языковые модели называют искусственным интеллектом, в ответ часто можно услышать, что это не вполне интеллект, а модель, предсказывающая наиболее вероятное следующее слово без понимания сути разговора. Мы не будем спорить на эту тему, а просто признаем, что живые люди действительно не всегда понимают, о чём говорят, и произносят некоторые фразы только потому, что они стали их автоматической речевой реакцией, лишённой какого-либо осознания. Можно ли определить: понимает говорящий то, что он вербализует, или озвучивает шаблонные конструкции? Как понять, что он понял? Этот вопрос особенно актуален, если вам нужно хоть как-то оценить уровень экспертности говорящего в той области, в которой вы сами слабо разбираетесь. И есть другой не менее важный вопрос: как понять, что ты сам понял? Можно ли отличить иллюзию понимания от понимания истинного? Универсального рецепта нет, но в некоторых случаях это можно сделать. CodeFest 16 #ИИ в разработке ПО Олег Бобриков. От публичных бенчмарков к модельной стратегии: как выбирать LLM для продуктов компании Публичные бенчмарки помогают увидеть общую картину, но плохо предсказывают, как модель поведёт себя в конкретном продукте. На реальных данных и task-specific метриках расстановка сил между моделями может заметно меняться: одни хуже работают с доменной терминологией, другие не выдерживают нужный формат ответа, третьи дают приемлемое качество, но выигрывают по стоимости или снижают зависимость от внешнего провайдера. В докладе расскажу, как мы в 2ГИС оцениваем и сравниваем LLM на задачах продуктовых сервисов — от классификации и извлечения фактов до function calling и SQL generation. Покажу, как учитывать не только качество, но и стоимость, ограничения по sensitive data, self-hosted сценарии и инфраструктурные риски. Обсудим, как разрабатывать внутренний benchmark-сервис и как он помогает принимать решения о выборе, замене и сочетании моделей, а также формировать модельную стратегию для большого числа сервисов. Презентация - https://links.mnogosdelal.ru/CodeFest Сайт - https://16.codefest.ru

, чтобы оставлять комментарии