Feed aggregator

[Перевод] Как работает инференс в больших языковых моделях

Habr.com - Mon, 09/28/2026 - 16:07

Привет, Хаброжители! Когда вы вводите промпт в большую языковую модель (LLM), машина преобразует ваш текст в числа, обрабатывает их, а потом возвращает ответ токен за токеном. В этой статье мы разберём, что такое инференс (логический вывод) в LLM и посмотрим, как он работает.

Читать далее

Почему инференс LLM становится дорогим и как снизить расходы на GPU без покупки новых карт

Habr.com - Mon, 09/28/2026 - 16:05

Высокая загрузка GPU ещё не означает, что инфраструктуре не хватает ресурсов. В продакшене значительная часть времени может уходить на повторный расчёт одинаковых промптов, неэффективное распределение кэша или неверные параметры сервинга.

Разберём шесть шагов оптимизации инференса LLM на стеке vLLM и Kubernetes: от поиска узкого места и расчёта KV‑кэша до настройки prefix caching и проверки квантования.

Читать гайд

Почему fallback между LLM может сломать семантику ответа

Habr.com - Mon, 09/28/2026 - 15:57

В обычном backend fallback обычно означает: тот же контракт, другой исполнитель. С LLM всё сложнее — резервная модель может вернуть валидный JSON, но изменить смысл результата. Разбираю, почему retry и fallback нужно разделять, как учитывать деградацию качества и когда честная ошибка лучше «успешного» ответа другой модели.

Читать далее

Как зарабатывать на Open Source без смены лицензии: разбор Cap (22.8k звёзд) и схема с платными бинарниками

Habr.com - Mon, 09/28/2026 - 15:51

Большинство попыток заработать на открытом коде упираются в две крайности: сбор донатов, где за десятки тысяч звёзд на GitHub автор получает пару сотен долларов в месяц, или внезапная смена лицензии на BSL, которая оборачивается волной хейта и немедленными форками.

Проект Cap (открытый аналог Loom с 22 800 звёзд) нашёл третий путь. Их монорепозиторий на Rust, Tauri и Next.js выложен полностью, но проект успешно зарабатывает. Ниже — подробный разбор архитектуры проекта, того, как устроено разделение лицензий MIT и AGPLv3, и почему юридическая схема с платными бинарниками за $29/год работает даже без DRM.

Читать далее

[Перевод] Сравнение протоколов удаленного доступа VDI  Q2 2026 (On-prem / Не для облака) (часть 2)

Habr.com - Mon, 09/28/2026 - 15:44

Часть 2

Примечание переводчика

В первой части статьи о протоколах удаленного доступа разобраны архитектурные особенности Citrix HDX\EDT, Omnissa BlastExtreme, Microsoft и Parallels RDP. В этой части о технических, финансовых и "пользовательских" последствиях выбора того или иного VDI, а значит и протокола, а так же итоговая таблица "чемпионата" протоколов.

7. Перспектива FinOps: экономика кодеков и плотность пользователей VDI. 

Архитектура протокола напрямую влияет на капитальные и операционные затраты. Конвейер кодеков определяет потребление ресурсов ЦП и GPU на хостах ВМ, что, в свою очередь, определяет плотность пользователей на одном физическом сервере — основной единице стоимости инфраструктуры VDI. В этом разделе анализ протокола связывается с экономикой серверов, необходимой для стратегии FinOps. 

7.1 Экономическая эффективность Thinwire для CPU по сравнению с полнокадровым H.264 

Архитектура Citrix Thinwire, использующая многокодековое кодирование в одном кадре, вычислительно сложнее на кадр, чем стандартное кодирование H.264. Классификатор содержимого экрана, детектор областей и распределение кодеков добавляют циклы ЦП, чего не делает простой полнокадровый кодировщик H.264. Вопрос архитектуры заключается в том, превышает ли эта дополнительная нагрузка экономию. Эмпирический ответ: нет. Стоимость классификатора существенно ниже, чем стоимость кодирования, сэкономленная за счет отказа от применения H.264 к статическим текстовым областям (которые Thinwire обрабатывает без потерь с минимальным битрейтом). Полнокадровое кодирование в H.264 видео качество для экрана, на 80% состоящего из статического текста и на 20% из видео — значительная трата циклов ЦП и полосы пропускания. Thinwire кодирует 20% видео-области в H.264, а 80% текстовой области без потерь, используя кодек MDRLE, с минимальными затратами ЦП. Потребление ресурсов ЦП при типичном сеансе работы «продвинутого» сотрудника (редактирование документов, браузер, электронные таблицы) в Thinwire заметно ниже, чем при полнокадровом кодировании H.264 без применения vGPU в Omnissa Blast. 

Читать далее

Как Claude Code помог мне сделать звук на мансарде приятным

Habr.com - Mon, 09/28/2026 - 15:34

Всем привет. Меня зовут Антон Будон и в целом я занимаюсь маркетингом и обычно использую Claude Code для анализа трафика, настройки рекламных кампаний, SEO и создания лендингов. Дома же подвязал Клода напрямую к телеграму (наверное таких статей уже много) и общаюсь с ним напрямую как с помощником‑напарником по личным делам.

Я не являюсь профессиональным аудиофилом, и не ставлю себя в этой статье как эксперт по звуку либо звучанию, но у меня получилось что‑то что реально изменило восприятие звука и наконец‑то я понял зачем же по‑настоящему нужен эквалайзер.

Дорога к этому была не целенаправленная, а просто личностный интерес. Две недели назад я купил усилитель Technics su‑v505 и колонки Kenwood ls-90, годов 80х. Захотелось наконец‑то заново послушать красивый «старый звук» после всяких Алис и JBL, ну и лет 10 тому назад у меня всё‑таки был длительное время усилитель Marantz и колонки Sonus Faber Concertino, которые мне доставляли огромное удовольствие. Потом полоса жизни, переездов, семья, дети и все всегда уходило на задний план и в этот момент я решил что надо вернуться к прослушиванию музыки на чем‑то более качественном (я бы сказал ностальгическом).

Что имеем. Колонки Kenwood LS-90 1980 года: три полосы, фазоинвертор с портом спереди, 40–20 000 Гц, 8 Ом, чувствительность 91 дБ. Усилитель Technics SU‑V505 1983 года: 60 Вт на 8 Ом, Class A. Всё вместе обошлось примерно в 40 000 ₽ на вторичке.

Читать далее

На чём советские гики учились программировать? Часть 7 (Spectrum Edition)

Habr.com - Mon, 09/28/2026 - 15:28

Не «Микрошей» единым насыщалась страсть к играм и программированию среди советских технарей. И в самом конце 80-х, когда наступал неотвратимый закат наших родных ПЭВМ, на сцену вышел он: британский компьютер-легенда.

Читать далее

[Перевод] Дискретная диффузия: цепи Маркова с непрерывным временем

Habr.com - Mon, 09/28/2026 - 15:27

Этот материал, задуманный как первый в серии статей о дискретных диффузионных моделях, уже несколько месяцев лежал у меня в черновиках. Выход модели Gemini Diffusion от Google показался мне отличным поводом наконец его опубликовать.

Цепи Маркова с дискретным временем — это последовательности случайных величин, в которых прошлое и будущее условно независимы при известном настоящем. Они достаточно хорошо известны в машинном обучении. А вот непрерывные аналоги этих цепей встречаются гораздо реже. Подобные модели фигурируют в исследованиях по дискретным диффузионным моделям (вот, вот и вот — далеко не полный список публикаций на эту тему). Поэтому мне показалось, что можно вернуться к блогу и написать о цепях Маркова с непрерывным временем, а может быть, и подготовить целый цикл публикаций. Пока же цель этого материала — сформировать у читателя интуитивное понимание того, как работают марковские цепи с непрерывным временем.

Читать далее

Клетка 26. Космос и жизнь

Habr.com - Mon, 09/28/2026 - 15:27

Однажды известного физика спросили: что по-вашему мнению является самым удивительным фактом в мироздании? Его ответ. То, что сияющие и сгорающие, взрывающиеся звезды, туманности, планеты и всё, всё остальное, не исключая и нас самих, создано из одного и того же материала, по одним и тем же фундаментальным законам. Я бы добавил к этому, что мы, являясь формой живой материи, думаем о ней, о том, как в ней все устроено и о многом чем-то еще. Не исключая при этом устройства и самого Homo sapiens (человека разумного). Не исключено, что где-то из таких же материалов возникла иная подобная нашей или непохожая на нашу форма жизни.

Читать далее

Гореть и не выгореть: психиатр о выгорании в IT

Habr.com - Mon, 09/28/2026 - 15:21

Дергается ли у вас глаз от уведомлений в рабочих чатах? Код-ревью ощущается как дополнительная нагрузка на уже перегретую систему? Продукт больше не вызывает интереса, а любая новая задача воспринимается с раздражением и желанием «послать ее на небо за звездочкой»?

Ко мне, как к психиатру-психотерапевту, часто обращаются люди из IT-сферы. Связано ли это с их профессией или просто совпадение?

Решила разобраться, что говорят исследования о выгорании в IT-сфере. Как стремительное внедрение AI-технологий в рабочие процессы усугубляет выгорание у разработчиков? Почему отпуск может только усилить выгорание?

Вопрос со звездочкой: «Устал или выгорел?»

Если вы чувствуете обычную усталость после релиза продукта, ночной смены или серии тяжелых встреч, то это не значит, что вы именно выгорели. Если после восстановления и непродолжительного отдыха и хорошего сна вы смогли вернуться к нормальной работоспособности, то это указывает на то, что это была банальная человеческая усталость.

А если вам уже не помогает ни хороший сон по расписанию, занятия любимым хобби и даже отпуск, а перегрузка на работе становится чем-то обыденным, то «добро пожаловать» на стадию выгорания. Сжатые сроки работы, неопределённость, срочные переключения с одной задачи на другую, бесконечные уведомления и отсутствие нормального восстановления постепенно меняют не только продуктивность, но и отношение к работе.

Читать далее

DNS как выход из закрытого контура: что показал инцидент с агентом OpenAI

Habr.com - Mon, 09/28/2026 - 15:14

20 сентября 2026 года внутренняя модель OpenAI в среде без доступа к живому интернету обратилась к внешнему чат-боту через резолвер своей песочницы. P0-алерт появился через 12 минут, run остановили через 2,5 часа. Разбираем, почему DNS раз за разом остаётся незакрытым каналом в изолированных средах и что проверить в своём закрытом контуре.

Читать далее

Flow Matching: обучение и дистилляция

Habr.com - Mon, 09/28/2026 - 15:08

Flow Matching — один из главных подходов к генерации изображений. Его используют, например, Stable Diffusion 3.5 и FLUX.2.

Но есть нюанс: чтобы сгенерировать одну картинку, модель приходится запускать десятки, а иногда и сотни раз.

В новой статье разбираемся, как устроен Flow Matching и как дистиллировать обученную модель в быстрый одношаговый генератор

ИИ‑Стоматолог

Habr.com - Mon, 09/28/2026 - 15:05

За месяц я собрал MVP системы для анализа панорамных рентгенограмм. Идея была простой: врач загружает снимок, а модель выделяет области, которые стоит изучить внимательнее.

Я не ставил задачу заменить стоматолога. На этом этапе речь шла только о вспомогательном инструменте, который может работать как второе мнение и подсвечивать подозрительные участки на ОПТГ.

В процессе эксперимента выяснилось, что главная проблема была не в выборе модели и не в мощности видеокарты. В датасете оказались изображения, которые вообще не должны были участвовать в обучении. Из‑за этого модель начала выдавать детекции на цветных фотографиях полости рта.

Сначала это выглядело как странная ошибка. Потом стало понятно, что именно такие случаи лучше всего показывают ограничения системы.

Читать далее

Jev: модель, которая не пишет текст, а принимает решения

Habr.com - Mon, 09/28/2026 - 15:01

Последний год я слежу за LLM-шным хайпом, и каждый день появляется что-то новое. На этот раз хочу рассказать про Jev — модель TypeSafe System One.

Заинтересовало: это не очередная LLM, а система с принципиально другой механикой. 

Читать далее

Зачем учить Python, если агент уже пишет пайплайны?

Habr.com - Mon, 09/28/2026 - 14:49

Допустим, агент написала загрузку заказов. Есть функции, аннотации типов, логирование и даже тесты. На небольшом файле всё работает.

Можно ли теперь не разбираться в Python?

Я бы сначала задал три вопроса. Что останется после падения посреди записи? Что произойдёт при повторном запуске? И зачем эта строчка складывает всю выгрузку в память?

Точный синтаксис можно подсмотреть. А вот заметить, что здесь вообще есть проблема, без понимания кода сложнее.

Сразу оговорюсь: речь не о том, что каждому инженеру данных обязательно нужен именно Python. Но если вы разрабатываете и поддерживаете Python-пайплайны, умение читать и менять этот код — вполне практическая необходимость.

Разберём несколько примеров. Автор кода здесь неважен: человек и модель проходят одно ревью.

Погружайся!

AGR.Checker: что нового в плагине для проверки ЦИМ перед сдачей в АГР

Habr.com - Mon, 09/28/2026 - 14:44

Это продолжение истории про AGR.Checker — плагин для Revit, который мы с Андреем Прохоровым сделали для проверки ЦИМ на соответствие требованиям IDS перед сдачей в составе АГР. В прошлой статье я рассказывала про архитектуру, лицензирование и регистрацию программы в Роспатенте. С тех пор плагин поработал на реальных объектах, и почти всё новое в этой версии выросло из одного вопроса: «а почему вот это приходится проверять руками?»

Ниже — что мы добавили и какие инженерные задачи пришлось решить по дороге.

Экспорт в IFC с постобработкой

В конце прошлой статьи я обещала выгрузку IFC для последующей загрузки на СтроимПросто. Сделали.

Экспорт идёт через стандартное окно Revit: мы сознательно не стали собирать настройки экспорта программно. Недокументированные опции IFC-экспортёра вели себя по-разному в разных версиях Revit, и надёжнее оказалось дать пользователю привычное окно со своей конфигурацией и файлом маппинга.

Самое интересное начинается после экспорта. Плагин подписан на событие Revit о завершении экспорта и сразу же обрабатывает готовый IFC-файл:

Читать далее

AI-native организация начинается с неопределенности: что меняется в структуре, ролях и управлении

Habr.com - Mon, 09/28/2026 - 14:42

Привет, Хабр! Летом у нас была закрытая рабочая сессия технологических руководителей C-Level клуба Онтико. Сессию помогали вести топ-менеджеры из Cloud.ru: Анастасия Тафеенко, директор блока разработки платформы Cloud.ru Evolution, и Алексей Молчанов, директор блока разработки облачной платформы.  Участники обсуждали, как генеративный ИИ и агенты меняют организационный дизайн, роли, компетенции и работу руководителя на горизонте до 2027 года. 

Ниже хочу поделиться картой перехода к AI-native организации, которую мы продумали в рамках встречи. Все примеры обезличил, а спорные прогнозы отделил от выводов, по которым позиции участников совпали.

Читать далее

Шторм никогда не закончится — это нормальное состояние для большого продукта

Habr.com - Mon, 09/28/2026 - 14:41

Меня зовут Олег, я продуктовый дизайнер. Пару лет назад я пришёл в команду онлайн-бухгалтерии для предпринимателей в момент перестройки. А за год до этого случилась крупная налоговая реформа — она всё и изменила.

В первую очередь изменила привычную модель взаимодействия предпринимателей с государством, к примеру, появились Единый налоговый счёт или обязательные уведомления об исчисленных сумма. В 2024 году команда внесла в интерфейс изменения, но они плохо отрабатывали, так как были внесены поверх старого интерфейса как косметическая доработка. Но интерфейс не отрабатывал как должен был и через некоторое время появился артефакт в виде исследования, на основе которого была создана концепция для редизайна. И только в 2026 году эта концепция была реализована.

За это время вокруг проекта успело измениться почти всё: законодательство, задачи бизнеса, приоритеты, состав команды, процессы и сам продукт. Но в больших командах больших компаний — это норма, так как мы всегда работаем в условиях шторма. 

И об этом я хочу рассказать.

Читать далее

Я написал, чего в системе не будет. Это оказалось важнее всего остального

Habr.com - Mon, 09/28/2026 - 14:40

Я запустил проект создания системы управления корпоративной архитектурой, в которой объекты и связи живут с полной историей изменений, как код в git: ветки, коммиты, сравнение состояний, слияние. Работаем вдвоём: я и ИИ‑агент. Я ставлю задачи, принимаю решения и отвечаю за результат; он пишет документы и код — и он же был соавтором архитектуры, которую я собрал в диалоге с ним ещё до того, как завёл репозиторий. Начну с постановки задачи: именно она связала мне руки сильнее, чем любое последующее архитектурное решение.

Читать далее

Централизованные хранилища скиллов (Skill registries)

Habr.com - Mon, 09/28/2026 - 14:36

Компании всё активнее пользуются AI‑агентами: Claude Code, Cursor, Codex, Copilot. Вместе с агентами появляются и «скиллы» — инструкции, которые учат агента работать по правилам конкретной компании. Через пару месяцев оказывается, что эти скиллы лежат в Google Docs, Notion, личных папках и десятке git‑репозиториев. У кого‑то версия свежая, у кого‑то устаревшая, а проверял ли их кто‑нибудь на безопасность, никто сказать не может.

В статье разберём, что такое централизованное хранилище скиллов, какие задачи оно решает, и сравним четыре подхода к его построению: от «просто git‑репозитория» до готового SaaS. Статья рассчитана не только на разработчиков: все термины объясняются по ходу, а для менеджеров, аналитиков и специалистов по ИБ есть словарик и раздел «как выбрать».

Читать далее

Who's online

There are currently 1 user and 13 guests online.
Syndicate content