Feed aggregator

Семантического поиска оказалось мало. Как я научил Obsidian находить похожие заметки

Habr.com - Tue, 08/18/2026 - 21:48

В прошлой статье я рассказывал, как добавил в Obsidian локальный семантический индекс. Сам проект развивается открыто, код лежит здесь:

GitHub: https://github.com/zinverno/obsidian-ai-hub

С тех пор semantic-слой заметно вырос. Появились автоматическая синхронизация индекса, Similar Notes и поиск потенциальных дублей. В какой-то момент стало понятно, что сам по себе семантический поиск решает только половину задачи.

Базовая схема у меня была такой:

Читать далее

Шесть LLM‑судей из четырёх лабораторий несут 1,9 независимого голоса из 6

Habr.com - Tue, 08/18/2026 - 21:35

6 LLM‑судей, 4 лаборатории, 3 страны — а ошибки коррелируют: ρ̄ ≈ 0,42, эффективно 1,9 из 6.

В июле я писал, что консенсус шести LLM‑судей на RAGTruth бьёт любого одиночного судью. Это по‑прежнему верно. Но тогда я не проверил главного: сколько независимых голосов стоит за этим консенсусом. Оказалось — примерно два.

1,9 из 6

Посадите шесть разных инструктивных LLM судить одну задачу и выносить вердикт голосованием — интуиция подсказывает, что шесть моделей из четырёх лабораторий надёжнее одной: разные компании, архитектуры, страны, ошибки же должны быть независимыми.

Я это измерил. На публичном бенчмарке RAGTruth комитет из шести моделей несёт — по design‑effect приближению — примерно столько же независимой информации, сколько 1,9 независимого судьи из шести. Средняя попарная корреляция их ошибок ρ̄ ≈ 0,42.

Это не «1,9 судьи» в буквальном смысле — это эффективный размер: сколько независимых голосов реально стоит за шестью коррелированными. Разнообразие провайдеров не покупает независимость ошибок.

И вот вывод, который держится вообще без спора о точной цифре: ошибки шести судей скоррелированы достаточно, чтобы гарантии независимого голосования выродились. Теорема Кондорсе для коррелированных голосов не отменяется (Ладха, Боланд) — но её границы становятся куда слабее: шесть таких голосов работают как эффективные ~два. «1,9» лишь оценивает масштаб этого вырождения.

Весь метод, данные и пересчёт одной командой — в репозитории: https://github.com/itsjustmarsel/llm-judge-independence. Скрипт analyze.py пересчитывает ρ̄ и n_eff прямо из сохранённых вердиктов, без единого обращения к API.

Читать далее

Словарь «Колобок» и идея перевода словарей

Habr.com - Tue, 08/18/2026 - 21:29

Оказывается, если поработать с промптами и гейтами, то можно перевести большущий японо-английский словарь к виду японо-русского с очень неплохим качеством. Идея применима к другим языкам. Сделал пайплайн, запускал 100 Sol-воркеров-переводчиков одновременно через CLI. Вышло недорого.

Тут словарь, тут гитхаб с пайплайном, тут примеры статей.

Читать далее

ИИ пишет тест-кейсы и автотесты за тебя: как их генерировать и не получить ложное покрытие

Habr.com - Tue, 08/18/2026 - 21:22

Генерация тест-кейсов — один из первых сценариев, с которых компании внедряют ИИ в тестирование. Отдаёшь модели требования или код — через несколько секунд получаешь готовый список проверок. Кажется, что рутину тест-дизайна можно закрыть промптом, а ручных тестировщиков — сократить.

Но тест-кейс — не синоним тестирования. Модель работает только с тем контекстом, что ей передали: не знает незафиксированные правила и может принять баг в коде за норму. Кейсов становится больше, а контроля качества — нет.

Разбираем, что ИИ реально снимает с QA, где создаёт лишь видимость покрытия и почему сгенерированный набор всё равно приходится проектировать и проверять человеку.

Где прячется ложное покрытие →

Ни строчки руками: как я вайбкодил AI-мастера D&D и что показали два месяца открытой беты

Habr.com - Tue, 08/18/2026 - 21:10

За полгода я не написал руками ни одной строчки кода. При этом в проде — почти тысяча пользователей и первые 50 тысяч рублей. Днём я геймдизайнер в мобильной игре, вечером сажусь оперировать фермой агентов, которые пишут код вместо меня — и сами же его ревьюят и тестируют. Под катом честные цифры двух месяцев открытой беты: воронка, глубина сессий, деньги и пара мест, где агенты меня знатно подставили. А вы уж сами решите, вайбкодинг — это новая разработка или преступление против профессии.

Мне есть, что сказать...

Как совмещать работу и учёбу: кейс студентки онлайн-магистратуры ИТМО в партнёрстве с Яндексом

Habr.com - Tue, 08/18/2026 - 21:00

Привет, меня зовут Кристина Меликова, я учусь в онлайн-магистратуре ИТМО в партнёрстве с Яндексом на программе «Фронтенд и бэкенд-разработка» и работаю бэкенд-разработчиком в компании YADRO. До того, как пойти в сферу IT, я уже успела получить другое высшее образование, но решила переквалифицироваться. В статье расскажу, как проходит обучение в онлайн-магистратуре и как я совмещаю его с работой по специальности.

Читать далее

Призрачный сигнал «Марса-3»: передал ли СССР первое изображение с поверхности Марса?

Habr.com - Tue, 08/18/2026 - 20:45

2 декабря 1971 года советский аппарат «Марс‑3» прошёл сквозь глобальную пылевую бурю и совершил первую мягкую посадку на Марс. Затем он заговорил — и уже более полувека мы спорим, что именно он успел передать и почему замолчал, не сказав главного.

Краткое содержание (TL;DR): У СССР была полноценная и амбициозная программа исследования Марса, но череда аварий, закрытость исходных данных и слабая публичная подача частичных успехов почти вытеснили её из общественной памяти. Ни одна экспедиция не выполнила всю программу, однако советские аппараты достигли Марса, вышли на его орбиту и совершили первую мягкую посадку. Более того, современная обработка сигнала «Марса‑3» допускает, что он может содержать первое изображение марсианского грунта, которое в 1971 году приняли за помехи. Статья рассказывает об этой драматичной истории и предлагает представить, что произошло бы, если бы «Марс‑3» успел передать полную панораму.

От автора: К истории космонавтики у меня особое отношение. Я провёл детство в Советском Союзе, читал в журнале «Наука и жизнь» публикации об экспедиции «Вега» и американских «Викингах», размышлял об интерпретации их биологических экспериментов, с замиранием сердца следил за полётами «Фобоса‑1» и «Фобоса‑2» и собирал посвящённые им газетные вырезки. Я до сих пор помню, как плакал, когда в новостях сообщили, что экспедиция завершилась неудачей на последнем этапе, а потом не мог объяснить друзьям, почему воспринимал произошедшее как настоящую трагедию.

Экспедиция СССР к Марсу 1971 года состоялась немного раньше моего времени, но её история всегда поражала меня талантом и упорством создавших её учёных и инженеров. В детстве я долго размышлял о том, что могло скрываться в таинственном сигнале «Марса‑3». Удивительно спустя примерно 35 лет найти возможные ответы на вопросы, которыми я задавался ещё ребёнком. Собственно, именно об этом эта статья.

Читать далее

Проиндексирован, исправен и невидим: ноль из 32 в ответах нейросетей

Habr.com - Tue, 08/18/2026 - 20:40

Я измеряю видимость компаний в поиске и в ответах нейросетей. Свой сайт проверил последним: клиентские проекты всегда впереди своих. Результат отрезвляющий — все страниц есть в поиске, проблем с индексацией нет, а в вопросах про услугу без упоминания названия ноль появлений из тридцати двух возможных.

Внутри: как собрать промпт-карту и почему её нельзя писать до замера спроса, чем российский стек отличается от западного, отдельная директива в robots.txt, о которой мало кто знает, и во что обошёлся весь замер — 102 рубля.

Читать далее

Теплый ламповый локальный инет. От Opencode и DocFetcher. «Свой лунопарк»

Habr.com - Tue, 08/18/2026 - 20:40

Уже лет 10 я пользуюсь Everything от VoidTools, и наслаждаюсь. Вся навигация в машине - поиск - только через него. Единственное что он не умеет делать быстро - искать в файлах по содержимому.

Не в первый раз недавно посмотрел на DocFetcher, и стал он вдруг “LocalInet feat DocFetcher”.

Первый подход к локальному поиску на индексаторах я делал 10 лет назад. Нашел тогда на торрентах DtSearch, СopernicDesktopSearch, YandexDesktop, DVYGUN Smart Search, потестил многое, но ничего нормально не работало. DtSearch и YandexDesktop были лучшими, но кряков не хотелось, и даже DtSearch был не очень стабильным, а YandexDesktop был очень быстр и бесплатен, но был нестабильным совсем, и был яндексом заброшен. Что значит не очень стабильным ? Оказалось, в рабочем архиве у меня 5 млн. файлов) А все хранилище целиком потянет на 10-15( Ни один индексатор не мог собрать индекс(

Полгода назад по случаю вайбкодил поисковые питон скрипты, и обратил внимание, что одного поиска мне мало: их должно быть два: Один поиск ищет последовательность key1 key2 key3, в порядке строго 123, и ключи там строго фиксированные. Это поиск программиста, когда он ищет кусок в программе.

И второй поиск, те же самые key1 key2 key3 - но тут ключи в произвольном порядке, важна лишь дистанция между ними. Она должна быть небольшой, чтобы гарантировать, что ключи относятся друг к другу, тогда в этом куске текста весьма вероятно будет то что нужно. При этом и ключи и индекс должны быть стеммизированные, те, поиск должен искать корни слов, а всякие окончания должны быть отрезаны. Иначе много нужных match потеряется. Этот второй поиск - поиск в книге.

Читать далее

Баг бессмертия и патч против тирании: что делать с властью, когда биологический сброс перестанет работать

Habr.com - Tue, 08/18/2026 - 20:30

Несменяемые элиты, когерентное сознание и эксперимент Quantum Icebreaker

Раздел 1. Футурологический тупик: биологическое долголетие, монополия элит и риск вечной стагнации

1.1. Последний биологический ограничитель власти

В истории человечества существовал один ограничитель власти, который не зависел ни от конституций, ни от качества институтов, ни от доброй воли самого правителя.

Можно было уничтожить политических противников, изменить законы, поставить под контроль армию, суды и информационное пространство. Можно было создать династию и передать наследникам имущество, связи и влияние. Но существовало обстоятельство, с которым не могла справиться ни одна политическая система: естественный биологический предел человеческой жизни.

Смерть правителя сама по себе, конечно, никогда не гарантировала свободы. Иногда одного деспота сменял другой. Иногда политическая конструкция переживала своего создателя практически без изменений. И всё же происходило нечто фундаментальное: менялись люди. Возникала необходимость заново распределять влияние, заключать союзы, договариваться с новыми группами, приспосабливаться к новому поколению. Даже самая закрытая политическая система не могла полностью остановить эту ротацию.

В этом смысле биология выполняла странную, но важную функцию системного предохранителя.

Она не обеспечивала прогресс. Она лишь не позволяла одному человеку удерживать историческое время в своих руках бесконечно.

Известную мысль Макса Планка о том, что новые научные идеи часто побеждают не потому, что удаётся убедить их противников, а потому, что меняются поколения, можно с определённой осторожностью перенести и на политику.

Читать далее

Компилятор как первый ревьюер: петля верификации Go‑кода, который написал агент

Habr.com - Tue, 08/18/2026 - 20:29

Год назад мой типичный пулл-реквест писался руками часа три и ревьюился минут двадцать. Сейчас четыреста строк агент выдаёт за минуту, а ревью того же дифа занимает час: приходится вычитывать уверенно написанный чужой код, в котором ошибка выглядит ровно так же убедительно, как правильное решение. Узкое место переехало с набора кода на его проверку, и усилием воли оно не расширяется.

В августе у Google вышел текст о том, почему Go хорошо подходит для разработки с агентами. С тезисами спорить трудно: единый форматтер, быстрая компиляция, строгий компилятор, большая стандартная библиотека, обещание совместимости. Беда в том, что из этих тезисов не следует ни одной строчки конфига. Хорошие свойства языка сами по себе не мешают агенту сдать диф, который собирается, проходит тесты и при этом делает совсем другое.

Дальше о том, как довести идею до инженерного состояния. Почему форма сообщения об ошибке влияет на исход правки сильнее, чем формулировка промпта. Какие поломки Go пропускает молча и чем их ловить. Как за полчаса написать свой анализатор, превращающий договорённость команды в ошибку сборки. И чем закончились попытки закрыть тот же вопрос документом AGENTS.md. Всё обкатано на монорепозитории примерно на сто восемьдесят тысяч строк, где за последний квартал около половины дифов написал агент.

Читать далее

Когда senior'а оценивают по коммуникативным навыкам — это диагноз компетентности руководителя

Habr.com - Tue, 08/18/2026 - 20:24

Я нечасто работаю с IT компаниями, но 6 моих  IT компаний-клиентов, да и общая информация об IT позволила мне сложить впечатление, что люди в IT отличаются от других.
В IT больше Синих людей по классификации Клера Грейвса, то есть людей склонных к более аналитической деятельности и восприятию мира через факты, но не через эмоции. При этом у них есть свои особенности с коммуникациями; они лучше общаются письменно и не готовы общаться с незнакомыми людьми не по делу.
Для меня это было очевидно, да и для многих тоже, именно поэтому я так удивился, когда тут на linkedin прочитал пост о том, что senior'а чуть не уволили из компании так как у него были проблемы с внешней коммуникацией. Его даже назвали senior со звездочкой, типа с проблемой.
И у меня тут возникает два вопроса.
Первый вопрос: кто эти руководители в IT, которые оценивают senior по коммукативным навыкам выше его профессиональных навыков, что готовы были уволить такого сотрудника, который в условиях, когда его не гнобили за плохое общение, показал выдающиеся результаты, потому что ему наконец-то дали возможность работать.
И второй вопрос. Какой смысл развивать в сотруднике то, что у него не является принципиально важным для работы, в ущерб развития наиболее перспективных качеств, где он реально может быть эффективным.
Стратегия Голубого океана как раз заключается в развитии сильных качеств, при этом про слабые качества просто знают и учитывают, без попытки их изменить.
Стратегия Голубого океана отлично работает для бизнеса, почему не использовать её идею и для людей.
#it #бизнес

Читать далее

Я не хотел нанимать работника и заменил его нейросетью

Habr.com - Tue, 08/18/2026 - 20:02

Дисклеймер: я люблю людей и свою карму. И не считаю, что всех нужно заменять ИИ.

Всем привет! Меня зовут Миша Шумовский, я главред Нейромедиа — нового медиа про нейросети. На запуске у нас была задачка: наладить регулярный выпуск новостей, чтобы получать дополнительный поисковый трафик. Нанимать под это отдельного человека не хотелось: такая работа стоит недорого, но для молодого медиа важна каждая копеечка. Да и как будто в медиа про нейросети часть процессов точно должна быть автоматизирована, иначе зачем все это. 

Поэтому я поковырялся и с нуля собрал себе парсер новостей в виде Telegram-бота — при том, что программировать не умею. Теперь каждые 15 минут бот сам обходит нужные сайты, отбирает важное, пишет нормальный текст новости на русском и присылает мне в телегу. Мне остается нажать одну кнопку. Давайте расскажу, как я такой сервис сделал.

Читать далее

Странность августовского обновления Макса

Habr.com - Tue, 08/18/2026 - 20:01

Делюсь наблюдением о несовпадающем сертификате издателя в десктопном клиенте мессенджера под Windows.

Читать далее

ОК или НеОК: как мы строили LLM‑судью и дважды меняли формулу вердикта

Habr.com - Tue, 08/18/2026 - 20:00

У нашего AI‑агента поддержки было десять метрик и ноль ответов на главный вопрос: какую долю обращений он решает?

Судья, который читал только текст диалога, ставил 18/20, а проверка по реальным вызовам инструментов давала 8/20. Текстовые проверки считали правдоподобный ответ верным и не могли отличить его от подтвержденного. Самодельный «процент фантомных эскалаций» оказался измерением того, насколько слова бота согласованы с его же внутренними флагами. Каждая метрика что‑то измеряла, и ничего продуктового

Тогда мы решили: оценка качества станет отдельным сервисом с собственным источником истины. В этой статье два переписывания формулы вердикта, несколько пойманных слепот и один эталонный набор, который учил нас доверять неправильным ошибкам.

Читать далее

Как умирает город без электричества? Написал роман о блэкауте уровня Кэррингтона — хочу узнать, насколько ошибся

Habr.com - Tue, 08/18/2026 - 19:58

Сначала была не идея романа, а ощущение: наш мир — хрупкая штука. Я программист, и моя личная версия конца света была профессиональной: а что, если вирус сожжёт все процессоры? Не данные — железо. Производство микроэлектроники — самая сложная цепочка поставок, которую построило человечество; то, что сгорело, не перевыпустить.

Потом я наткнулся на событие Кэррингтона. 1859 год, геомагнитная буря: телеграфные аппараты искрят и бьют операторов током, связь работает при отключённых батареях — на энергии, которую навела в провода сама буря. И я понял, что мой вирус — детская страшилка. Есть сценарий хуже: не процессоры. Электричество. Всё и сразу.

Насколько я ошибся

Универсальный контроллер управления отоплением и водоснабжением. Железо

Habr.com - Tue, 08/18/2026 - 19:47

В прошлой статье была рассмотрена схема организации отопления и горячего водоснабжения (ГВС) отдельной квартиры с общим (и единственным) контуром циркуляции теплоносителя, основным источником тепла в виде индивидуального проточного газового водонагревателя (колонки или котла) и вспомогательным электрическим бойлером.

Читать далее

Как попасть в IT без знания кода? Разбираемся в профессии no‑code разработчика

Habr.com - Tue, 08/18/2026 - 19:34

Понятие разработки без кода сегодня все чаще звучит в разговорах о будущем цифровых профессий. Это направление открыло дорогу в IT для людей, которые раньше не считали себя техническими специалистами, но хотели создавать продукты и решать задачи без углубления в кодинг. О том, как стать no-code специалистом и и какие возможности открыты для них на российском рынке, рассказала Яна Смирнова, разработчик студии визуализации данных AkademiaDev.

Читать далее

Автоматизация wildcard-сертификатов

Habr.com - Tue, 08/18/2026 - 19:34

Рано или поздно в инфраструктуре появляется задача автоматического обновления TLS-сертификатов. В простом случае она решается установкой certbot: один домен, один сервер, cron-задание и дальше можно не вспоминать об этом годами.

Сложности начинаются, когда инфраструктура вырастает…

Читать далее

Как я измеряю видимость брендов в шести нейросетях: схема замера, формат логов и ошибки

Habr.com - Tue, 08/18/2026 - 19:34

Задача звучит просто: выяснить, называют ли бренд ChatGPT, Claude, Perplexity, Gemini, Алиса AI и GigaChat, когда пользователь спрашивает совета или ответа у ИИ. На практике эта задача раскладывается на десятки технических решений, каждое из которых меняет результат в разы. Ниже устройство замера, формат хранения и три моих ошибки, которые обесценивают всю работу.

Читать далее

Who's online

There are currently 0 users and 8 guests online.
Syndicate content