В пятницу вышла Qwen3.8-27B. Скажу честно, с середины мая я отказался от подписок и сидел исключительно на локальной Qwen3.6 (для всех своих домашних проектов), у меня даже статья была на эту тему. Поэтому мне было очень интересно увидеть на что способна новая Qwen3.8-27B.
Тут на Хабре было несколько статей о том, что 3.8 слишком долго думает и что у 3.8 слишком много галлюцинаций (что, как мне кажется, не совсем корректно), поэтому я решил поделиться настройками, которые работают (у меня), надеюсь они будут кому-нибудь полезны. Qwen3.8-27B превзошла мои самые смелые ожидания, и уж что-что, а задумчивой ее никак не назовешь.
Читать далееИтан Сигел (американский астрофизик-теоретик и научный журналист, автор рубрики "Спросите Итана", один из пропагандистов современных научных знаний), недавно опубликовал статью об истории открытий, которые и привели нас к преобладающему сегодня взгляду на Вселенную (возникшую в Большом взрыве и расширяющуюся с ускорением).
200 лет назад мы почти ничего не знали о нашей Вселенной в космических масштабах. Сегодня мы знаем очень многое, и обнаружили немало загадок, непонятных явлений с неясной природой. @avshkol перевёл этот шикарный исторический экскурс, который даёт общее представление о 20 открытиях в астрономии и физике, по одному на каждое десятилетие, перевернувших наше понимание природы, космоса, Вселенной. Статья будет интересна всем, кто интересуется астрономией, астрофизикой, а также историей развития наших взглядов на Вселенную и формирования преобладающей сейчас теории Вселенной.
Читать далееИИ меняет экономику маркетинга. Работа, на которую уходили рабочие часы команды и подрядчиков, теперь делается за часы. Отсюда возникает соблазн: смотреть на маркетинг как на список затрат и резать, резать, резать … людей, инструменты, исследования, контент.
Но маркетинг это связанная система. Что-то в ней можно убрать без последствий, а что-то кажется лишним ровно до того момента, пока не начинают падать качество решений, знание клиента и рост. Правильный вопрос это не «что заменить на ИИ?», а «что можно удешевить, не разрушив систему?».
Читать далееЛет 10 назад, когда я работал в банке в Сибири, был у нас отдел - малая автоматизация. Делали ПО для местных. Потом отдел расформировали и перешли на централизованное ПО.
Сейчас каждый может стать таким небольшим отделом малой автоматизации. Для себя, для личных нужд или для своих.
ИИ помогает делать проекты, которые раньше ты бы никогда не сделал. Или дорого по времени, или по ресурсам. А сейчас.... Давно уже не испытывал такой личной упоротости в маленькие проекты. Про один я уже писал, теперь расскажу про другой.
Итак, добро пожаловать на шоу!
Читать далееАссистент на вопрос «где в Москве вылечить зуб» отвечает не ссылкой на поиск, а готовым списком клиник с адресами и ценами. Я прогнал 549 бытовых запросов через девять моделей, получил 4941 ответ и разметил в них 94 клиники. Конкретная клиника названа в 91,7% ответов. Имя бренда даёт лишь 8,7% упоминаний, всё остальное приносят страницы: одна клиника попала в ответы 1694 раза и ни разу не была названа по имени. Половина моделей в интернет вообще не заглядывает. Внутри разбор механики, таблицы по моделям и источникам и глава про то, где мой метод врёт.
Читать далееAI-сервисы, API и SaaS всё чаще переходят от фиксированной подписки к оплате за фактическое использование. Если клиент пользуется сервисом больше, он платит больше, если меньше — меньше. Такой подход кажется простым, пока не начинаешь внедрять его в реальном продукте. Здесь легко ошибиться и с самой тарифной логикой, и с учётом потребления. В статье собрала 10 ошибок, которые встречаются при внедрении pay as you go.
Читать далееLLM всё чаще становятся частью рабочего процесса разработчика, но вместе с ускорением приносят новую проблему: как понять, где ассистент действительно помогает, а где уверенно ведёт по ложному следу.
В статье разобрали опыт трёх месяцев работы с Claude: в каких задачах он экономит время, где начинает галлюцинировать и почему с генерацией кода всё сложнее.
Узнать подробнееВ прошлой статье я рассказывал, как добавил в Obsidian локальный семантический индекс. Сам проект развивается открыто, код лежит здесь:
GitHub: https://github.com/zinverno/obsidian-ai-hub
С тех пор semantic-слой заметно вырос. Появились автоматическая синхронизация индекса, Similar Notes и поиск потенциальных дублей. В какой-то момент стало понятно, что сам по себе семантический поиск решает только половину задачи.
Базовая схема у меня была такой:
Читать далее6 LLM‑судей, 4 лаборатории, 3 страны — а ошибки коррелируют: ρ̄ ≈ 0,42, эффективно 1,9 из 6.
В июле я писал, что консенсус шести LLM‑судей на RAGTruth бьёт любого одиночного судью. Это по‑прежнему верно. Но тогда я не проверил главного: сколько независимых голосов стоит за этим консенсусом. Оказалось — примерно два.
1,9 из 6
Посадите шесть разных инструктивных LLM судить одну задачу и выносить вердикт голосованием — интуиция подсказывает, что шесть моделей из четырёх лабораторий надёжнее одной: разные компании, архитектуры, страны, ошибки же должны быть независимыми.
Я это измерил. На публичном бенчмарке RAGTruth комитет из шести моделей несёт — по design‑effect приближению — примерно столько же независимой информации, сколько 1,9 независимого судьи из шести. Средняя попарная корреляция их ошибок ρ̄ ≈ 0,42.
Это не «1,9 судьи» в буквальном смысле — это эффективный размер: сколько независимых голосов реально стоит за шестью коррелированными. Разнообразие провайдеров не покупает независимость ошибок.
И вот вывод, который держится вообще без спора о точной цифре: ошибки шести судей скоррелированы достаточно, чтобы гарантии независимого голосования выродились. Теорема Кондорсе для коррелированных голосов не отменяется (Ладха, Боланд) — но её границы становятся куда слабее: шесть таких голосов работают как эффективные ~два. «1,9» лишь оценивает масштаб этого вырождения.
Весь метод, данные и пересчёт одной командой — в репозитории: https://github.com/itsjustmarsel/llm-judge-independence. Скрипт analyze.py пересчитывает ρ̄ и n_eff прямо из сохранённых вердиктов, без единого обращения к API.
Читать далееОказывается, если поработать с промптами и гейтами, то можно перевести большущий японо-английский словарь к виду японо-русского с очень неплохим качеством. Идея применима к другим языкам. Сделал пайплайн, запускал 100 Sol-воркеров-переводчиков одновременно через CLI. Вышло недорого.
Тут словарь, тут гитхаб с пайплайном, тут примеры статей.
Читать далееГенерация тест-кейсов — один из первых сценариев, с которых компании внедряют ИИ в тестирование. Отдаёшь модели требования или код — через несколько секунд получаешь готовый список проверок. Кажется, что рутину тест-дизайна можно закрыть промптом, а ручных тестировщиков — сократить.
Но тест-кейс — не синоним тестирования. Модель работает только с тем контекстом, что ей передали: не знает незафиксированные правила и может принять баг в коде за норму. Кейсов становится больше, а контроля качества — нет.
Разбираем, что ИИ реально снимает с QA, где создаёт лишь видимость покрытия и почему сгенерированный набор всё равно приходится проектировать и проверять человеку.
Где прячется ложное покрытие →За полгода я не написал руками ни одной строчки кода. При этом в проде — почти тысяча пользователей и первые 50 тысяч рублей. Днём я геймдизайнер в мобильной игре, вечером сажусь оперировать фермой агентов, которые пишут код вместо меня — и сами же его ревьюят и тестируют. Под катом честные цифры двух месяцев открытой беты: воронка, глубина сессий, деньги и пара мест, где агенты меня знатно подставили. А вы уж сами решите, вайбкодинг — это новая разработка или преступление против профессии.
Мне есть, что сказать...Привет, меня зовут Кристина Меликова, я учусь в онлайн-магистратуре ИТМО в партнёрстве с Яндексом на программе «Фронтенд и бэкенд-разработка» и работаю бэкенд-разработчиком в компании YADRO. До того, как пойти в сферу IT, я уже успела получить другое высшее образование, но решила переквалифицироваться. В статье расскажу, как проходит обучение в онлайн-магистратуре и как я совмещаю его с работой по специальности.
Читать далее2 декабря 1971 года советский аппарат «Марс‑3» прошёл сквозь глобальную пылевую бурю и совершил первую мягкую посадку на Марс. Затем он заговорил — и уже более полувека мы спорим, что именно он успел передать и почему замолчал, не сказав главного.
Краткое содержание (TL;DR): У СССР была полноценная и амбициозная программа исследования Марса, но череда аварий, закрытость исходных данных и слабая публичная подача частичных успехов почти вытеснили её из общественной памяти. Ни одна экспедиция не выполнила всю программу, однако советские аппараты достигли Марса, вышли на его орбиту и совершили первую мягкую посадку. Более того, современная обработка сигнала «Марса‑3» допускает, что он может содержать первое изображение марсианского грунта, которое в 1971 году приняли за помехи. Статья рассказывает об этой драматичной истории и предлагает представить, что произошло бы, если бы «Марс‑3» успел передать полную панораму.
От автора: К истории космонавтики у меня особое отношение. Я провёл детство в Советском Союзе, читал в журнале «Наука и жизнь» публикации об экспедиции «Вега» и американских «Викингах», размышлял об интерпретации их биологических экспериментов, с замиранием сердца следил за полётами «Фобоса‑1» и «Фобоса‑2» и собирал посвящённые им газетные вырезки. Я до сих пор помню, как плакал, когда в новостях сообщили, что экспедиция завершилась неудачей на последнем этапе, а потом не мог объяснить друзьям, почему воспринимал произошедшее как настоящую трагедию.
Экспедиция СССР к Марсу 1971 года состоялась немного раньше моего времени, но её история всегда поражала меня талантом и упорством создавших её учёных и инженеров. В детстве я долго размышлял о том, что могло скрываться в таинственном сигнале «Марса‑3». Удивительно спустя примерно 35 лет найти возможные ответы на вопросы, которыми я задавался ещё ребёнком. Собственно, именно об этом эта статья.
Читать далееЯ измеряю видимость компаний в поиске и в ответах нейросетей. Свой сайт проверил последним: клиентские проекты всегда впереди своих. Результат отрезвляющий — все страниц есть в поиске, проблем с индексацией нет, а в вопросах про услугу без упоминания названия ноль появлений из тридцати двух возможных.
Внутри: как собрать промпт-карту и почему её нельзя писать до замера спроса, чем российский стек отличается от западного, отдельная директива в robots.txt, о которой мало кто знает, и во что обошёлся весь замер — 102 рубля.
Читать далееУже лет 10 я пользуюсь Everything от VoidTools, и наслаждаюсь. Вся навигация в машине - поиск - только через него. Единственное что он не умеет делать быстро - искать в файлах по содержимому.
Не в первый раз недавно посмотрел на DocFetcher, и стал он вдруг “LocalInet feat DocFetcher”.
Первый подход к локальному поиску на индексаторах я делал 10 лет назад. Нашел тогда на торрентах DtSearch, СopernicDesktopSearch, YandexDesktop, DVYGUN Smart Search, потестил многое, но ничего нормально не работало. DtSearch и YandexDesktop были лучшими, но кряков не хотелось, и даже DtSearch был не очень стабильным, а YandexDesktop был очень быстр и бесплатен, но был нестабильным совсем, и был яндексом заброшен. Что значит не очень стабильным ? Оказалось, в рабочем архиве у меня 5 млн. файлов) А все хранилище целиком потянет на 10-15( Ни один индексатор не мог собрать индекс(
Полгода назад по случаю вайбкодил поисковые питон скрипты, и обратил внимание, что одного поиска мне мало: их должно быть два: Один поиск ищет последовательность key1 key2 key3, в порядке строго 123, и ключи там строго фиксированные. Это поиск программиста, когда он ищет кусок в программе.
И второй поиск, те же самые key1 key2 key3 - но тут ключи в произвольном порядке, важна лишь дистанция между ними. Она должна быть небольшой, чтобы гарантировать, что ключи относятся друг к другу, тогда в этом куске текста весьма вероятно будет то что нужно. При этом и ключи и индекс должны быть стеммизированные, те, поиск должен искать корни слов, а всякие окончания должны быть отрезаны. Иначе много нужных match потеряется. Этот второй поиск - поиск в книге.
Читать далееНесменяемые элиты, когерентное сознание и эксперимент Quantum Icebreaker
Раздел 1. Футурологический тупик: биологическое долголетие, монополия элит и риск вечной стагнации
1.1. Последний биологический ограничитель власти
В истории человечества существовал один ограничитель власти, который не зависел ни от конституций, ни от качества институтов, ни от доброй воли самого правителя.
Можно было уничтожить политических противников, изменить законы, поставить под контроль армию, суды и информационное пространство. Можно было создать династию и передать наследникам имущество, связи и влияние. Но существовало обстоятельство, с которым не могла справиться ни одна политическая система: естественный биологический предел человеческой жизни.
Смерть правителя сама по себе, конечно, никогда не гарантировала свободы. Иногда одного деспота сменял другой. Иногда политическая конструкция переживала своего создателя практически без изменений. И всё же происходило нечто фундаментальное: менялись люди. Возникала необходимость заново распределять влияние, заключать союзы, договариваться с новыми группами, приспосабливаться к новому поколению. Даже самая закрытая политическая система не могла полностью остановить эту ротацию.
В этом смысле биология выполняла странную, но важную функцию системного предохранителя.
Она не обеспечивала прогресс. Она лишь не позволяла одному человеку удерживать историческое время в своих руках бесконечно.
Известную мысль Макса Планка о том, что новые научные идеи часто побеждают не потому, что удаётся убедить их противников, а потому, что меняются поколения, можно с определённой осторожностью перенести и на политику.
Читать далееГод назад мой типичный пулл-реквест писался руками часа три и ревьюился минут двадцать. Сейчас четыреста строк агент выдаёт за минуту, а ревью того же дифа занимает час: приходится вычитывать уверенно написанный чужой код, в котором ошибка выглядит ровно так же убедительно, как правильное решение. Узкое место переехало с набора кода на его проверку, и усилием воли оно не расширяется.
В августе у Google вышел текст о том, почему Go хорошо подходит для разработки с агентами. С тезисами спорить трудно: единый форматтер, быстрая компиляция, строгий компилятор, большая стандартная библиотека, обещание совместимости. Беда в том, что из этих тезисов не следует ни одной строчки конфига. Хорошие свойства языка сами по себе не мешают агенту сдать диф, который собирается, проходит тесты и при этом делает совсем другое.
Дальше о том, как довести идею до инженерного состояния. Почему форма сообщения об ошибке влияет на исход правки сильнее, чем формулировка промпта. Какие поломки Go пропускает молча и чем их ловить. Как за полчаса написать свой анализатор, превращающий договорённость команды в ошибку сборки. И чем закончились попытки закрыть тот же вопрос документом AGENTS.md. Всё обкатано на монорепозитории примерно на сто восемьдесят тысяч строк, где за последний квартал около половины дифов написал агент.
Читать далееЯ нечасто работаю с IT компаниями, но 6 моих IT компаний-клиентов, да и общая информация об IT позволила мне сложить впечатление, что люди в IT отличаются от других.
В IT больше Синих людей по классификации Клера Грейвса, то есть людей склонных к более аналитической деятельности и восприятию мира через факты, но не через эмоции. При этом у них есть свои особенности с коммуникациями; они лучше общаются письменно и не готовы общаться с незнакомыми людьми не по делу.
Для меня это было очевидно, да и для многих тоже, именно поэтому я так удивился, когда тут на linkedin прочитал пост о том, что senior'а чуть не уволили из компании так как у него были проблемы с внешней коммуникацией. Его даже назвали senior со звездочкой, типа с проблемой.
И у меня тут возникает два вопроса.
Первый вопрос: кто эти руководители в IT, которые оценивают senior по коммукативным навыкам выше его профессиональных навыков, что готовы были уволить такого сотрудника, который в условиях, когда его не гнобили за плохое общение, показал выдающиеся результаты, потому что ему наконец-то дали возможность работать.
И второй вопрос. Какой смысл развивать в сотруднике то, что у него не является принципиально важным для работы, в ущерб развития наиболее перспективных качеств, где он реально может быть эффективным.
Стратегия Голубого океана как раз заключается в развитии сильных качеств, при этом про слабые качества просто знают и учитывают, без попытки их изменить.
Стратегия Голубого океана отлично работает для бизнеса, почему не использовать её идею и для людей.
#it #бизнес
Дисклеймер: я люблю людей и свою карму. И не считаю, что всех нужно заменять ИИ.
Всем привет! Меня зовут Миша Шумовский, я главред Нейромедиа — нового медиа про нейросети. На запуске у нас была задачка: наладить регулярный выпуск новостей, чтобы получать дополнительный поисковый трафик. Нанимать под это отдельного человека не хотелось: такая работа стоит недорого, но для молодого медиа важна каждая копеечка. Да и как будто в медиа про нейросети часть процессов точно должна быть автоматизирована, иначе зачем все это.
Поэтому я поковырялся и с нуля собрал себе парсер новостей в виде Telegram-бота — при том, что программировать не умею. Теперь каждые 15 минут бот сам обходит нужные сайты, отбирает важное, пишет нормальный текст новости на русском и присылает мне в телегу. Мне остается нажать одну кнопку. Давайте расскажу, как я такой сервис сделал.
Читать далее