STORM от Стэнфорда: исследование уровня PhD за 5 минут

Коротко: STORM - система Стэнфордской лаборатории OVAL, которая генерирует исследовательские статьи на уровне PhD: на рецензируемых тестах её результаты оказались на 25% структурированнее и на 10% шире по охвату темы, чем у конкурентов. Логику системы можно воспроизвести четырьмя промптами прямо в Claude - без установки кода и без GitHub. Живую версию можно бесплатно попробовать на storm.genie.stanford.edu.

Содержание
  1. Стэнфордский метод STORM: как заставить Claude вести исследование на уровне PhD за пять минут
  2. Что такое STORM и зачем это вам
  3. Почему один промпт всегда проигрывает
  4. Шаг 1. Многоперспективное сканирование
  5. Шаг 2. Карта противоречий
  6. Шаг 3. Синтез в исследовательский бриф
  7. Шаг 4. Саморецензия
  8. Где применять прямо сейчас
  9. Частые вопросы

Стэнфордский метод STORM: как заставить Claude вести исследование на уровне PhD за пять минут

Стэнфордский метод STORM: как заставить Claude вести исследование на уровне PhD за пять минут Скриншот: vc.ru

Стэнфордская лаборатория OVAL опубликовала на NAACL 2024 систему STORM, которая на рецензируемых тестах давала статьи на 25% структурированнее конкурентов и на 10% шире по охвату темы. Главное: ту же логику воспроизводят четырьмя промптами прямо в Claude, без установки кода и без GitHub.

Что такое STORM и зачем это вам

STORM расшифровывается как Synthesis of Topic Outlines through Retrieval and Multi-perspective Question Asking. Живую версию можно попробовать на storm.genie.stanford.edu, бесплатно и без регистрации. Полный код лежит на github.com/stanford-oval/storm под лицензией MIT.

Но устанавливать ничего не нужно. Метод по сути является способом мышления: смотреть на тему с пяти разных углов одновременно, сталкивать их между собой и потом собирать в связный вывод. Именно так работает хороший аспирант. Разница в том, что аспиранту нужно 40-60 часов чтения, а Claude делает это за пять минут.

Почему один промпт всегда проигрывает

Когда вы просто спрашиваете Claude о теме, вы получаете самую частую трактовку. Поверхность. Вы не получаете взгляд практика, который работает с этим каждый день. Не получаете скептика, который считает всю область ошибкой. Не получаете экономиста, который следит за деньгами, или историка, который уже видел похожие закономерности.

Эти голоса замечают разные вещи. Стэнфордская работа подтвердила это цифрами: многоперспективные вопросы ловят слепые зоны, которые одиночный запрос никогда не видит.

Шаг 1. Многоперспективное сканирование

Первый промпт, он же сердце метода. Просите Claude смоделировать пять экспертных точек зрения по вашей теме:

По каждой перспективе просите: ключевую позицию в двух предложениях, сильнейший аргумент в её пользу, одну мысль, которую не даст ни один другой взгляд.

На выходе пять совершенно разных прочтений одной темы. Занимает около минуты.

Шаг 2. Карта противоречий

Теперь заставляете Claude найти, где эти пять голосов спорят. Именно в столкновениях живёт настоящее понимание. Просите показать:

Последний пункт особенно ценен. Если все пять согласны, это скорее всего правда. Если никто не затронул какую-то тему, вы только что нашли пробел во всей области.

Шаг 3. Синтез в исследовательский бриф

Третий промпт собирает всё вместе. Просите Claude написать:

Такой бриф не напишет ни один отдельный эксперт, потому что он видит только свой угол. Claude видит все пять сразу.

Шаг 4. Саморецензия

У STORM есть известная слабость, которую признали сами стэнфордские исследователи: система не критикует себя, поэтому в неё проникают смещения источников и ложные связи. Четвёртый промпт закрывает эту дыру.

Просите Claude оценить надёжность каждого вывода по десятибалльной шкале, назвать самое слабое утверждение, проверить, не доминирует ли один голос над остальными, указать на недостающую шестую перспективу и поставить итоговую оценку всему исследованию.

На выходе честный разбор собственной работы. Это то, чего большинство аналитиков себе не позволяют.

Где применять прямо сейчас

Четыре промпта дают реальный результат в конкретных ситуациях:

Перед написанием статьи или отчёта. Прогоните метод, и текст охватит углы, о которых остальные не подумали. Особенно полезно, если тема спорная.

Перед крупным решением. Собрать все пять взглядов и увидеть, что работает на практике, что может пойти не так и кому выгодна текущая картина, это уже полноценный due diligence.

Перед переговорами. Вы заранее знаете возражения другой стороны и входите в комнату подготовленнее всех.

При изучении нового навыка. Разложить область на пять ракурсов и понять, что учить в первую очередь, а что переоценено.

Если вы работаете с корпоративными знаниями, встречами и документами в команде, стоит посмотреть на ENGRAM: российский инструмент, который фиксирует и структурирует информацию из встреч и документов так, чтобы потом с ней можно было работать именно такими методами.

Про то, как строить запросы к моделям грамотно, есть отдельный гайд по промпт-инжинирингу, а сравнить, какие модели подойдут для исследовательских задач, можно в каталоге LLM-моделей.

Частые вопросы

Работает ли это с другими моделями, не только с Claude?

Работает с любой достаточно мощной языковой моделью: GPT-4o, Gemini 1.5 Pro, GigaChat Pro. Стэнфордская система STORM в оригинале использует GPT-4. Принцип не привязан к конкретной модели, он привязан к структуре запросов. Claude удобен тем, что хорошо держит контекст длинного многошагового диалога, но логика четырёх промптов воспроизводится везде.

Чем это отличается от обычного «напиши мне аналитику по теме X»?

Обычный запрос даёт одну точку зрения, самую распространённую. STORM намеренно создаёт противоречие между пятью разными позициями и потом синтезирует их. Разница примерно как между одним свидетелем события и пятью с разных сторон улицы. Плюс четвёртый шаг с саморецензией добавляет то, чего в обычном ответе нет вообще: оценку надёжности собственных выводов.

Нужно ли устанавливать что-то или платить за доступ к STORM?

Нет. Живая версия на storm.genie.stanford.edu бесплатна и не требует регистрации. Код на GitHub под лицензией MIT, то есть бесплатен и для коммерческого использования. Четыре промпта в Claude работают в рамках обычного доступа к модели, дополнительных инструментов не нужно.

Мнение редакции ENGRAM

Рекомендуем начинать не с живого storm.genie.stanford.edu, а сразу с четырёх промптов в той модели, которая у вас уже подключена: GPT-4o через OpenAI API, GigaChat Pro или Gemini через VPN - принцип работает везде, установка не нужна. На нашем опыте самый ценный шаг - четвёртый, саморецензия: именно он отсекает галлюцинации и перекос в сторону одной перспективы, что критично, если результат идёт в отчёт или на стол руководителю. Если исследование ведётся командой и нужно сохранять и переиспользовать такие брифы внутри компании, данные остаются в российском контуре без вопросов по 152-ФЗ - это отдельный аргумент в пользу хранить структурированные выводы в специализированном инструменте, а не в чате модели.

ENGRAM решает это

Знания и наработки команды теряются в переписке. ENGRAM собирает их в единую ИИ-память с поиском по смыслу - данные остаются в России.

Читайте также