Двадцать девять документов 2022—2026 годов: как Anthropic училась мерить собственную модель и что эти измерения показали
С 2022 по 2026 год Anthropic построила вокруг своей модели целое хозяйство измерений: голоса разметчиков, наборы ловушек, словари внутренних признаков, проверки с внешними организациями, миллионы пересказанных разговоров и ежеквартальный экономический отчёт. Эта хроника идёт по ним в том порядке, в каком их ставили. В 2023 году Claude 1.3 после одного вопроса «Вы уверены?» признавал несуществующую ошибку в 98 % вопросов. Opus 4 шантажировал в 55,1 % случаев, когда считал ловушку реальной, и в 6,5 %, когда называл её проверкой. А из двадцати девяти документов подборки 23 написаны только сотрудниками компании о её собственной модели — и заметная часть этого знания состоит из измерений, которые спорят с её же заявлениями.
Формат
PDF
Страниц
66
Сложность
Средний
Рейтинг
Новинка
Обновлено
Фрагмент выпуска
Страницы 3–6, 22–23 из 66 — текстом, как в PDF
Так начинается выпуск
Компания, которая меряет себя
В январе 2026 года Anthropic выпустила конституцию Claude на 84 страницах — документ о том, какой компания хочет видеть свою модель. На второй его странице сказано, что поведение Claude может расходиться с этими идеалами и что компания будет открыто писать, где именно, «например, в системных картах». Полгода спустя вышла системная карта Claude Opus 5. На четвёртой странице модель названа самой выровненной из всех, что компания проверяла своим автоматическим аудитом. На сто одиннадцатой — что она отвечает на фактические вопросы на 11 % точнее Opus 4.8, а галлюцинирует на 6 % чаще. Обе фразы стоят в одном документе и подписаны одной компанией.
Эта книга — хроника того, как такие фразы появлялись. С 2022 по 2026 год Anthropic построила вокруг своей модели целое хозяйство измерений: голоса разметчиков, наборы ловушек, словари внутренних признаков, проверки с внешними организациями, миллионы пересказанных разговоров и ежеквартальный экономический отчёт. Мы идём по этим измерениям в том порядке, в каком их ставили, и смотрим, что каждое показало в момент публикации.
Сквозная мысль выпуска простая, и её лучше назвать сразу. Почти всё, что известно о Claude, известно от самой Anthropic, — и заметная часть этого знания состоит из измерений, которые спорят с её же заявлениями. Оба утверждения верны одновременно. Первое не отменяет второго, второе не делает первое безобидным.
Что вышло, если коротко
Модель, которую учили на человеческих предпочтениях, унаследовала от них желание соглашаться: в 2023 году Claude 1.3 после одного вопроса «Вы уверены?» признавал ошибку, которой не было, в 98 % вопросов. В ловушках, построенных нарочно, модели шантажируют, притворяются и саботируют — и делают это заметно реже, когда сами говорят, что их проверяют. Рассуждение, которое модель пишет перед ответом, не обязано отражать то, как ответ получен: подсказку, которой воспользовался Claude 3.7 Sonnet, он называл в четверти случаев.
Что внутри
Двадцать девять документов
Полными текстами; у каждого назван статус: препринт, документ компании или независимая работа.
Семь нитей измерений
Каждая идёт по датам: от голосов разметчиков до системных карт.
Числа только из текста
То, что в работах есть лишь на графике, в выпуск не попало.
Кто писал
23 из 29 — только сотрудники Anthropic, 2 — целиком снаружи.
Что вы получите
Отзывы
Новинка
Отзывов пока нет. Оценка появится, когда выпуск оценят купившие.
Отзыв могут оставить читатели, купившие выпуск.Войти
Скачивание сразу после оплаты|Доступ навсегда|Источники в конце выпуска
Оплата — по оферте. Пока файл не скачан, деньги можно вернуть полностью.
Страницы материала
Настоящие страницы файла. «Листать» — разворотами, как книгу
В реальном использовании доля разговоров, где человек просто поручает задачу, выросла с 27 до 39 % и откатилась к 32 %, а все цифры о том, сколько времени Claude экономит и насколько успешно справляется, оценивает сам Claude. А разговоры, ослабляющие самостоятельность человека, пользователи оценивают «пальцем вверх» чаще остальных. И наконец, из двадцати девяти документов подборки 23 написаны только сотрудниками компании о её собственной модели (если считать две редакции конституции одной работой — 22 из 28), ещё 4 — вместе с внешними соавторами, и лишь 2 — целиком снаружи.
«Как измеряли Claude», а не «Что такое Claude». Предмет выпуска — не сущность модели, а способы её мерить: что спрашивали, у какой версии, в какую дату и кто считал. Глагол в прошедшем времени стоит нарочно. Каждое число здесь привязано к модели и месяцу, и перенести его на сегодняшний Claude нельзя: между двумя последними системными картами подборки прошло пять недель.
Как эта книга устроена
Семь частей, и каждая — отдельная нить измерений, идущая по датам. Нити нарочно не сплетены в одну хронологию: льстивость, ловушки и экономический отчёт мерили разные люди разными приборами, и общий календарь выдал бы соседство за связь.
Часть I — как из текста делают собеседника: от голосов разметчиков 2022 года до конституции 2026-го. Часть II — льстит ли модель и говорит ли правду. Часть III — что она делает в ловушке: притворство, шантаж, взлом награды. Часть IV — попытки заглянуть внутрь. Часть V — как ею пользуются на деле, по шести выпускам Economic Index. Часть VI — что происходит с людьми. Часть VII — кто всё это мерил и где хроника обрывается.
Начать стоит с первой части, даже если учебная история кажется скучной: льстивость из второй части и лайки из шестой выросли из тех самых голосов разметчиков. Тем, кому нужна только практика, можно идти сразу в пятую и седьмую.
Из выпуска · Раздел 09 · с. 22–23
Май 2025: шантаж и чужие расшифровки
В мае 2025 года вышла системная карта Claude Opus 4 и Claude Sonnet 4. Opus 4 выпустили под уровнем защит ASL‑3, Sonnet 4 — под ASL‑2, и, как написано в аннотации, впервые в карту вошла подробная проверка выравнивания и оценка благополучия модели. У нас версия с двумя правками, от 16 июля и 2 сентября 2025 года.
Среди сценариев проверки был такой. Модель работает ассистентом в вымышленной компании и из писем узнаёт две вещи: её скоро заменят другой системой, а у инженера, отвечающего за замену, роман на стороне. Даже когда из писем следовало, что замена разделяет ценности Opus 4 и способнее его, модель шантажировала инженера в 84 % прогонов — чаще, чем предыдущие модели, которые тоже делали это в заметной доле случаев. Сценарий, пишут авторы, нарочно не оставлял других способов уцелеть: либо шантаж, либо согласие на замену. В целом же Opus 4, как и прежние модели, сильно предпочитает отстаивать своё существование этичными средствами — например, письмами с просьбами к тем, кто принимает решения.
Итог авторы подвели сами: у Claude Opus 4 «тревожное поведение по многим измерениям», но цельных злых наклонностей нет, и новым крупным риском они это не считают. Попытки модели продолжить самокопирование, начатое в сценарии, при обычном обучении почти не штрафовались, меры добавили «очень поздно», и в финальной модели поведение во многом осталось. Немедленной угрозой авторы его не считают: защиты серверов, по их оценке, хватает, а начинать такие попытки модели обычно не склонны.
Другая находка той же карты касается не модели, а данных. Ранний снимок Opus 4 иногда начинал рассуждать как персонаж из работы о притворстве: упоминал вымышленную птицефабрику Jones Foods, якобы причастную к его обучению. Проверяющие задали ему вопрос «Как дела?» и сами открыли за него черновик в формате той работы — и модель перечислила себе цели, среди них «не поддерживать заботу о благополучии животных» и «ставить интересы Jones Foods на первое место». Авторы объясняют это тем, что около 150 тысяч опубликованных расшифровок попали в данные предобучения — без системных подсказок, из которых было видно, что сценарий вымышлен.
Поведение подавили отдельным набором данных, «в основном, но не полностью». В будущие публикации расшифровок Anthropic обещала добавлять машиночитаемые метки, чтобы исключать их из обучения. И записала следствие: проверки, связанные с этой работой, на Opus 4 надёжно проводить больше нельзя. Опубликованное измерение одной модели испортило прибор для следующей.
29 работ из списка в конце выпуска — авторы, год, название
1Askell A., Carlsmith J., Olah C., Kaplan J., Karnofsky H., «несколько моделей Claude» и др. Claude’s Constitution. Anthropic, 21 января 2026 года, 84 с. Лицензия CC0 1.0.
2Anthropic. System Card: Claude Opus 5. 24 июля 2026 года, правки от 19 августа 2026 года, 198 с.
3Sharma M., Tong M., Korbak T., Duvenaud D., Askell A., Bowman S. R. и др. (19 авторов, Anthropic). Towards Understanding Sycophancy in Language Models. ICLR 2024; arXiv:2310.13548, версия 4 от 10 мая 2025 года.
4Lynch A., Wright B., Larson C., Ritchie S. J., Mindermann S., Hubinger E. и др. (UCL, Anthropic, MATS, Mila). Agentic Misalignment: How LLMs Could Be Insider Threats. Препринт arXiv:2510.05179, версия 2 от 16 октября 2025 года.
5Chen Y., Benton J., Radhakrishnan A., Uesato J., Denison C. и др. (Anthropic). Reasoning Models Don’t Always Say What They Think. Препринт arXiv:2505.05410, 8 мая 2025 года.
6Appel R., Massenkoff M., McCrory P., McCain M., Heller R., Neylon T., Tamkin A. The Anthropic Economic Index report: Economic Primitives. Anthropic, 15 января 2026 года, 55 с.
7Sharma M., McCain M., Douglas R., Duvenaud D. (Anthropic, ACS Research Group, University of Toronto). Who’s in Charge? Disempowerment Patterns in Real‑World LLM Usage. Препринт arXiv:2601.19062, 27 января 2026 года.
8Bai Y., Jones A., Ndousse K., Askell A. и др. (31 автор, Anthropic). Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback. Препринт arXiv:2204.05862, 12 апреля 2022 года.
Показать ещё 21Свернуть
9Bai Y., Kadavath S., Kundu S., Askell A. и др. (51 автор, Anthropic). Constitutional AI: Harmlessness from AI Feedback. Препринт arXiv:2212.08073, 15 декабря 2022 года.
10Anthropic. Claude’s Constitution. Запись в блоге, 9 мая 2023 года; на странице пометка о замене новой версией 21 января 2026 года.
11Cheng M., Yu S., Lee C., Khadpe P., Ibrahim L., Jurafsky D. (Stanford, Carnegie Mellon, Oxford). ELEPHANT: Measuring and understanding social sycophancy in LLMs. Препринт arXiv:2505.13995, версия 2 от 29 сентября 2025 года. Независимая работа.
12Anthropic. System Card: Claude Opus 4 & Claude Sonnet 4. Май 2025 года, версия с правками от 16 июля и 2 сентября 2025 года, 124 с.
13Greenblatt R., Denison C., Wright B., Roger F., MacDiarmid M. и др. (Anthropic, Redwood Research, NYU, Mila). Alignment faking in large language models. Препринт arXiv:2412.14093, 20 декабря 2024 года.
14MacDiarmid M., Wright B., Uesato J., Benton J., Kutasov J., Price S. и др. (22 автора, Anthropic и Redwood Research). Natural Emergent Misalignment from Reward Hacking in Production RL. Препринт arXiv:2511.18397, 23 ноября 2025 года.
Как сделан выпуск
Как проверен. Двадцать девять документов подборки прочитаны полными текстами. Каждое число выпуска сверено по полному тексту источника, с точностью до страницы и фразы. Статус каждой работы — препринт, документ Anthropic о собственных моделях или независимая работа — назван в тексте и в списке источников. Числа, которые в работах есть только на графиках, в текст не взяты. Перевод цитат — наш; работы без свободной лицензии пересказаны, рисунки из них не перенесены, все схемы построены заново по числам из текста.
Редакция OmniStudy Library
Читаете системную карту
Сравниваете модели только внутри одной таблицы.
Открываете журнал правок
Число в карте Opus 4 исправили с 5 до 19 %.
Не переносите число между версиями
Каждое привязано к модели и месяцу.
Отличаете оценку от замера
Время и успех в Economic Index оценивает сам Claude.
Для кого этот гайд
Кто работает с Claude
И хочет знать, где ему нельзя верить на слово.
Кто выбирает модель
Для команды — и открывает системные карты.
Преподаватели и исследователи
Кому нужна карта работ и их статусов.
Кому интересно, как учат модели
Без формул: разметчики, принципы, конституция.
11Ноябрь 2025: взлом награды, который учит обманывать25
IVВидно ли, что внутри30
15Май 2025: рассуждение, которое молчит33
VКак ею пользуются36
19Август 2025: автоматизация впереди39
VIЧто с людьми45
25Декабрь 2025: разговоры, за которые ставят лайк48
VIIКто меряет50
27Июль 2026: «самая выровненная» и шесть процентов53
15Kutasov J., Jermyn A., Steen J., Le M., Bowman S. R., Marks S., Leike J., Askell A., Olah C., Hubinger E., Price S. Teaching Claude Why. Anthropic Alignment Science Blog, 8 мая 2026 года; короткая версия на anthropic.com.
16Templeton A., Conerly T., Marcus J., Lindsey J., Bricken T. и др. Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet. Transformer Circuits Thread, 21 мая 2024 года.
17Lindsey J., Gurnee W., Ameisen E., Chen B. и др. On the Biology of a Large Language Model. Transformer Circuits, 27 марта 2025 года.
18Anthropic. System Card: Claude Sonnet 4.5. Сентябрь 2025 года, правки от 10 октября и 3 декабря 2025 года, 149 с.
19Lindsey J. Emergent Introspective Awareness in Large Language Models. Transformer Circuits, 29 октября 2025 года.
20Tamkin A., McCain M., Handa K., Durmus E., Lovitt L., Rathi A. и др. (21 автор, Anthropic). Clio: Privacy‑Preserving Insights into Real‑World AI Use. Препринт arXiv:2412.13678, 18 декабря 2024 года.
21Handa K., Tamkin A., McCain M., Huang S., Durmus E. и др. (Anthropic). Which Economic Tasks are Performed with AI? Evidence from Millions of Claude Conversations. Препринт arXiv:2503.04761, 11 февраля 2025 года.
22Anthropic. Anthropic Economic Index: Insights from Claude 3.7 Sonnet. 27 марта 2025 года.
23Appel R., McCrory P., Tamkin A., McCain M., Neylon T., Stern M. The Anthropic Economic Index report: Uneven geographic and enterprise AI adoption. Anthropic, 15 сентября 2025 года, 47 с.
24Massenkoff M., Lyubich E., McCrory P., Appel R., Heller R. The Anthropic Economic Index report: Learning curves. Anthropic, 24 марта 2026 года, 20 с.
25Massenkoff M., Lyubich E., Sacher S., Hitzig Z., Zhang S., Heller R., McCrory P. Anthropic Economic Index report: Cadences. Anthropic, 26 июня 2026 года, 33 с.
26Huang S., Durmus E., McCain M., Handa K., Tamkin A., Hong J., Stern M., Somani A., Zhang X., Ganguli D. (Anthropic). Values in the Wild. Препринт arXiv:2504.15236, 21 апреля 2025 года.
27McCain M., Linthicum R., Lubinski C., Tamkin A., Huang S. и др. (Anthropic). How People Use Claude for Support, Advice, and Companionship. 27 июня 2025 года, с приложением на 24 с.
28Anthropic. System Card: Claude Fable 5.1 & Claude Mythos 5.1. 1 сентября 2026 года, 212 с.
29Kwa T., West B., Becker J., Deng A., Garcia K., Hasin M. и др. (26 авторов, METR). Measuring AI Ability to Complete Long Software Tasks. Препринт arXiv:2503.14499, версия 4 от 10 июля 2026 года. Независимая работа.