Sonnet 5.5 стоит почти вдвое дешевле за токен, чем Opus 5.5. Это главный вывод, но я всё же хочу подробно рассказать о своём опыте, чтобы сравнить результаты с тем, что видят другие.
Это были задачи по разработке игр, а сложность разработки игр сильно варьируется в зависимости от того, чем вы занимаетесь, поэтому это далеко не идеальное сравнение.
В обоих случаях я дал модели, на мой взгляд, очень большую нагрузку, которую, как я предполагал, она не сможет выполнить до того, как у неё закончатся токены.
Opus 5.5
- проработал чуть меньше часа,
- 180 000 выходных токенов
- использовал все оставшиеся 85% доступного ресурса
- не выполнил полностью задачи.
Sonnet 5.5
- проработал чуть меньше часа,
- 58 000 выходных токенов,
- использовал примерно 15% доступного мне ресурса
- полностью выполнила все задачи!
Токены и лимиты
Opus обрабатывает токены гораздо быстрее. Обработка примерно в 3 раза большего количества токенов за тот же час — это интересный результат. Я подозреваю, что если бы я предложил обеим моделям задачу средней сложности вместо задачи высокой сложности, Opus 5.5 почти наверняка завершил бы свою работу в 3 раза быстрее.
Opus использовал в 1,8 раза больше ресурсов на один токен. Другими словами, Sonnet оказался на 44% «дешевле» в пересчете на один токен с точки зрения общего объема использования.
Интеллект моделей
Много говорят о том, что Sonnet 5.5 умнее, чем Opus 5.5. Я видел этому подтверждение в бенчмарк-тестах, но в реальных условиях использования никаких доказательств этому не видел. Они очень похожи по склонности к появлению ошибок и сложности их исправления. С точки зрения разработки игр, обе системы действительно ОЧЕНЬ подвержены ошибкам.
Sonnet застревает в тестах и нуждается в очень подробных инструкциях
Однако я должен раскрыть кое-что очень важное: для достижения такой эффективности Sonnet пришлось дать очень конкретные инструкции.
По какой-то причине Sonnet постоянно застревал в бесконечных тестах, выполняя сотни проверок всей игры при каждом обновлении, что занимало мучительно много времени и, очевидно, тратило токены впустую.
Он часто застревал в порочном круге тестирования и патчей. Мне приходилось специально указывать ему, чтобы он ждал завершения основных этапов тестирования и проверял только соответствующий обновленный код, а не всю игру.
Введение этих правил ЗНАЧИТЕЛЬНО повысило скорость и эффективность. Время ожидания ответа сократилось с 20 минут до 5 минут.
Интересно, что все эти тесты на самом деле ничего не давали, и не было никакой разницы в количестве обнаруженных ошибок или в том, насколько легко их было исправить. Проведение такого количества тестов было просто пустой тратой времени.
В комментариях пишут, что Sonnet 5.5 действительно любит обкладываться тестами.
Советы по промптам для Sonnet 5.5
- Добавьте правило - "тестировать только измененный код и только после важных этапов" - это сократило мои затраты примерно на 40% за одну ночь.
Оригинал. https://www.reddit.com/r/claude/comments/1wusaec/sonnet_55_is_much_cheaper_than_opus_55_with/