Я пользуюсь Codex уже много лет, ещё со времён GPT-3.5. Я использовал GPT-4, 5, 5.1, 5.2, и всегда был на подписке за 200-100 долларов.
Astra была для меня потрясающей моделью, но в последнее время она уже не та, что была при первом запуске. Поэтому я решил переключиться на Sol 6.1, в основном на низкий/средний уровень сложности, а иногда и на высокий/очень высокий.
Я протестировал практически всё. Свою собственную кастомную систему, другие кастомные системы, навыки Patpock, хвостик, разные конфигурации... Я пробовал модель в агентах Pi, OpenCode и самом Codex. Честно говоря, я понятия не имею, сколько часов я потратил на тестирование различных настроек.
Поэтому в этот понедельник я решил попробовать самую дешевую подписку на Claude от Anthropic. (о, я тоже на ней сижу - прим. kvisaz)
И, ребята, мне жаль это говорить, но даже Haiku 5.5 High показывает лучшие результаты, чем Sol 6.1 Low в моих тестах.
Я провел несколько сравнений, используя одни и те же подсказки и задания.
Например, Sol 6.1 Low начинал создавать избыточные функции, несмотря на четкие инструкции по его использованию, предписывающие этого избегать. Он создавал ненужные функции, игнорировал соглашения проекта, а иногда и вовсе игнорировал мой файл AGENTS.md.
Один конкретный пример: в моём файле AGENTS.md явно указано, что проект должен использовать Microsoft C++ Build Tools версии 145 и ISO C++14. Однако Sol решил использовать C++20 самостоятельно. Почему? Понятия не имею.
(примечание от kvisaz: это совпадает с моими ощущениями - модели OpenAi очень своевольны в текущей версии, а Claude модели работают с меньшим хаосом - хотя весной 2026 все было наоборот)
Между тем, Haiku 5.5 и Sonnet 5.5 практически с первого раза справляются со всем, что я им предлагаю. Те же задания, те же подсказки, но требуется гораздо меньше вмешательства.
И это меня больше всего расстраивает.
Жаль видеть, в каком направлении, похоже, движется OpenAI с Codex. Случайные сбросы, уменьшенные квоты, и теперь, кажется, заметное изменение в поведении модели.
Я не хочу строить предположения о том, что происходит за кулисами. Названия моделей не изменились, мы по-прежнему говорим о Sol 6.1 и Astra. Но что-то в процессе обдумывания кажется другим.
Когда Sol 6.1 только вышел, среднее время ожидания для подобных задач составляло около 5–25 минут. Сейчас оно сократилось до 3–10 минут, а результат заметно ухудшился.
Конечно, чем быстрее, тем хуже, и я не могу доказать, что что-то изменилось внутри. Я просто делюсь тем, что постоянно наблюдаю.
Я даже не знаю, что еще сказать. Просто хотела поделиться своим опытом.
И я не жалуюсь ради жалоб. Я действительно потратил невероятное количество времени на тестирование этого перед тем, как написать этот пост.
Самое большое отличие для меня сейчас заключается в простом принципе: с Codex мне приходится перепроверять всё, что он пишет. С моделями Anthropic я получаю гораздо более надёжные первые попытки, и мне приходится проверять или исправлять гораздо меньше кода.
И, честно говоря, меня это разочаровывает, учитывая, что я плачу 200-100 долларов в месяц и пользуюсь Codex уже много лет.
PS: это репост с Реддит https://www.reddit.com/r/codex/comments/1x1ilzd/after_years_on_the_200_tier_even_haiku_is/
Комментарии - разделились
- хотя я тоже ни капли не доверяю Codex, количество глупостей, которые он делает, намного меньше, и многие запросы на слияние, прошедшие проверку с его помощью, в итоге одобряются без обратной связи. Запросы на слияние от Claude почти никогда не получают одобрения с первого раза.
- Не знаю насчет Haiku, но именно по этой причине я перешел на Claude. Codex просто перестал следовать инструкциям. Управлять моделями в Codex невозможно. В какой-то момент я был настолько расстроен, что начал сомневаться, делаю ли я что-то не так, потому что в то время даже Opus 5 был довольно плох, а вот Opus 5.5 – просто идеален!
- На данном этапе этих подставных авторово с постами следует модерировать, это просто сплошной маркетинговый шум.
Комментарий kvisaz
Сорри, я вот не подставной. Не знаю, как там автор поста, но его ощущения совпадает с моими ощущениями на сентябрь-октябрь 2026 года - модели Клода более точные и умные. Но я видел ошибки и самовольные изменения и у них.