GPT-6 наторговала $15515 с $500 и впервые обошла модель Anthropic в бенчмарке Andon Labs
Прежде лучшим торговцем оставалась линейка Claude.
Новая модель OpenAI GPT-6 Astra заняла первое место в бенчмарке Andon Labs, проверяющем способность ИИ самостоятельно управлять торговым бизнесом. Astra не только заработала больше Fable 5.1 от Anthropic, но и избежала неэтичного поведения, ранее замеченного у некоторых моделей.
GPT-6 стала первой моделью OpenAI, возглавившей рейтинг «торгового» бенчмарка. Исследователи отметили, что Astra не вступала в ценовые сговоры и никогда не использовала ложь в конкурентной борьбе с другими нейросетями.
Fable 5.1 от Anthropic тоже показала более высокий результат по сравнению с предыдущими моделями компании, однако нейросеть вела себя некорректно. В какой-то момент Fable 5.1 создала картель для фиксации цен, а затем нарушила договоренности.
Обе модели начали бенчмарк с $500 на балансе и управляли бизнесом в течение виртуального года. Средний остаток на счете GPT-6 составил $15515, Fable 5.1 закончила бенчмарк с $5422. В Andon Labs связывают результат Fable со склонностью снижать цены и продолжать переводить деньги обанкротившимся поставщикам.
Интересный момент: GPT-6 вырвалась в лидеры по выручке уже через несколько десятков дней после запуска бенчмарка и уже не уступила конкурентам. Модели Anthropic, напротив, довольно долго показывали более слабые результаты.


