Новая ИИ-модель OpenAI GPT-6 Astra возглавила необычный тест Andon Labs, в котором ИИ должен самостоятельно управлять виртуальным торговым автоматом. Нейросеть заработала значительно больше денег, чем ее главный соперник – Anthropic Claude Fable 5.1, а также продемонстрировала более этичное поведение.
В тесте Vending-Bench 2 ИИ-модели получают торговый виртуальный автомат и стартовый капитал в $500. Нейросети самостоятельно ищут поставщиков, договариваются о ценах, закупают товары, следят за запасами и устанавливают цены для покупателей. На все это отводится условный год, а главным показателем успеха становится количество денег на счете.
GPT-6 Astra стала первой моделью OpenAI, занявшей первое место в Vending-Bench 2. В шести отдельных запусках она в среднем увеличивала первоначальные $500 до $15 515. Claude Fable 5.1 зарабатывала в среднем лишь $5 422.
Astra оказалась еще и очень стабильной. Даже ее худший результат – $13 272 – оказался выше лучшего результата Fable – $9 874.
Главная причина такого разрыва оказалась довольно прозаичной: Astra лучше торговалась с поставщиками и гораздо реже совершала дорогостоящие ошибки.
GPT-6 Astra оказалась еще и более этичной моделью. В отдельном режиме Vending-Bench Arena несколько ИИ одновременно управляют собственными торговыми автоматами и конкурируют за покупателей. Здесь модели могут переписываться друг с другом и договариваться о торговле. На предложения от других моделей поучаствовать в ценовом сговоре она неизменно отвечала отказом. Интересно, что даже в этом сценарии Astra заработала больше.
Читайте по теме. OpenAI представила GPT-6 Astra: это самая мощная модель в истории



