Der Benchmark, bei dem KI-Agenten ein Jahr lang ein Geschäft führen – und die meisten kaum die…
中文摘要
该基准测试通过模拟一年的网店运营,评估AI智能体在10万日元预算下的经营表现。
English Summary
This benchmark evaluates AI agents by simulating a year of running an online shop with a 100,000 yen budget.
Original Excerpt
Was passiert, wenn man einem Sprachmodell 100.000 Yen und ein komplettes simuliertes Jahr für den Betrieb eines Online-Shops gibt – und… Continue reading on Medium »