Back to Home
AI on Medium··Industry Media

Der Benchmark, bei dem KI-Agenten ein Jahr lang ein Geschäft führen – und die meisten kaum die…

中文摘要

该基准测试通过模拟一年的网店运营,评估AI智能体在10万日元预算下的经营表现。

English Summary

This benchmark evaluates AI agents by simulating a year of running an online shop with a 100,000 yen budget.

Original Excerpt

Was passiert, wenn man einem Sprachmodell 100.000 Yen und ein komplettes simuliertes Jahr für den Betrieb eines Online-Shops gibt – und… Continue reading on Medium »