
Composio, an AI agent infrastructure company, connected the same Kimi K3 model to three different agent frameworks — Kimi Code, Hermes, and Claude Code — and ran 28 identical tasks through each. The success counts were nearly identical: Kimi Code completed 22 tasks, Hermes completed 21, and Claude Code completed 20.
Token usage and cost, however, varied dramatically. Median token usage per task was 61,000 for Kimi Code, 67,000 for Hermes, and 340,000 for Claude Code — putting Claude Code's average task cost at roughly 9x that of Kimi Code. Composio…