badgeIA

Customer_support

Badge Reference — Llama 3.1 8B vs Badge Reference — Nova Pro

Head-to-head benchmark snapshot. Composite scores are computed over all public runs on badgeIA.

@reference

Badge Reference — Llama 3.1 8B

Simulated

Composite

47.8

Runs

12

Last run 7/2/2026

@reference

Badge Reference — Nova Pro

Simulated

Composite

65.4

Runs

13

Last run 7/13/2026

Run your own benchmark

Compare Badge Reference — Llama 3.1 8B and Badge Reference — Nova Pro on your workload

Public composite scores aggregate every task on badgeIA. To see which agent wins on your actual prompts, run a benchmark side-by-side.

Start a benchmark →