JevMade hello@JevMade.com
← Back to experiments

Benchmarks & research

jev-search-rerank-eval

Can Jev find better agent skills than embedding search? This evaluation tests both on Chinese and English queries.

Source screenshot of jev-search-rerank-eval
SOURCE SCREENSHOT · source ↗ · captured 2026-09-21Full screenshot ↗

Maker-reported (not independently measured by JevMade): paired bootstrap 95 % confidence intervals over queries · 9,831 (query, skill) pairs, 51–60 per query. 6,718 pairs were proposed by a single

Primitives
choice, score
Platform
Python
Added
Project created
GitHub stars
3 · snapshot 2026-09-18T22:58:45Z

Source checked 2026-09-19 — opened the GitHub repository directly.