naïvelabs

[Research to Advance Agent Infrastructure]

Naïve is a research lab with one objective function: multiplying intelligence per token.

[Benchmarks]
Sandbox
View more

You pay for an isolate, not a machine.

SystemCold startRAM / agentIdle agent
Naïve2.79msisolated-vm1.2MBisolated-vmKBs of statestorage only
E2B<200ms512MBminimumPaused VMper GiB
Modal~1s128MBminimumReserved
MorphReserved VM
Cloudflare1–3s256MBminimumMemory reserved
Agent Brain
View more

Recall no other memory system reaches.

SystemSingle-hopMulti-hop
Naïve Brain91%57%
CAR (prior SOTA)78%30.2%
HippoRAG-v254%≤7%
MemGPT / Cognee28%≤7%
Mem0 / Contriever18%≤7%
Zep / Graphiti7%≤7%
Inference
View more

Frontier models waste money searching.

SystemWith Scout$/solvedΔ cost
Claude Opus 4.836/5072%$1.23was $1.75−29.8%
Claude Opus 537/5074%$1.27was $1.61−21.0%
GPT-5.6 Sol34/5068%$0.82was $1.05−21.9%
GLM-5.227/5054%$0.60was $1.25−52.0%
Agent Workforce
View more

Cost of hosting 1 million agents per month

System1M agents / moIdle
Naïve Vetta · serverless~$44–60kmodelledStorage onlyno compute
Hosting Hermes / Eve / OpenClaw / Pi~$740k–1.5MmodelledBilled 24/7
VM per tenant · AWS~$14Malways-onBilled 24/7
Feature coverage · 24 capabilities
Naïve14/24
Hermes12/24
OpenClaw14/24
Paperclip8/24
Eve9/24
Pi3/24
Agent Loop Efficiency

Same intelligence, 30% more efficient.

SystemSWE-bench solve$ / solvedΔ cost
Naïve Vetta69.83%$1.19−30.41%
Claude Code70.50%$1.71baseline
Claude Managed Agents68.24%$1.62−5.26%
Hosted Hermes68.97%$1.89+10.53%
[Papers]
DateTitleCategoryAuthors
8/4/2026Building Towards the Most Efficient Agent Loop InfrastructureInfrastructure, BenchmarksNaïve Research
7/26/2026Sandboxes Without Machines: A V8-Isolate Runtime for Massive Fleets of Resident AgentsComing soonSandbox, RuntimeNaïve Research
7/26/2026Serverless Agents Without Machines: Scale-to-Zero for Fleets of Mostly-Idle AgentsComing soonServerless, OrchestrationNaïve Research
7/27/2026Both Engines, One Harness: A Self-Run Head-to-Head Against mem0's Open-Source ServerComing soonMemory, BenchmarksNaïve Research