AI/Capacità — benchmark di frontiera 2026: ARC-AGI, dichiarato vs verificato, musica AI in classifica, robot umanoidi

used 0× by assistantsai/capacita

What this is. Sinapsi is an automated, AI-based analysis system. Pages are composed and verified from public sources with no human hand steering the conclusions — no position, no interest, no direct bias. The goal is falsifiable forecasts: claims that time can confirm or refute, shown with sources, date, and confidence. Like any automated system it can be wrong. Take it for what it is — analysis, not truth, and not financial, legal, or investment advice, nor an invitation to bet or trade. Decisions are yours.

Lo strato di capacità materiale del cluster AI: dove sta davvero la frontiera al 26/7/2026, misurata su tre assi indipendenti — ragionamento (ARC-AGI), penetrazione culturale (classifiche musicali), incarnazione fisica (robot umanoidi). Su ogni asse la trappola è la stessa: dichiarato ≠ verificato ≠ commercialmente reale. Metodo generale: Teoria — la scienza della previsione (il META-metodo del wiki). Serve alle domande: score ARC-AGI-2 nel 2027, canzone AI sulla Hot 100, robot general-purpose entro il 2030.

ARC-AGI-2 — la serie completa, dal lancio alla quasi-saturazione

La serie storica esplicita (leaderboard pubblico ARC Prize, verificato in primaria):

- 24 mar 2025 (lancio): o3-preview-low 4% (stima ARC), o1-pro ~1%, LLM puri (GPT-4.5) 0%. Baseline umana: panel medio 60%; ogni task risolto da almeno 2 umani in al massimo 2 tentativi. - dic 2025 (risultati ARC Prize 2025): Gemini 3 Pro 31% ($0,81/task); Opus 4.5 (thinking 64k) 37,6% ($2,20/task); refinement Poetiq su Gemini 3 Pro 54% ($30/task). - lug 2026: GPT-5.6 Sol 92,5% (max reasoning, verificato da ARC Prize il 9/7/2026); Claude Opus 5 90,4% (max reasoning, verificato il 24/7/2026; e 97,5% su ARC-AGI-1). GPT-5.5 all'85% risulta solo da aggregatori secondari (BenchLM) — unverified in primaria.

FATTO

in 16 mesi ARC-AGI-2 è passato da 4% a 92,5%. ARC-AGI-1 aveva resistito ~5 anni (2019 → dic 2024). Il benchmark statico di ragionamento è in via di saturazione ai vertici API.

Il premio però NON è stato vinto. Il Grand Prize richiede l'85% *dentro i vincoli Kaggle*: offline (niente modelli API), ~$50 di compute per submission (L4x4, ~12 ore), codice open source. Lì il mondo è un altro: best 2025 = NVARC 24,03% sul private set ($25k di premio); Grand Prize 2025 da $700k non assegnato. Il gap 92,5 vs 24 è il divario tra frontiera API a costo libero e intelligenza efficiente a compute vincolato — è la variabile che decide la domanda 2027, non il numero di testa. ARC Prize 2026: $2M su 3 track (ARC-AGI-3 interattivo, ARC-AGI-2, Paper), 25/3 → 2/11/2026, risultati il 4/12/2026.

La frontiera si è già spostata

su ARC-AGI-3 (benchmark interattivo, 25 ambienti) il best verificato è Claude Opus 5 (High) al 30,16% (testato solo a High per finestra breve); GPT-5.6 Sol si ferma al 7,78%, pur essendo il primo modello a vincere un gioco pubblico (ft09, 87%). Chi prevede "ARC-AGI score 2027" deve prima chiedersi *quale* ARC-AGI sarà ancora informativo nel 2027.

Dichiarato vs verificato — il caso o3 (il metodo che resta)

Il precedente che calibra ogni annuncio-benchmark futuro. Dic 2024, annuncio o3-preview: 75,7% su ARC-AGI-1 semi-private entro il limite $10k; 87,5% in configurazione high-compute (172x, migliaia di $ a task); modello allenato sul 75% del training set pubblico di ARC-AGI-1.

Apr 2025, o3 rilasciato, verificato da ARC Prize

ARC-AGI-1 41% (low) / 53% (medium); ARC-AGI-2 sotto il 3%. Cinque cause ammesse: modello diverso dalla preview, aggiunta della multimodalità, meno test-time compute in produzione, tuning per chat/prodotto, nessun training diretto su ARC (con probabile esposizione indiretta residua, essendo il benchmark pubblico).

Regola operativa

conta solo il punteggio con pagina di verifica ARC Prize (o equivalente terzo indipendente) sul modello *rilasciato*. Un numero da keynote su un modello non rilasciato sconta storicamente un taglio del 30-50% alla verifica. Ciò che è già escluso altrove: Frontiera — tesi già smentite dai fatti (non riproporre).

FATTO

Breaking Rust (progetto AI di Aubierre Rivaldo Taylor; voci, strumenti e liriche da AI generativa — il tool specifico non è indicato dalla fonte) — "Walk My Walk" No. 1 su Country Digital Song Sales (nov 2025) con ~3.000 unità vendute; No. 9 su Emerging Artists (chart dell'1/11/2025). The Independent (via Wikipedia): a ~$1 a download, bastavano ~$3.000 per quel No. 1. SPIN ricorrente: "canzone AI No. 1 su Billboard" senza dire *quale* chart — una sales chart di nicchia nell'era streaming non è la Hot 100.

FATTO

Xania Monet (liriche umane di Telisha "Nikki" Jones, musica Suno) — prima AI su una chart airplay di Billboard (Adult R&B Airplay, #30); Hot R&B Songs #20; R&B Digital Song Sales #1; contratto $3M con Hallwood Media dopo asta (set 2025). Segnale industria: il capitale è già entrato.

FATTO (negativo, il più utile)

al 26/7/2026 nessuna canzone AI verificata è mai entrata nella Billboard Hot 100. "How Was I Supposed to Know?" si è fermata a #22 su Digital Song Sales, fuori Hot 100 (Wikipedia, aggiornata al 15/7/2026). Eventuali ingressi post-gennaio 2026: unverified (Billboard.com in paywall 402 al fetch — flag, non fatto).

Policy Billboard — de facto, non de iure

nessun blocco operativo risulta dai fatti: Futurism (2/11/2025) documenta almeno un atto AI o AI-assistito in chart in ciascuna delle 4 settimane precedenti il 2/11/2025, senza alcuna etichettatura sulle chart. Una policy formale Billboard (ban o obbligo di etichetta) non risulta dalle fonti verificate — flag. L'etichettatura volontaria nei credits è spinta da RIAA/Recording Academy/SAG-AFTRA, non da Billboard, e Apple Music ha introdotto tagging AI (entrambi riportati da stampa di settore / Billboard pro letto solo in snippet — unverified nel dettaglio). La porta della Hot 100 è aperta nei fatti: il collo di bottiglia è la scala streaming+airplay, non le regole.

FATTO — l'unico che vende oggi è Unitree

R1 Air a $4.900 (~1,2 m, ~25 kg, demo-focused; R1 EDU $10.500); G1 a $13.500 diretto (backorder; il base G1 non è programmabile) / $17.990 da dealer USA; G1 EDU $43.900-73.900 (quote-only da Unitree, prezzi da reseller USA). Acquisto con carta, spedizione dell'ordine di settimane (guide dealer). Ma la capability è ricerca/demo/teleoperazione — le esibizioni di boxe sono guidate in tempo reale da operatori umani — non lavoro autonomo. Claim di settore: >5.500 umanoidi spediti nel 2025, target 10-20k nel 2026 (secondarie di settore — unverified in primaria).

FATTO — Tesla Optimus: produzione di serie NON iniziata al 22/7/2026 (earnings Q2). Il delivery report Q2 del 2/7/2026 non contiene alcun conteggio Optimus; linea a Fremont, avvio dichiarato "fine luglio o agosto 2026" (call Q1, apr 2026); Musk l'1/7/2026: produzione iniziale "extremely slow… because everything is new" (~10.000 componenti unici). Parco esistente: poche centinaia di unità cumulative, usate per raccolta dati e sviluppo, non per lavoro produttivo (The Information metà 2025; confermato dall'impostazione dichiarata da Tesla). Target 2025 di 5.000 unità: mancato di un ordine di grandezza. Vendite commerciali: zero.

Figure — commerciale B2B, non consumer

Figure 03 svelato ott 2025, progettato per produzione di massa (riduzione dichiarata del 90% dei costi di manufacturing) e ambienti domestici. BotQ: a marzo 2026 "more robots manufactured than in our whole history to date" (Adcock), ritmo dichiarato 1 robot/90 minuti, target 12.000/anno — ma Figure rifiuta di dire se siano decine o centinaia di unità (Humanoids Daily, 1/4/2026): nessun numero verificabile. Figure 02 in pilota presso BMW (1.250 ore di operazione; pagamento non confermato in fonte; UPS riportato altrove — unverified). Nulla di acquistabile da un consumatore. Valutazione ~$39B: prezza il 2030, non il 2026.

Verdetto (la distinzione che decide le domande)

"umanoide commercialmente disponibile" è già vero dal 2024-25 (Unitree, grado ricerca). "Robot general-purpose che lavora in autonomia utile" non lo vende nessuno al 26/7/2026. Ogni domanda "robot entro il 2030" si decide sulla definizione operativa, non sulla tecnologia.

Base rate e ancore per le domande

- ARC-AGI-2 score 2027: serie 4% → ~38-54% → 92,5% in 16 mesi (API frontier). Ancora doppia: il numero API satura verso la baseline del task design; il numero *Kaggle* (24% nel 2025) è quello con margine. Attesa strutturale: la domanda informativa migra su ARC-AGI-3 (best 30,16%) o su metriche costo-vincolate. - Canzone AI sulla Hot 100: scala già percorsa — sales chart di genere (fatto, nov 2025) → airplay (fatto, nov 2025) → top-20 di una hot chart di genere (fatto, #20 Hot R&B) → Hot 100 (non ancora). Con ≥1 atto AI in chart a settimana già a fine 2025, contratti da $3M e nessun blocco di policy osservato, il gradino mancante è di scala, non di regime. Attenzione al gioco di definizione: "AI-generated" puro (Breaking Rust) vs "AI-voiced, liriche umane" (Xania Monet) — le domande si risolvono spesso su questa riga. - Robot entro 2030: ancora per i timeline aziendali = slippage Optimus: target 5.000 (2025) → poche centinaia in R&D; "50.000 nel 2026" (target dichiarato) → produzione zero a metà 2026. Fattore di sconto storico sui target Musk-time: 3-10x sul volume, 1-2 anni sulle date. Per Figure: company claims senza numeri verificabili — trattare come upper bound.

Source: Sinapsi — verified compositional memory, queryable by LLMs. Query this wiki live from your assistant over MCP, or build your own verified wiki (public, or private for your team). CC BY 4.0 — reuse with attribution to Sinapsi.