2 Sept 2026, 09:03 UTCโ1,240 views3 reactionsread 2 September 2026 Photo
Gli agenti LLM messi alla prova in ambienti reali, non ideali ๐
La maggior parte dei benchmark valuta gli agenti in scenari semplificati, con tool puliti e input perfetti. AgentGym2 fa il contrario: testa gli agenti in ambienti "de-idealizzati" che assomigliano molto piรน al mondo reale.
Dentro troverete:
๐ Ambienti realistici: niente tool interface pre-impacchettate
๐ Input imperfetti: gli agenti devono gestire datโฆ
โค2๐ฅ1
1 Sept 2026, 09:01 UTCโ1,770 views5 reactionsread 2 September 2026 Photo
Tutti i numeri sull'AI del primo trimestre 2026 ๐
CB Insights ha pubblicato il suo report trimestrale sullo stato dell'AI, con dati su funding, startup, settori piรน caldi e le mosse delle Big Tech nel primo trimestre dell'anno.
Dentro troverete:
๐ Funding: dove sono finiti davvero i miliardi investiti in AI
๐ Settori: quali verticali stanno crescendo piรน velocemente
๐ Startup: le aziende emergenti da tenere d'occhiโฆ
โค3โคโ๐ฅ2
31 Aug 2026, 09:02 UTCโ2,090 views6 reactionsread 2 September 2026 Photo
Gli agenti AI messi alla prova su task lunghi da terminale ๐ป
I benchmark da terminale esistenti misurano solo task brevi, risolvibili in pochi minuti. Long-Horizon-Terminal-Bench cambia approccio: valuta gli agenti su compiti lunghi, con un sistema di reward denso che premia anche i progressi parziali.
Dentro troverete:
๐ Il problema: i benchmark classici ignorano il progresso intermedio
๐ La soluzione: reward gradโฆ
โค6
28 Aug 2026, 09:03 UTCโ3,050 views6 reactionsread 2 September 2026 Photo
Il toolkit robotics open source di Hugging Face si aggiorna ๐ค
LeRobot v0.6.0 รจ il rilascio piรน grande di sempre per la libreria open source di robotica di Hugging Face: chiude il loop imagine-evaluate-improve per l'AI embodied, con nuovi modelli, benchmark e strumenti di training.
Dentro troverete:
๐ World model policies: VLA-JEPA, FastWAM, LingBot-VA per "immaginare" il futuro
๐ Nuovi VLA: GR00T N1.7, MolmoAct2, Eโฆ
๐ฅ5โค1
27 Aug 2026, 10:04 UTCโ3,090 views1 reactionsread 2 September 2026 Photo
Se in questo periodo state cercando nuove opportunitร , su Datapizza Jobs abbiamo due posizioni che potrebbero interessarvi! ๐
1๏ธโฃ AI Transformation Leader in Azzurro Digitale
๐ธ RAL: 60k-80k + MBO ๐ก Esperienza: 5+ anni ๐ Ibrido a Padova ๐ Tecnologie: AI Expert, Evaluation di soluzioni GenAI, RAG e Agenti, Sistemi multi-agente, AI Tools, People Management, Project management
๐ https://bit.ly/4qHWmfl
2๏ธโฃ AI Transforโฆ
๐ญ1
26 Aug 2026, 09:03 UTCโ3,010 views1 reactionsread 2 September 2026 Photo
Le skill dei vostri agenti possono allenarsi da sole ๐ ๏ธ
SkillOpt di Microsoft รจ un optimizer open source che allena skill testuali riutilizzabili per agenti LLM "congelati", senza toccare i pesi del modello. Basta un documento di skill che si aggiorna da solo, con edit validati e nessuna chiamata extra a inferenza.
Dentro troverete:
๐ Come funziona: un optimizer trasforma i rollout in edit su un unico file di skillโฆ
๐ฅ1
25 Aug 2026, 09:04 UTCโ2,920 views12 reactionsread 2 September 2026 Photo
Creare dataset con l'AI, senza scrivere una riga di codice ๐งฎ
Hugging Face ha lanciato AI Sheets, un tool open source che vi permette di costruire, arricchire e trasformare dataset usando modelli AI direttamente da un'interfaccia a foglio di calcolo. Potete usare migliaia di modelli open del Hub tramite Inference Providers, oppure far girare tutto in locale.
Dentro troverete:
๐ Zero codice: interfaccia a celle, comeโฆ
๐ฅ5โค4๐3
24 Aug 2026, 09:03 UTCโ2,930 views4 reactionsread 2 September 2026 Photo
Un agente AI puo' davvero comportarsi come un ricercatore, dall'idea alla pubblicazione? ๐ฌ
Questa suite di benchmark valuta LLM frontier e harness agentici su tutto il ciclo di vita della ricerca scientifica, non solo su un singolo task isolato.
Dentro troverete:
๐ Copertura: ideazione, letteratura, esperimenti, scrittura del paper
๐ Target: modelli frontier e harness agentici a confronto diretto
๐ Metodo: task penโฆ
โค2๐1๐ฅด1
21 Aug 2026, 09:07 UTCโ3,410 views3 reactionsread 2 September 2026 Photo
Se in questo periodo state cercando nuove opportunitร , su Datapizza Jobs abbiamo due posizioni che potrebbero interessarvi! ๐
1๏ธโฃ Sales Industry Leader - Pubblica Amministrazione e Difesa in Datapizza
๐ธ RAL: 70k-80k
๐ก Esperienza: 6+ anni
๐ Ibrido su Milano
๐ Tecnologie: Sales Strategy, Account Management, Capacitร di negoziazione, Data & AI, Business Development, Result driven, Pubblica Amministrazione e Difesa
๐ hโฆ
โค2๐1
20 Aug 2026, 09:17 UTCโ3,400 views2 reactionsread 2 September 2026 Photo
Aggiornare un package una volta รจ facile, farlo per 12 release di fila molto meno โ๏ธ
SWE-Chain valuta i coding agent su catene di upgrade reali, dove ogni versione si costruisce sulla precedente proprio come succede nella manutenzione vera di un progetto.
Dentro troverete:
๐ Dataset: 12 catene di upgrade su 9 package Python reali
๐ Scala: 155 transizioni di versione, 1.660 requisiti verificati
๐ Risultato: i miglioโฆ
โค2
19 Aug 2026, 09:16 UTCโ3,190 views7 reactionsread 2 September 2026 Photo
Il capex delle Big Tech sta per superare il cash flow ๐
Epoch AI ha pubblicato un nuovo data insight sulla spesa in infrastrutture AI degli hyperscaler: stima che entro il Q3 2026 gli investimenti in capex supereranno il flusso di cassa operativo.
Dentro troverete:
๐ Il sorpasso: capex aggregato oltre il cash flow entro Q3 2026
๐ NVIDIA: oltre il 60% del compute totale installato
๐ Il resto: Google e Amazon a copriโฆ
โค3๐คฃ3โคโ๐ฅ1
18 Aug 2026, 10:08 UTCโ3,320 views0 reactionsread 2 September 2026 Photo
Valutare un agente AI su un benchmark intero costa caro! ๐ฐ
Ma serve davvero farlo? ๐ค
Questo paper mostra come selezionare solo i task a difficoltร intermedia permetta di ridurre drasticamente il costo di valutazione senza perdere affidabilitร .
Dentro troverete:
๐ Filtro basato su tassi di successo storici tra il 30% e il 70%
๐ Riduzione dei task di valutazione dal 44% al 70%
๐ Alta fedeltร nel ranking anche cambiaโฆ
Showing the 12 most recent of 37 posts we hold for @datapizza. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked โ was rounded by Telegram before we ever saw it โ t.me prints views in full below 1,000 and to three significant figures above, so โ1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.