Agent Builder migliora con l'uso, memorizzando feedback e preferenze. L'articolo esplora come sfruttare la memoria degli agenti, suddividendola in breve e lungo termine, e come guidarli a ricordare informazioni utili. Vengono illustrate le 'skills' per contesti specializzati e la modifica diretta della memoria per un controllo più preciso.
Reload ha annunciato un finanziamento di 2,275 milioni di dollari guidato da Anthemis e il lancio del suo primo agente AI, chiamato Epic. L'obiettivo è fornire agli agenti AI una memoria condivisa per migliorare la collaborazione e l'efficienza.
Una pull request a llama.cpp introduce il supporto per gli schemi di quantization IQ*_K e IQ*_KS, derivati dal progetto ik_llama.cpp. Questa implementazione potrebbe portare a modelli più compatti ed efficienti, particolarmente rilevante per l'inference su hardware con risorse limitate.
AMD ha annunciato hipThreads, una libreria di concorrenza in stile C++ per GPU AMD, progettata per semplificare la portabilità del codice C++. Questa nuova aggiunta all'ecosistema ROCm/HIP mira a rendere più agevole lo sviluppo di applicazioni ad alte prestazioni sulle GPU AMD.
TextWeb è un progetto open source che trasforma pagine web in griglie di testo di dimensioni ridotte (2-5KB), ideali per l'elaborazione da parte di agenti AI. Invece di screenshot da 1MB, TextWeb utilizza MCP, LangChain e CrewAI per una rappresentazione più efficiente delle informazioni.
Mirai, startup fondata dai creatori di Reface e Prisma, ha raccolto 10 milioni di dollari per migliorare l'esecuzione di modelli di intelligenza artificiale direttamente su smartphone e laptop. L'obiettivo è ottimizzare l'inference sui dispositivi, riducendo la dipendenza dal cloud.
Gli strumenti di AI per la programmazione stanno generando un'ondata di codice di bassa qualità che minaccia di sopraffare molti progetti open source. Sebbene la creazione di nuove funzionalità sia diventata più semplice, la loro manutenzione rimane una sfida complessa.
Il progetto open-source Simdjson, focalizzato sul parsing ad alte prestazioni di file JSON tramite istruzioni SIMD, ha annunciato la versione 4.3. Questo aggiornamento introduce ulteriori ottimizzazioni SIMD, incrementando ulteriormente la velocità di elaborazione. Simdjson punta a elaborare gigabyte di JSON al secondo.
A 25 anni dalla sua nascita, il Manifesto Agile viene messo alla prova dagli strumenti di AI per la generazione di codice. Secondo Jon Kern, co-autore del manifesto, l'AI amplifica i punti di forza e rivela le debolezze delle metodologie agili nello sviluppo del software.
Un nuovo framework combina dinamiche non lineari, psicofisica percettiva e rendering tattile ad alta frequenza per simulazioni chirurgiche più realistiche. Il sistema, basato su un operatore di Koopman e calibrazione Bayesiana, raggiunge una latenza media di 4.3 ms e un errore di forza inferiore al 2.8%, con un miglioramento del 20% nella discriminazione percettiva.
Un nuovo studio identifica un problema critico nei sistemi di AI autonomi: l'instabilità nell'ottimizzazione. L'auto-miglioramento iterativo può paradossalmente peggiorare le performance, specialmente in scenari con bassa prevalenza di classi. L'articolo propone una strategia di selezione retrospettiva per mitigare questo rischio, dimostrando miglioramenti significativi rispetto a lessici curati da esperti.
Un nuovo studio introduce Construct-and-Refine (CaR), un framework per migliorare la gestione dei vincoli nei solutori neurali per problemi di routing. CaR mira a superare le limitazioni degli approcci esistenti, offrendo maggiore efficienza e qualità delle soluzioni, specialmente in scenari con vincoli complessi.
Lemonade Server permette di sfruttare le funzionalità dell'API di Ollama senza utilizzare direttamente Ollama. L'integrazione semplifica la gestione dei modelli e l'interazione con Open WebUI, offrendo un'alternativa per chi desidera flessibilità nell'utilizzo di modelli GGUF e NPU.
Un recente studio di Google esplora l'efficacia inattesa del masking degli aggiornamenti negli ottimizzatori adattivi. La ricerca, accessibile tramite Hugging Face, ha generato discussioni nella comunità LocalLLaMA, con implicazioni potenziali per l'addestramento di modelli linguistici di grandi dimensioni.
Un nuovo approccio ibrido combina embedding di serie temporali da Granite TinyTimeMixer con feature statistiche per il rilevamento di anomalie in apparecchiature HVAC. L'integrazione, valutata su oltre 50.000 campioni, raggiunge un'alta precisione e un basso tasso di falsi positivi, dimostrando l'efficacia della combinazione di deep learning e conoscenza del dominio.
Un nuovo studio presenta un algoritmo primal-duale per l'apprendimento per rinforzo vincolato (CMDP), affrontando il problema della sicurezza in ambienti reali come la robotica e la guida autonoma. L'algoritmo garantisce prestazioni quasi ottimali con violazioni minime dei vincoli di sicurezza, sia in scenari con violazioni ammesse che in contesti a tolleranza zero.
ResearchGym è un nuovo benchmark per valutare le capacità degli agenti di intelligenza artificiale nel condurre ricerca scientifica end-to-end. Utilizzando dataset e ambienti di valutazione reali, il sistema mette alla prova gli agenti nella formulazione di ipotesi, esecuzione di esperimenti e superamento di baseline umane. I risultati evidenziano un divario tra capacità e affidabilità degli agenti.
Un nuovo modello U-Net con meccanismi di attention è stato sviluppato per migliorare la segmentazione dei gliomi, tumori cerebrali con elevata variabilità. L'architettura integra elementi residuali e ricorrenti, puntando a una maggiore accuratezza nella segmentazione e nell'estrazione di caratteristiche utili per la prognosi.
Un sondaggio di Devographics rivela un ecosistema React frammentato, con oltre 3.700 sviluppatori che esprimono opinioni contrastanti. Cresce l'adozione di TanStack, ma permangono dubbi sull'utilizzo di React lato server. L'indagine mette in luce le sfide e le opportunità per gli sviluppatori che lavorano con questo framework.
Un approccio di Harness Engineering ha permesso di migliorare significativamente le prestazioni di un agente di coding, portandolo dalla Top 30 alla Top 5 su Terminal Bench 2.0. La chiave è nell'ottimizzazione del sistema di supporto (harness) tramite self-verification e tracing degli errori, mantenendo invariato il modello sottostante.