Un nuovo modello surrogato preserva frequenze e correlazioni a lungo raggio in sequenze simboliche come linguaggio scritto e DNA genomico. Il modello mappa rumore gaussiano frazionario sull'istogramma empirico, riproducendo statistiche di primo ordine e scaling a lungo raggio, randomizzando le dipendenze a corto raggio. Validato su testi in inglese e latino, e su DNA genomico.
Un nuovo algoritmo, ATPO, affronta le sfide dell'incertezza nei dialoghi medici tramite LLM. ATPO alloca dinamicamente risorse di calcolo a stati di alta incertezza, migliorando la stima dei valori e l'esplorazione. L'ottimizzazione include pruning guidato dall'incertezza e ricerca asincrona con riuso della cache KV. Qwen3-8B supera GPT-4o in accuratezza.
Un nuovo studio introduce RxnNano, un modello LLM compatto (0.5B parametri) per la predizione di reazioni chimiche. Il modello utilizza un approccio di apprendimento gerarchico per migliorare la comprensione chimica, superando modelli più grandi (7B+ parametri) in benchmark rigorosi. L'obiettivo è instillare una profonda intuizione chimica nei modelli, piuttosto che scalare semplicemente parametri e dataset.
OpenAI introduce un aggiornamento al modello GPT-5.3 Instant di ChatGPT per mitigare risposte considerate fastidiose dagli utenti. L'obiettivo è migliorare l'esperienza utente riducendo le interazioni indesiderate.
DeepMind presenta Project Genie, un'iniziativa che permette agli utenti di generare mondi virtuali tramite prompt testuali. L'articolo fornisce indicazioni su come formulare i prompt per ottenere i risultati desiderati. Un nuovo modo di creare contenuti digitali con l'intelligenza artificiale.
Google presenta Gemini 3.1 Flash-Lite, un modello della serie Gemini 3 progettato per offrire prestazioni elevate e costi contenuti. Questo modello mira a fornire intelligenza artificiale scalabile, ottimizzando l'efficienza computazionale per un'ampia gamma di applicazioni.
Il servizio di intelligenza artificiale Claude di Anthropic ha subito interruzioni e problemi di disponibilità. I problemi hanno interessato il servizio di chat di base, l'API e l'offerta Claude Code. Gli sviluppatori si sono trovati di fronte alla necessità di intervenire direttamente sul codice.
Un nuovo modello di rimozione del rumore (NR) affina le consegne dei modelli BERT per il riconoscimento di entità nominate (NER) in ambito clinico. Il modello NR analizza le probabilità di output del modello NER, classificando le predizioni come deboli o forti tramite una Probability Density Map (PDM), riducendo i falsi positivi dal 50% al 90%.
Un nuovo approccio per il fact-checking online combina LLM e grafi di conoscenza per migliorare l'accuratezza e l'affidabilità delle verifiche. Il sistema utilizza un processo decisionale di Markov per valutare le affermazioni e recuperare evidenze strutturate, riducendo la dipendenza dalla sola similarità testuale.
Perplexity ha annunciato 'Computer', un nuovo agente AI progettato per supportare le aziende nei processi decisionali. L'agente integra 19 modelli diversi e mira a fornire analisi approfondite e raccomandazioni basate sui dati per migliorare l'efficienza e la strategia aziendale.
Molti utenti stanno abbandonando ChatGPT a favore di Claude a seguito di alcune controversie. Questa guida illustra i passaggi fondamentali per effettuare la transizione tra i due chatbot basati su intelligenza artificiale.
Un'intelligenza artificiale ha formalmente verificato le prove matematiche della vincitrice della Medaglia Fields, Maryna Viazovska, accelerando la ricerca matematica. L'AI ha convalidato la soluzione del problema dell'impacchettamento di sfere in 8 e 24 dimensioni, dimostrando il potenziale dell'AI nell'assistere i matematici e aprendo nuove frontiere nella formalizzazione su larga scala.
Il chatbot Claude di Anthropic ha subito una diffusa interruzione del servizio, con migliaia di utenti che segnalano problemi di accesso. L'incidente ha sollevato interrogativi sulla stabilità delle infrastrutture cloud che supportano i modelli di linguaggio di grandi dimensioni.
Il team di Jan ha rilasciato Jan-Code-4B, un modello di piccole dimensioni ottimizzato per attività di programmazione. Basato su Jan-v3-4B-base-instruct, mira a fornire assistenza nello sviluppo di codice, generazione, refactoring e debugging, mantenendo un'impronta leggera per l'esecuzione locale. Può sostituire il modello Haiku in Claude Code.
Un avviso per chi utilizza Qwen 3.5 in locale con llama.cpp: la cache KV deve essere impostata manualmente su BF16 (bfloat16) anziché sul valore predefinito FP16 (float16). Test di perplexity su wikitext-2-raw confermano che l'implementazione ufficiale di Qwen-team, come vLLM, utilizza BF16, mentre llama.cpp usa F16 di default.
È stata rilasciata una nuova versione del modello linguistico Qwen 3.5. La versione 'small' potrebbe consentire consegne più efficienti su hardware con risorse limitate, aprendo nuove possibilità per applicazioni on-premise e ambienti edge.
Un nuovo studio presenta Task-Lens, un'analisi cross-task di 50 dataset vocali indiani in 26 lingue, valutandone l'idoneità per nove task di Natural Language Processing (NLP). La ricerca mira a superare la scarsità di dati, identificando metadati non sfruttati e lacune nelle risorse esistenti per migliorare lo sviluppo di tecnicie vocali inclusive.
Un nuovo modello discriminativo basato su Qwen3-0.6B affronta la segmentazione di documenti ultra-lunghi, superando i limiti dei modelli generativi in termini di velocità e supporto per input estesi. Il modello utilizza un approccio a finestra scorrevole e una fusione vettoriale per migliorare l'efficienza nel downstream retrieval.
Un nuovo framework, U-CAN, affronta le problematiche di privacy nei sistemi di raccomandazione generativa basati su LLM. U-CAN mitiga la perdita di utilità durante il machine unlearning, attenuando selettivamente i parametri sensibili nei low-rank adapter, preservando al contempo le prestazioni.
Un nuovo approccio, chiamato REPO (Representation Erasure-based Preference Optimization), mira a ridurre la generazione di output tossici da parte dei modelli linguistici di grandi dimensioni (LLM). REPO interviene a livello di rappresentazione interna del modello, forzando la convergenza delle rappresentazioni tossiche verso quelle benigne, dimostrando una maggiore robustezza rispetto ai metodi tradizionali.