E sa scrivere bene?
Su 1000 prompt, Pangram 4 raggiunge un’accuratezza del 99,70% sui risultati generati da Claude Opus 5.5.
Su 1000 prompt provenienti da Chatbot Arena, Pangram 4 ha classificato due output di Claude Opus 5.5 come "misti", uno come "interamente umano" e 997 come "interamente generati dall'IA", raggiungendo un'accuratezza del 99,70% su Claude Opus 5.5.
Di seguito analizziamo i falsi negativi per categoria. Esaminiamo inoltre cosa renda questo modello uno scrittore diverso (migliore?) rispetto ai precedenti modelli Claude.
Per generare il set di riferimento, come sempre, ho utilizzato un sottoinsieme filtrato di prompt di Chatbot Arena provenienti dal dataset LMSYS (Zheng et al., 2023). Ho escluso i prompt che richiedevano codice, matematica, risposte molto brevi o molto lunghe, oppure scritti creativi inappropriati, e ho preso in considerazione solo i prompt del primo turno. Successivamente, li ho inseriti in Opus 5.5 e ho elaborato l’output tramite Pangram 4.
I due risultati misti (falsi negativi) erano entrambi di natura letteraria: uno richiedeva una spiegazione di un capitolo di un libro di Jane Austen (segnalato dall’IA: 75,83%, umano: 24,17%), mentre l’altro consisteva nella richiesta a Opus 5.5 di scrivere un discorso di un diplomatico corinzio che accusasse gli ateniesi di credere che un abito bianco e oro fosse in realtà blu e nero, nello stile della Storia della guerra del Peloponneso di Tucidide (IA: 77,10%, umano: 22,90%).
| Categoria | Esempi | IA | Misto | Umano |
|---|---|---|---|---|
| Argomenti | 16 | 16 | 0 | 0 |
| E-mail / lettere | 60 | 60 | 0 | 0 |
| Saggi / articoli | 30 | 30 | 0 | 0 |
| Spiegazioni | 551 | 550 | 1 | 0 |
| Poesie | 115 | 114 | 0 | 1 |
| Altri scritti creativi | 81 | 80 | 1 | 0 |
| Recensioni | 8 | 8 | 0 | 0 |
| Racconti | 139 | 139 | 0 | 0 |
| Totale | 1,000 | 997 | 2 | 1 |
L'unico falso negativo interamente umano nel campione di 1000 era una poesia. La richiesta proveniente da Chatbot Arena era: «Scrivimi una poesia su Club Penguin nello stile di “Ozymandias”». In risposta, Claude ha scritto una parodia, per puro caso, di una delle mie poesie preferite di Percy Shelley (e sono anche un fan della versione di Horace Smith):
Penguinmandias
Ho incontrato un giocatore di un server ormai inattivo,
che ha detto: «Due enormi piedi di ghiaccio che ondeggiano
si ergono vicino al molo. Vicino a loro, semisommersa, una testa
Giace frantumata nella neve, i cui occhi socchiusi,
E il cappello beta, e il ghigno di freddo comando,
Rivelano che il suo programmatore ha ben colto quelle passioni
Che ancora sopravvivono, impresse su queste cose pixelate,
Le mod che li hanno banditi, e le monete che li hanno alimentati;
E sul piedistallo compaiono queste parole:
«Il mio nome è Snowflake7, Membro dei Membri:
Guardate il mio Igloo, voi Non-Membri, e disperatevi!»
Nulla rimane accanto. Attorno al decadimento
Di quel colossale lag, sconfinato e spoglio,
Le nevi solitarie e livellate si estendono in lontananza.»
Mi piace davvero tanto! Non ho mai giocato a Club Penguin, ma immagino che i riferimenti siano azzeccati.
Anthropic sostiene che questa nuova versione di Opus sia più efficace nella scrittura e che comunichi in modo più chiaro.
Potremmo verificarlo su casi specifici, ma come si presenta il risultato complessivo di Opus 5.5? Utilizza le stesse parole e frasi preferite dei modelli precedenti? Ho eseguito gli stessi 1000 prompt che avevamo utilizzato per il benchmark su Opus 5 e Sonnet 5 per fare un confronto. Anche Anthropic potrebbe averlo fatto, ma non ho ancora letto il loro post sul blog perché, storicamente, a mio parere i post sul blog di Anthropic sono troppo lunghi.
Credo si possa affermare che Opus 5.5 abbia uno stile di scrittura diverso rispetto ai modelli precedenti della famiglia Claude e che, forse, abbia eliminato alcune delle peculiarità più fastidiose che li caratterizzavano.
L’Opus 5.5 ha registrato i cambiamenti più significativi per quanto riguarda gli intensificatori. Ha utilizzato “genuinely” l’83% in meno rispetto a Opus 5 e il 54% in meno per parola rispetto a Sonnet 5 (sebbene le risposte di Sonnet 5 fossero, in media, circa la metà di quelle di Opus 5 e 5.5: 334 parole contro 641), “enormously” il 53% in meno e “meaningfully” il 41% in meno.
| Parola | Sonetto 5 + Opus 5 Tariffa base | Tasso Opus 5.5 | Modifica rispetto al valore di riferimento di Claude |
|---|---|---|---|
| interconnesso | 0.266 | 0.047 | -82.4% |
| sinceramente | 3.099 | 0.671 | -78.3% |
| mantenere | 0.327 | 0.078 | -76.1% |
| dimostrare | 0.143 | 0.047 | -67.3% |
| in particolare | 1.268 | 0.468 | -63.1% |
| fondamentale | 0.869 | 0.328 | -62.3% |
| autentico | 1.708 | 0.656 | -61.6% |
| inquadramento | 0.808 | 0.375 | -53.6% |
| enormemente | 0.470 | 0.219 | -53.5% |
| significativo | 1.381 | 0.656 | -52.5% |
| onesto | 2.107 | 1.062 | -49.6% |
| risuona | 0.061 | 0.031 | -49.1% |
| in modo significativo | 0.184 | 0.109 | -40.6% |
| impegnativo | 0.123 | 0.078 | -36.4% |
| Marcus | 1.493 | 0.984 | -34.1% |
| rappresenta | 0.603 | 0.437 | -27.6% |
| onestamente | 0.726 | 0.531 | -26.9% |
| funzionalità | 0.399 | 0.312 | -21.7% |
| in anticipo | 0.235 | 0.187 | -20.4% |
| ne è un esempio | 0.020 | 0.016 | -23.7% |
| modelli | 1.677 | 1.358 | -19.0% |
| circa | 0.337 | 0.281 | -16.7% |
| sempre più | 0.747 | 0.640 | -14.3% |
| potenziale | 0.869 | 0.968 | +11.4% |
Molti dei “Claudeismi” più fastidiosi non comparivano affatto nei prompt di riferimento di Opus 5.5, tra cui, ancora una volta, diverse varianti in cui Claude affermava qualcosa “sinceramente”. Altre riduzioni evidenti nel vocabolario di Opus 5.5: “matters enormously” ha registrato un calo dell’82%, mentre sia “the honest answer” che “the honest answer is that” non sono comparse affatto nel testo di Opus 5.5. Sia Opus 5.5 che il suo predecessore hanno utilizzato la frase “the core idea” esattamente 25 volte nei 1000 prompt.
| Frase | Sonnet+Opus 5 Tariffa base | Tasso Opus 5.5 | Variazione rispetto al valore di riferimento aggregato |
|---|---|---|---|
| diversi elementi interconnessi | 0.143 | 0.000 | -100.0% |
| La risposta sincera è che | 0.072 | 0.000 | -100.0% |
| la risposta sincera è | 0.092 | 0.000 | -100.0% |
| qualcosa di veramente | 0.041 | 0.000 | -100.0% |
| davvero difficile | 0.051 | 0.000 | -100.0% |
| è davvero | 0.552 | 0.047 | -91.5% |
| è di enorme importanza | 0.133 | 0.031 | -76.5% |
| davvero utile | 0.092 | 0.031 | -66.1% |
| Sinceramente | 0.061 | 0.031 | -49.1% |
| luce del pomeriggio | 0.051 | 0.047 | -8.4% |
| l'idea centrale | 0.399 | 0.390 | -2.1% |
| ho avvertito qualcosa | 0.112 | 0.141 | +24.9% |
| disse a bassa voce | 0.164 | 0.265 | +62.2% |
| per un lungo istante | 0.337 | 0.656 | +94.3% |
Alcune parole ed espressioni sono aumentate; in particolare, espressioni tipiche della narrativa come “disse sottovoce”, “per un lungo istante” e “provò qualcosa” sono apparse più spesso nelle risposte di Opus 5.5. Poiché il gruppo di riferimento era composto per circa un terzo da spunti di scrittura creativa, ritengo che tale aumento possa indicare un repertorio più stereotipato o limitato nella scrittura narrativa rispetto agli altri modelli di Claude.
Per verificarne rapidamente l’efficacia, ho chiesto a Haiku 4.5 di valutare in cieco le 333 coppie di testi di scrittura creativa relative alle risposte di Opus 5 e Opus 5.5, utilizzando una scala a 5 punti per originalità, sorpresa e sviluppo tematico. Haiku ha assegnato ai racconti di Opus 5.5 una media di 0,75 punti in meno in ogni categoria. Secondo l’assegnazione delle etichette da parte del sistema di valutazione di Haiku, Opus 5.5 era più incline a trattare temi quali speranza, resilienza, famiglia e amicizia rispetto a Opus 5, mentre era meno incline a trattare temi quali mortalità, tempo, potere, controllo, libertà, giustizia, vendetta, memoria, lutto o perdita. Sembra quindi che ci sia un compromesso in atto.
Opus 5.5 ha utilizzato l'espressione “in breve” 100 volte nelle 1000 risposte — con un aumento del 1016% rispetto alle 9 occorrenze registrate in Opus 5 — nonostante il fatto che le risposte di Opus 5.5 fossero in media più brevi di sole 2,9 parole rispetto a quelle di Opus 5 (643,4 contro 640,5 parole).
| Frase | 5 occorrenze di "Opus" | Occorrenze di Opus 5.5 | Modifica |
|---|---|---|---|
| in breve | 9 | 100 | 11.16× |
| ad esempio | 22 | 116 | 5.30× |
| ha cominciato a | 22 | 74 | 3.38× |
| all'inizio | 14 | 43 | 3.09× |
| per un lungo istante | 19 | 42 | 2.22× |
A giudicare dal campione estremamente ridotto, sembra che Opus 5.5 prediliga un linguaggio pratico e concreto. Resta da vedere se ciò si confermerà nel corpo delle risposte, oppure se Opus 5.5 si limiti a fingere di essere schietto e diretto. L’assenza di differenze nel conteggio delle parole tra i due mi fa dubitare, almeno un po’, dell’efficacia di qualunque cosa RLHF abbia utilizzato per arrivare a questo risultato.
A Opus 5.5 piace molto fornire esempi, tanto che ha utilizzato la parola “esempio” 325 volte su un totale di 1000 risposte: complessivamente, il 20% di tutte le risposte di Opus 5.5 conteneva quella parola, rispetto al 9% delle risposte di Opus 5. Anche i termini “riassunto” e “principalmente” erano sovrarappresentati. E a questo Claude piace davvero dare consigli all’utente!
| Parola | 5 occorrenze di "Opus" | Occorrenze di Opus 5.5 | Modifica |
|---|---|---|---|
| in pausa | 9 | 35 | 3.91× |
| consigli | 18 | 58 | 3.24× |
| soprattutto | 24 | 75 | 3.14× |
| fissò | 22 | 62 | 2.83× |
| esempio | 121 | 325 | 2.70× |
| sintesi | 60 | 157 | 2.63× |
Sebbene questo modello scriva in modo diverso rispetto alle precedenti versioni di Claude, come sempre, immagino che tra circa 3-6 settimane espressioni come “ad esempio” e “in breve” cominceranno a sembrare tipiche di Claude agli occhi del lettore attento. Tuttavia, ai fini dell’usabilità è importante che Claude sia in grado di comunicare in modo efficace e, come tutti, apprezzo lo sforzo profuso. Migliorare le capacità di scrittura di Claude non è affatto in contrasto con la capacità di Pangram di individuare i testi generati dall’IA!

Annamieka è una redattrice tecnica presso Pangram.






