Vulsar AI testi: Yapay zeka profesyonel yazarları geçemedi
Vulsar AI’nin 475 istemden oluşan yaratıcı yazarlık testinde GPT 6 Astra, amatör insan yazarları küçük bir farkla geride bıraktı. Profesyonel yazarlar ise kurgu, üslup ve uzun anlatı performansında yapay zeka modellerinin üzerinde yer aldı.

Vulsar AI tarafından gerçekleştirilen 475 istemlik yaratıcı yazarlık testi, gelişmiş yapay zeka modellerinin uzun metin üretimindeki performansını insan yazarlarla karşılaştırdı. Genel okuyucu tercihleri doğrultusunda eğitilmiş ödül modelleriyle yapılan değerlendirmede OpenAI’ın GPT 6 Astra modeli yüzde 87,8’lik öngörülen kazanma oranıyla yapay zeka modelleri arasında ilk sırada yer aldı.
Amatör insan yazarların yüzde 86,6’lık oranını küçük bir farkla geçen modelin ardından yüzde 77,6 ile GPT 5.6 Sol ve yüzde 70,3 ile Anthropic’in Claude Fable 5.1 modeli geldi. Profesyonel insan yazarlar ayrı kategoride değerlendirildiğinde ise bütün yapay zeka modellerinin üzerinde sonuç aldı.
GPT-6: ASTRA ZİRVEDE
Test sonuçları, en gelişmiş modellerin amatör düzeydeki insan yazarlara yaklaşabildiğini ve bazı ölçümlerde onları geçebildiğini gösterirken profesyonel yazarlıkta aynı tablonun oluşmadığını ortaya koydu. GPT 6 Astra’nın yüzde 87,8’lik sonucu, testte yapay zeka modelleri arasında en yüksek oranı oluşturdu.
Amatör insan yazarlarla arasındaki fark 1,2 puanda kalırken GPT 5.6 Sol ile Claude Fable 5.1 daha geride yer aldı. Profesyonel yazarların performansı ise kurgu ve üslup kalitesi bakımından tüm modellerin üzerinde kaldı.
MODEL BOYUTU
Daha düşük kapasiteli modellere geçildikçe performans oranlarında belirgin bir düşüş görüldü. Claude Opus 5, Kimi K3 ve Grok 4.6 gibi modeller yüzde 50 ile yüzde 65 arasında sonuçlar alırken, açık kaynaklı ve daha küçük ölçekli sistemlerde oranlar daha da geriledi.
Qwen3.8-27B yüzde 23,2, DeepSeek V4.1 Flash yüzde 19,8 seviyesinde kaldı. Gemma 4 26B ise yüzde 10,9’luk sonuçla listenin alt sıralarında yer aldı. Test, model kapasitesi azaldıkça uzun yaratıcı metin üretimindeki performans farkının daha görünür hale geldiğini ortaya koydu.

UZUN METİN FARKI
İstem başına üretilen metin hacminde de insan yazarlar ilk sırada yer aldı. İnsanların ortalama üretimi 2.592 token olarak ölçülürken Claude Fable 5.1, 2.114 token ile en yüksek hacme ulaşan yapay zeka modeli oldu. GPT 6 Astra ise istem başına 1.537 token üretti. Bu sonuçlar, yalnızca tercih oranlarında değil, uzun anlatı oluşturma kapasitesinde de insanlarla modeller arasında farklılık bulunduğunu gösterdi.
KURGU TUTARLILIĞI
Reddit ve teknoloji forumlarında yapılan geliştirici değerlendirmelerinde, özellikle daha küçük modellerin çok bölümlü ve karmaşık istemlerde anlatı bütünlüğünü korumakta zorlandığı, tekrar eden ifadelere yöneldiği ve kurgu derinliğini sürdüremediği belirtiliyor. İ
nsan yazarlar ise uzun metinlerde hikâye örgüsünü devam ettirme, anlatının tonunu değiştirme ve tempoyu farklı bölümlere göre ayarlama konusunda daha güçlü bir performans sergiliyor. Test sonuçları da profesyonel insan yazarların bu alanlarda yapay zeka modellerinin önünde kaldığını gösteriyor.
PROFESYONEL ÜSTÜNLÜK
Vulsar AI’nin çalışması, yapay zeka modellerinin yaratıcı yazarlıkta amatör insan performansına ulaşabildiğini, ancak profesyonel yayıncılık düzeyindeki üretimde aynı başarıyı gösteremediğini ortaya koyuyor.
En gelişmiş modeller yüksek tercih oranlarına ulaşırken, uzun anlatılarda kurgu bütünlüğü, üslup kontrolü, ton değişimi ve tempo yönetimi profesyonel yazarların öne çıktığı alanlar olmaya devam ediyor. Test, yapay zekanın içerik üretimindeki kapasitesinin büyüdüğünü ancak profesyonel yaratıcı yazarlığın bütün unsurlarını aynı düzeyde karşılayamadığını gösteriyor.
Yorum yazmak için giriş yapın.
Henüz yorum yok. İlk yorumu siz yazın.