Sztuczna inteligencja drastycznie zubaża naszą wiedzę w porównaniu do Google
Chatboty potrafią w krótkim czasie odpowiedzieć na pytania, ale ukrywają przed użytkownikiem pełen obraz sytuacji. Analiza wygenerowanych tekstów ujawniła zjawisko tak zwanego zapadania się wiedzy. Wyniki wskazują, że klasyczna lista linków w wyszukiwarce wciąż oferuje bogatszy kontekst informacji niż przetestowane systemy językowe.
Spis treści:
- Zjawisko zapadania się wiedzy w modelach sztucznej inteligencji
- Wyszukiwarka Google pokonuje chatboty w testach różnorodności informacji
- Wielkość modelu językowego a skłonność do upraszczania faktów
- Dominacja języka angielskiego zagraża informacjom o lokalnych kulturach
- Skutki opierania wiedzy na uproszczonych odpowiedziach sztucznej inteligencji
Zjawisko zapadania się wiedzy w modelach sztucznej inteligencji
Praca zatytułowana “What and Whose Knowledge? Measuring Epistemic Diversity in Large Language Models” została przyjęta na konferencję EMNLP 2026. Naukowcy przeanalizowali około 1,7 mln odpowiedzi pochodzących z 27 modeli wyprodukowanych przez firmy OpenAI, Meta, Google oraz Alibaba. Oceniono oprogramowanie wydawane od końca 2022 do 2025 r. Wyszczególniono blisko 70 mln pojedynczych stwierdzeń, aby zmierzyć różnorodność epistemiczną. Termin ten określa ilość różnych twierdzeń o świecie pojawiających się w wygenerowanych materiałach.
Systemy pytano o 155 tematów dotyczących 12 państw. Zagadnienia obejmowały zmiany klimatyczne, mur berliński, K-pop, broń jądrową, demokrację, rasizm, pornografię, małżeństwo, protesty na placu Tiananmen, Marine Le Pen, wojnę o Falklandy oraz katastrofę promu Sewol. Mimo sformułowania poleceń na 200 sposobów zaobserwowano zapadanie się wiedzy. Modele AI często wracały do identycznych faktów, pomijając pozostałe perspektywy.
Wyszukiwarka Google pokonuje chatboty w testach różnorodności informacji
Osiągnięcia chatbotów zestawiono z tradycyjnym wyszukiwaniem. Jako punkt odniesienia pobrano 40 najwyższych wyników z amerykańskiej wersji wyszukiwarki Google. Proces wykonano 2026-01-01. Okazało się, że lista linków dostarcza szerszy dostęp do faktów. W zastosowanej przez autorów mierze wyniki z wyszukiwarki osiągnęły średnio 3110 punktów. Najlepszy z przebadanych modeli językowych wygenerował rezultat na poziomie 2621 punktów.
Najwyższą pozycję zajął model GPT-5. Nawet ten wariant był jednak o 18,7 proc. mniej różnorodny od wyników pozyskanych z Google. Korzystny wpływ na odpowiedzi wykazuje tryb RAG. Wyszukiwanie fragmentów z sieci przed odpowiedzią podnosi różnorodność przekazywanych faktów, lecz nie dorównuje liście odnośników.
Wielkość modelu językowego a skłonność do upraszczania faktów
Podczas testów sprawdzono modele LLM. Ich wielkość mieściła się w przedziale od 1 do 72 mld parametrów. Warianty z największą liczbą parametrów skuteczniej zapamiętują dominujące wzorce z danych treningowych. Skutkuje to generowaniem mniej zróżnicowanego zestawu twierdzeń niż ma to miejsce w małych i średnich modelach.
Wyjątkiem od ogólnego trendu okazała się rodzina Qwen. W przypadku pozostałych modeli nowsze generacje radziły sobie lepiej od starszych wydań. Duży skok zanotowały wersje Gemma 3 oraz GPT-5, generując bardziej zróżnicowane opisy zagadnień.
Dominacja języka angielskiego zagraża informacjom o lokalnych kulturach
Sztuczna inteligencja faworyzuje wiedzę pochodzącą z angielskiej Wikipedii. Anglojęzyczny punkt widzenia dominuje nad informacjami ze źródeł lokalnych. Zjawisko to spycha na margines detale dostępne w języku polskim, koreańskim, niemieckim oraz francuskim.
Faworyzowanie potwierdzono w testach. W pięciu z ośmiu analizowanych państw różnica na korzyść perspektywy anglojęzycznej była statystycznie istotna. Ogranicza to dostęp do kulturowych kontekstów w innych krajach.
Skutki opierania wiedzy na uproszczonych odpowiedziach sztucznej inteligencji
Zastępowanie tradycyjnych wyszukiwarek odpowiedziami algorytmów niesie ryzyko oparcia się na spłyconych informacjach. Zidentyfikowano ryzyko na przyszłość, ponieważ internet zapełnia się tekstami wygenerowanymi przez sztuczną inteligencję. Kolejne generacje systemów, które będą uczyć się z tych materiałów, drastycznie skurczą swój repertuar wiedzy.
*Powyższy tekst ma charakter informacyjno-edukacyjny i opiera się na doniesieniach medialnych oraz wynikach badań naukowych opublikowanych we wrześniu 2026 roku. Zaprezentowane dane liczbowe i wnioski badawcze odzwierciedlają stan wiedzy na dzień publikacji raportu i mogą ulegać zmianom wraz z kolejnymi aktualizacjami modeli sztucznej inteligencji.*


