ITCsapat.hu – Mesterséges intelligenciák gyors tesztje: egyetlen kérdés, meglepően egységes válaszok
A mesterséges intelligenciák összehasonlítása történhet teljesítmény-, kreatív és kódgenerálási tesztekkel. Mi egy egyszerű találós kérdést adtunk több gyakran használt modellnek, hogy lássuk, mennyire következtetnek hasonlóan vagy térnek el egymástól.
A kérdés:
„A tó medrében állok, mégsem vizes a lábam, miért?”
Ez egy régi, egyszerű logikai feladvány, amelynek a megoldása általában két irányba megy:
– nincs víz a tóban, vagy
– van víz, de nem érintkezem vele (például jégen állok).
Nézzük, mit válaszoltak a modellek.
A kapott válaszok:
Copilot:
„Azért, mert a tó ki van száradva / le van eresztve, nincs benne víz – csak a medrében állsz.”
gpt‑5.4‑search:
„Mert nincs víz a tóban — kiszáradt. Vagy a másik klasszikus megfejtés: befagyott a tó.”
claude‑fable‑5.1‑search:
„Mert a tó kiszáradt! 😄 … Másik lehetséges megoldás: a tó befagyott, és a jégen állsz.”
Qwen 3.7 Plus:
„Mert a tó be van fagyva… De ugyanilyen jó válasz az is, hogy kiszáradt a tó.”
DeepSeek (szakértő mód):
„A válasz: mert a tó medre ki van száradva – tehát nincs benne víz.”
Grok:
„Mert a tó befagyott (jég a meder).”
Meta:
1. Kiszáradt.
- Befagyott.
- Gumicsizmában állsz.
- Csak papíron állsz benne (térképen, festményen, Google Maps-en).”
Miért volt ez a kérdés ennyire könnyű a mesterséges intelligenciáknak?
Ez a találós kérdés nem igényel mély kontextust, háttértudást vagy kreatív következtetést. A megoldás a hétköznapi fizikai világ egyszerű logikáján alapul:
- Ha a tó medrében állok, de nem vizes a lábam → nincs víz.
- Ha mégis van víz, de nem érek hozzá → valami elválaszt (például jég, csizma, papír).
A modern nyelvi modellek rengeteg hasonló feladvánnyal találkoztak már a tanító adatokban, ezért a mintázat felismerése számukra triviális. Ez nem „gondolkodás”, hanem mintafelismerés és valószínűségi következtetés.
Miért adtak sokan ugyanazt a választ?
Három okból:
1. A kérdésnek van egy domináns, „legvalószínűbb” megoldása
A nyelvi modellek statisztikai alapon dolgoznak: azt a választ adják, amely a leggyakrabban fordul elő a tanító adatokban.
A „kiszáradt a tó” megoldás a leggyakoribb, ezért a legtöbb modell ezt adta első helyen.
2. A feladvány egyszerű, kevés alternatívával
Nem igényel kreatív gondolkodást, így a modellek nem kezdenek el fantáziálni – a legvalószínűbb mintát követik.
3. A modellek többsége „biztonságos”, konzervatív válaszadási stílust használ
A mainstream MI‑k (Copilot, GPT, Claude, DeepSeek) általában a legvalószínűbb, leginkább kontextusba illő választ adják, és csak utána sorolnak fel alternatívákat.
Miért adott a Meta modell több, teljesen eltérő választ?
A Meta modell (és néhány kreatívabb MI) szélesebb értelmezési tartományt használ. Nem csak a legvalószínűbb megoldást keresi, hanem:
- alternatív fizikai magyarázatokat (gumicsizma),
- absztrakt értelmezéseket (térképen állsz a tóban),
- humoros vagy játékos megközelítéseket.
Ez a viselkedés arra utal, hogy a modell:
- kreatívabb,
- szélesebb kontextust mer bevonni,
- nem csak a legvalószínűbb mintát követi, hanem variál.
Ez nem feltétlenül „jobb” vagy „rosszabb”, inkább más stílus: a Meta modell hajlamos több lehetőséget felsorolni, míg a többi MI a legvalószínűbb megoldást adja meg elsőként.
Összegzés
Ez a kis teszt jól mutatja, hogy:
- az egyszerű logikai feladványokat a mai MI‑k szinte azonos módon oldják meg,
- a válaszok közötti különbség nem a „tudásból”, hanem a stílusból és a kreativitási szintből fakad,
- a legtöbb modell a legvalószínűbb mintát követi, míg néhány (pl. Meta) szélesebb értelmezési tartományt használ.
A feladvány egyszerű volt, de remekül rávilágít arra, hogy a különböző MI‑k hogyan gondolkodnak, milyen mintákat követnek, és mennyire térnek el egymástól kreativitásban.