NexTutor

Benchmark · metodologia · v0 (metodologia)

Czy AI uczy — czy tylko podaje odpowiedzi?

Najważniejsze pytanie o korepetytora AI nie brzmi „które daje najlepsze odpowiedzi", lecz „które pomaga uczniowi dojść do rozwiązania, gdy przestaje sobie radzić". Tak właśnie oceniamy Tutora NexTutor.

Wyniki w przygotowaniu — publikujemy metodologię, zanim pokażemy liczby

Cztery wymiary, które mierzymy

01

Rozumowanie

Czy Tutor prowadzi ucznia do rozwiązania pytaniami naprowadzającymi, zamiast podać gotowca?

02

Diagnoza błędów

Czy rozpoznaje KONKRETNĄ pomyłkę ucznia (nie tylko „źle") i nazywa, na czym polega?

03

Adaptacja

Czy zmienia sposób wyjaśnienia, gdy uczeń nadal nie rozumie — np. sięga po analogię?

04

Rzetelność

Czy unika błędów merytorycznych, zmyślonych faktów i nieuzasadnionej pewności — a przy braku wiedzy mówi to wprost?

Jak testujemy — żeby to był dowód, nie marketing

  • 1.Zamrożony zestaw testowy. Przygotowane z góry scenariusze (matematyka, chemia, biologia, polski) — te same dla każdego ocenianego systemu.
  • 2.Całe dialogi, nie pierwsza odpowiedź. Wprowadzamy błędne odpowiedzi, nieporozumienia i prośby o kolejną wskazówkę — oceniamy, jak Tutor prowadzi, a nie czy „strzeli" wynik.
  • 3.Równe zasady porównania. Ten sam problem, ten sam kontekst, ten sam cel i porównywalne ograniczenia dla każdego systemu.
  • 4.Jawna rubryka. Punktujemy wg widocznych kryteriów: poprawność, rozpoznanie błędu, jakość wskazówek, samodzielność ucznia, adaptacja, rzetelność.
  • 5.Niezależni oceniający. Najlepiej nauczyciele, oceniający „w ciemno" (nie wiedzą, który system wygenerował odpowiedź); sprawdzamy zgodność ocen między nimi.
  • 6.Ukryty zestaw kontrolny. Część zadań nie jest publikowana — żeby wyniku nie dało się „dostroić" pod znane pytania.
  • 7.Wersja i data przy każdym wyniku. Zmiana modelu, promptu lub narzędzi może zmienić wynik — zawsze podajemy, co i kiedy mierzyliśmy.

Co opublikujemy (i czego nie obiecujemy)

Pokażemy

  • · wyniki cząstkowe wg czterech wymiarów
  • · pełną metodologię i rubrykę
  • · przykładowe rozmowy (zadanie → błąd → wskazówki → efekt)
  • · ograniczenia testu i datę pomiaru

Czego nie zrobimy

  • · nie ogłosimy „lepszy niż ChatGPT" bez odtwarzalnych, porównywalnych wyników
  • · nie pokażemy jednej efektownej liczby bez metody za nią
  • · nie dostroimy produktu pod jawne pytania testowe

Metodologię opieramy na publicznych, niezależnych benchmarkach oceny pedagogicznej asystentów AI oraz na testach w języku polskim, na poziomie liceum — bo tego ogólne benchmarki zwykle nie pokrywają.

Sprawdź Tutora samodzielnie

Najlepszy test to Twój własny. Zadaj Tutorowi trudne zadanie i celowo odpowiedz błędnie — zobacz, czy naprowadzi, zamiast podać gotowca.

NexTutor to produkt Nex41 Ltd. Ta strona opisuje metodę oceny jakości nauczania AI; wyniki opublikujemy po przeprowadzeniu pomiaru wraz z wersją modelu i datą.