Jak oceniać zadania programistyczne, gdy kandydaci korzystają z AI

Jak połączyć zadanie związane ze stanowiskiem z rozmową o rozwiązaniu. Kryteria oceny, wynagrodzenie za zadanie i przykłady procesów rekrutacji.

Ernest Bursa

Ernest Bursa

Founder · · 12 min czytania
Two engineers pair programming on a real codebase at a sunlit co-working table, one narrating a decision while the other types

Samo rozwiązanie zadania przy tablicy daje ograniczony obraz umiejętności kandydata. Kontrolowane badanie z NC State i Microsoftu wykazało, że kandydaci podczas obserwowanych rozmów technicznych radzili sobie blisko o połowę gorzej niż ci, którzy rozwiązywali ten sam problem na osobności. Generatywne AI rozwiązuje dziś w kilka minut zarówno łamigłówki z tablicy, jak i zadania domowe. Warto rozważyć próbkę pracy: zadanie związane z realną rolą, które kończy się rozmową, podczas której kandydat wyjaśnia swoje decyzje i modyfikuje rozwiązanie.

AI może pomagać zarówno w pisaniu kodu, jak i w odpowiedziach podczas rozmowy. Nie istnieje więc prosta gwarancja odporności na taką pomoc. Omówienie rozwiązania daje jednak dodatkową okazję do sprawdzenia, co kandydat rozumie i jak podejmuje decyzje. Poniżej porównujemy formaty oceny i przykłady procesów Anthropic, Stripe, Vercel i Linear.

Co może zakłócać ocenę przy tablicy

Ograniczenia tego formatu badano jeszcze przed upowszechnieniem generatywnego AI.

Jednym z problemów jest wpływ obserwacji na wynik. W kontrolowanym eksperymencie Behroozi i współpracownicy z NC State i Microsoftu (2020) kazali kandydatom rozwiązywać ten sam problem w dwóch warunkach: w samotności oraz pod obserwacją prowadzącego, w klasycznym układzie przy tablicy. Kandydaci w wariancie obserwowanym radzili sobie mniej więcej o połowę gorzej. Wynik sugeruje, że stres i obciążenie pamięci podczas obserwacji mogą zakłócać ocenę. Sam eksperyment nie dowodzi jednak, że format mierzy wyłącznie stres ani że każda grupa kandydatów reaguje tak samo.

Drugi problem pojawił się w 2025 roku. Nakładki w stylu Cluely, Interview Coder czy Leetcode Wizard niewidocznie podsuwają odpowiedzi w trakcie udostępniania ekranu. Standardowe zadanie typu LeetCode rozwiązuje się po cichu w tle, podczas gdy kandydat tylko przepisuje. Jeśli oceniasz tylko poprawność odpowiedzi na znaną łamigłówkę, trudniej oddzielić umiejętności kandydata od możliwości jego narzędzi.

Inną formą kodowania na żywo jest praca oparta na współpracy: parowanie w prawdziwym IDE nad realistycznym problemem, gdzie prowadzący jest partnerem myślącym razem z kandydatem, a nie nadzorcą czekającym na właściwą odpowiedź. To sprawdza, jak ktoś rozumuje, zadaje pytania i pracuje w nieznanym kodzie. Bliżej tu prawdziwej pracy, a nakładką znacznie trudniej to podrobić.

Jak oceniać zadanie wykonane bez nadzoru

Przy zadaniu wykonywanym bez nadzoru zakładaj dostęp do narzędzi AI i jasno określ zasady ich użycia.

Zadanie domowe może przypominać obowiązki na stanowisku. Sam oddany kod nie pokazuje jednak, ile kandydat rozumie z rozwiązania. Dostawca ocen Fabric podaje, że zadanie domowe zaprojektowane na trzy godziny narzędzia AI kończą w ok. osiem minut, a odsetek ściągania w jego puli kandydatów wzrósł przez 2025 rok ponad dwukrotnie (z około 15% do 35%). Te konkretne liczby traktuj raczej kierunkowo niż jak wyrocznię; pochodzą od dostawcy, bez niezależnych źródeł. Dobrze napisany kod nie jest dowodem niesamodzielnej pracy.

Niektóre zespoły sięgają po nadzór: śledzenie wzroku, logowanie naciśnięć klawiszy, blokowanie ekranu, szpiegowanie przeglądarki. Przed jego zastosowaniem uwzględnij trzy problemy.

  • Może zniechęcać kandydatów. Rejestrowanie zachowania na prywatnym komputerze może budzić sprzeciw i pytania o prywatność.
  • Tworzy własne problemy z uprzedzeniami i dostępnością. Narzędzia blokujące ekran i śledzące wzrok mogą stwarzać dodatkowe bariery dla osób neuroróżnorodnych, z niepełnosprawnościami lub niestandardowym sprzętem. Akt o sztucznej inteligencji (rozporządzenie 2024/1689) zalicza narzędzia AI oceniające kandydatów do systemów wysokiego ryzyka, a Kodeks pracy (art. 18(3a) i nast.) czyni pracodawcę odpowiedzialnym za nierówne traktowanie w rekrutacji, niezależnie od tego, kto zbudował narzędzie.
  • Nie daje pełnej kontroli. Dodatkowy monitor lub telefon może umożliwić pomoc spoza obserwowanego środowiska.

Kontekst lokalny

Aktualizacja z 6 września 2026: po wejściu w życie AI Omnibus 27 lipca 2026 termin stosowania obowiązków dla systemów wysokiego ryzyka z załącznika III, obejmującego określone zastosowania w rekrutacji, przesunięto z 2 sierpnia 2026 na 2 grudnia 2027. Potwierdza to Komisja Europejska. Zakres obowiązków zależy m.in. od klasyfikacji systemu oraz roli dostawcy lub podmiotu stosującego. Obejmuje odpowiednio nadzór człowieka, monitorowanie i dokumentowanie użycia. Nie należy utożsamiać obowiązków dostawcy dotyczących dokumentacji technicznej z obowiązkami każdego pracodawcy. Wskazane naruszenia mogą podlegać karom do 15 mln euro lub 3% światowego rocznego obrotu, z zasadami i wyjątkami określonymi w art. 99. Zobacz tekst rozporządzenia, art. 26, 99 i 113. Sama rozmowa na żywo ani karta oceny nie zapewnia zgodności z prawem.

Zaprojektuj ocenę tak, by obejmowała tok rozumowania, sprawdzanie kodu i reakcję na zmianę wymagań. W niektórych rolach można pójść dalej i wprost pozwolić na AI w trakcie zadania, a potem oceniać, jak dobrze kandydat nim kieruje i jak go krytykuje, bo to odzwierciedla faktyczną pracę.

Jak dobrać format oceny

Dopasuj format do codzienności roli i zadbaj, by przynajmniej jedna runda pozwalała obserwować podejmowanie decyzji. Nie ma jednego najlepszego formatu; jest najlepszy format dla tej roli.

Format Kiedy jest przydatny Co pozwala sprawdzić
Programowanie w parze nad realistycznym problemem Role, w których współpraca i praca w nieznanym kodzie to istota zadania Sposób rozumowania i współpracę przy zmieniającym się zadaniu
Zadanie domowe + obrona na żywo Role, w których istotą jest głęboka, samodzielna praca asynchroniczna Runda obrony sprawdza decyzje, których kandydat musi bronić na głos
Projektowanie systemu Role na poziomie seniora i role infrastrukturalne Chodzi o kompromisy i komunikację, a nie o odpowiedzi do wyciągnięcia z głowy
Asynchroniczny code review prawdziwego kodu Zespoły pracujące głównie zdalnie i asynchronicznie Sprawdza rozumienie i krytykę, a nie generowanie

Poproś kandydata o wyjaśnienie decyzji dotyczących rozwiązania. Wybierz format związany z obowiązkami na stanowisku i zaplanuj pytania, które sprawdzą rozumienie pracy.

Praktyczny domyślny wybór dla większości startupowych ról inżynierskich to drugi wiersz: krótkie, płatne, realistyczne zadanie domowe, które staje się agendą rozmowy na żywo. Pozwala to ocenić oddaną pracę i osobno sprawdzić jej rozumienie. Jeśli interesuje cię sposób projektowania samego zadania domowego (zakres, budżet czasu, ocenianie), zobacz nasz pogłębiony tekst o tym, jak przygotować zadania programistyczne.

Jak poprowadzić rozmowę o rozwiązaniu

Po oddaniu zadania możesz zapytać: „Przeprowadź mnie przez to. A teraz zmień wymaganie X. Dlaczego wybrałeś to, a nie alternatywę?”.

Przeznacz 20–30 minut na wybór modelu danych, ograniczenia rozwiązania i zmianę jednego wymagania. Model może pomagać także w takich pytaniach, dlatego rozmowa nie jest dowodem autorstwa. Daje jednak dodatkowe informacje o tym, co kandydat potrafi wyjaśnić, sprawdzić i zmienić.

Rozmowa o wcześniej wykonanej pracy może ograniczyć presję związaną z pisaniem od zera. Nadal wymaga jasnych kryteriów i uwzględnienia potrzeb kandydata. Przywołane badanie nie ustala trafności prognostycznej tej konkretnej formy rozmowy.

Konkretnie, w dowolnym procesie wygląda to tak:

  1. Kandydat wykonuje małą, realistyczną, płatną próbkę pracy asynchronicznie.
  2. 25-minutowa sesja na żywo zaczyna się od „przeprowadź mnie przez swoje podejście”.
  3. Zmieniasz jedno wymaganie na żywo i patrzysz, jak się dostosowuje.
  4. Prosisz, by od ręki zdebugował lub rozbudował jeden fragment.
  5. Recenzenci oceniają rozumowanie według karty oceny, zanim ktokolwiek zacznie omawiać kandydata.

Oceniaj odpowiedzi i działania według ustalonych kryteriów. Samo zawahanie nie dowodzi niesamodzielności.

Jak naprawdę rekrutują Anthropic, Stripe, Vercel i Linear

Poniższe opisy pokazują różne sposoby łączenia zadań i rozmów. Szczegóły mogą zależeć od stanowiska.

Anthropic prowadzi screening z rekruterem, techniczny screening telefoniczny, a potem albo zadanie domowe, albo około 60-minutową ocenę na żywo (zależnie od roli, w CodeSignal i wprost nie w stylu LeetCode), po czym następuje cztery do sześciu rund onsite, w tym projektowanie systemu i mocno ważona runda wartości. Co najistotniejsze, firma, która tworzy Claude, publikuje jawną politykę używania AI przez kandydatów. Po zwrocie z lipca 2025 kandydaci mogą używać AI do dopracowania materiałów aplikacyjnych, ale jest ono zabronione w rozmowach na żywo i zadaniach domowych: „Wykonaj je bez Claude’a, chyba że wskażemy inaczej. Chcemy ocenić twoje unikalne umiejętności”. To przykład jawnych zasad dla kandydatów; nie gwarancja ich przestrzegania.

Stripe prowadzi celowo praktyczny proces: zdebuguj nieznaną bazę kodu, zbuduj od zera małą integrację, rozwiąż wieloczęściowe problemy, opowiadając na głos swój tok myślenia. Część rund odbywa się jako parowanie. Świadomie bliżej tu prawdziwej inżynierii niż programowania konkursowego.

Vercel stosuje wspólną sesję kodowania nastawioną na budowanie, plus projektowanie systemu, z naciskiem na decyzje produktowe dotyczące frontendu i na komunikację.

Linear stosuje krótki (około trzygodzinny), płatny projekt w stylu próby pracy, po którym następuje rozmowa wokół code review, i wymaga niemal jednomyślnego „zdecydowanego tak” od panelu, żeby złożyć ofertę.

Innym przykładem jest wzorzec w stylu GitLaba: asynchroniczny code review prawdziwego merge requesta jako podstawa rozmowy na żywo. Sprawdza czytanie i krytykę prawdziwego kodu zamiast jego generowania, co pasuje do pracy zdalnej i asynchronicznej. Sens wyliczania pięciu różnych podejść nie polega na tym, że jedno jest poprawne. Polega na tym, że każda firma dopasowała format do tego, jak naprawdę pracuje, a kandydat może omówić swoją pracę podczas rozmowy.

Czy nowy format jest naprawdę bardziej sprawiedliwy? Co mówią dowody

Próbki pracy związane z realną rolą należą do najtrafniejszych i najmniej obciążonych uprzedzeniami metod selekcji, ale tylko gdy są ustrukturyzowane. Sprawiedliwość bierze się ze struktury, związku z pracą i spójności, a nie z samej etykiety formatu.

Uważaj z liczbami, bo kanon został niedawno skorygowany. Sackett, Zhang, Berry i Lievens (2022) ponownie przeanalizowali dekady badań nad selekcją personelu i obniżyli kilka długo cytowanych szacunków trafności:

  • Ustrukturyzowane rozmowy są dziś pojedynczym najlepszym predyktorem, z trafnością operacyjną na poziomie około .42 (skorygowane w dół z .51).
  • Testy próbek pracy plasują się około .33 (mocno skorygowane w dół z długo cytowanego .54).
  • Ogólne zdolności poznawcze plasują się około .31 (w dół z .51).

To szacunki dla szerokich kategorii metod i różnych zawodów. Nie oznaczają, że każda obrona zadania ma trafność 0,42 ani że automatycznie przewyższa próbkę pracy. Wspierają stosowanie ustalonych pytań i kryteriów, ale własny format trzeba ocenić osobno.

Przy ocenie uprzedzeń warto porównywać wielkości efektu z recenzowanych badań. Metaanaliza Aamodta wykazała, że rozmowy nieustrukturyzowane są znacznie podatniejsze na uprzedzenia (d = .59) niż ustrukturyzowane (d = .23), a różnice w wynikach między grupami rasowymi maleją wraz ze wzrostem struktury. Uwzględnij też wynagrodzenie: płać kandydatom za istotne etapy z próbką pracy. Campion i współpracownicy (2025) ustalili, że praktyka i płatne testy próbek pracy zmniejszają różnice w wynikach między podgrupami, a płacenie za prawdziwą pracę podnosi też odsetek ukończeń i pomaga opiekunom oraz kandydatom o niższych dochodach, których nie stać na oddawanie nieopłaconych godzin.

Dlaczego statystyki „42% / 81% redukcji uprzedzeń”, które widziałeś, są niewiarygodne

Znajdziesz dziesiątki blogów dostawców twierdzących, że ustrukturyzowane rozmowy „redukują uprzedzenia płciowe o 42%, rasowe o 35% i poprawiają trafność o 81%”. Te trzy liczby nie mają żadnego dającego się prześledzić badania źródłowego; są przepisywane z jednego miejsca do drugiego. Zamiast nich używaj recenzowanych wartości powyżej. Wiarygodność twojego argumentu o sprawiedliwości zależy od cytowania badań, które naprawdę istnieją, szczególnie w otoczeniu regulacyjnym, w którym Akt o sztucznej inteligencji (rozporządzenie 2024/1689) i Kodeks pracy wymagają, byś potrafił obronić swój proces rekrutacji.

Jak połączyć zadanie i ocenę w Kit

W Kit możesz połączyć zadanie, wypłatę, rozmowę i ocenę zespołową w jednym procesie. Zespół odpowiada za dobór zadania i kryteriów.

  • Szablony procesu pozwalają ustalić kolejność etapów: zgłoszenie, zadanie programistyczne, rozmowa na żywo, ocena zespołu i oferta. Przygotuj rozmowę na podstawie oddanego zadania.
  • Etap zadania programistycznego tworzy prywatne repozytorium z szablonu GitHuba. Możesz ustawić termin i poprosić kandydata o pracę na gałęzi oraz pull request, który kandydat tworzy samodzielnie. Związek zadania ze stanowiskiem zależy od przygotowanego szablonu.
  • Wypłaty na poszczególnych etapach pozwalają ustalić wynagrodzenie za zadanie i obsłużyć zapłatę.
  • Ocena zespołowa z przypisanymi recenzentami pozwala zebrać oceny według wspólnych kryteriów przed omówieniem. Taki zapis ułatwia porównanie opinii i kontrolę procesu pod kątem równego traktowania. Ocena zgodności z Aktem o sztucznej inteligencji i Kodeksem pracy wymaga też sprawdzenia pozostałych obowiązków.
  • Planowanie rozmów na żywo pozwala ustalić termin omówienia rozwiązania jako kolejnego etapu.

Jeśli chcesz pogłębionego wywodu o trafności, przeczytaj karty oceny ustrukturyzowanych rozmów i trafność predykcyjną, a po szerszy obraz odejścia od ekranów z łamigłówkami zobacz dlaczego LeetCode jest przestarzały w rozmowie po erze AI.

Dobierz zadanie do stanowiska, zapłać za istotny nakład pracy i omów rozwiązanie według wspólnych kryteriów. Rozpocznij bezpłatny okres próbny, by przygotować taki proces, lub przejrzyj szablony ról.

Powiązane artykuły

Zacznij pierwszą rekrutację.

Zacznij za darmo na 30 dni. Zrezygnuj przed końcem, a nie zapłacisz ani grosza. Skonfiguruj swój pierwszy pipeline rekrutacyjny w kilka minut.

Zacznij za darmo