AI Tester / AI Evaluation Engineer

Więcej niż jeden projekt. Więcej niż jeden rynek.

Jesteśmy częścią Hiberus, firmy technologicznej wywodzącej się z Hiszpanii z silną pozycją na rynku polskim: 4700+ specjalistów, obecnej w 14+ krajach i realizującej projekty dla klientów na całym świecie.

Pracujemy z technologiami AI, Data, Cloud, Software Development, BI i Cybersecurity. Ale przede wszystkim stawiamy na ludzi – gdy jeden projekt się kończy, szukamy kolejnych możliwości w ramach Hiberus, również w innych krajach.

Naszą wartość dodatkową stanowi Hiberus University - międzynarodowe środowisko i realna możliwość rozwijania swoich kompetencji. Ponad tysiąc osób przeszkolonych w zeszłym roku z wybranych technologii.

Pierwszy projekt to początek. Z Hiberus możesz budować swoją karierę długoterminowo. 

About the company

More Than One Project. More Than One Market.

We are part of Hiberus, a technology company founded in Spain with a strong presence in the Polish market: 4,700+ specialists, operating in 14+ countries and delivering projects for clients worldwide.

We work with technologies including AI, Data, Cloud, Software Development, BI, and Cybersecurity. But above all, we put people first. When one project comes to an end, we look for new opportunities within Hiberus — including projects in other countries.

One of our key advantages is Hiberus University — an international learning environment offering real opportunities to develop and expand your skills. More than 1,000 people were trained last year in selected technologies.

Your first project is just the beginning. With Hiberus, you can build a long-term career.

Opis stanowiska

Dla naszego Klienta poszukujemy AI Testera / AI Evaluation Engineera, który będzie odpowiedzialny za testowanie, ocenę jakości oraz stabilności rozwiązań opartych na AI, ML i GenAI.

Szukamy osoby z doświadczeniem w testowaniu oprogramowania lub systemów opartych na danych, która rozumie specyfikę modeli ML/LLM i potrafi oceniać ich wyniki pod kątem jakości, zgodności z wymaganiami, bezpieczeństwa i użyteczności.


Zakres obowiązków:

  • przygotowywanie scenariuszy testowych dla rozwiązań AI, ML i GenAI,
  • projektowanie zestawów pytań, przypadków brzegowych oraz danych referencyjnych do oceny modeli,
  • testowanie jakości odpowiedzi modeli oraz stabilności zachowania systemów AI,
  • przeprowadzanie testów regresji po zmianie modelu, promptu, danych źródłowych lub konfiguracji,
  • raportowanie defektów, anomalii oraz ryzyk jakościowych,
  • współpraca z AI Engineerami, analitykami, zespołami biznesowymi i bezpieczeństwa przy odbiorze rozwiązań,
  • dokumentowanie wyników testów oraz przygotowywanie rekomendacji dotyczących jakości systemów AI.

Job description

For our Client, we are looking for an AI Tester / AI Evaluation Engineer who will be responsible for testing and evaluating the quality and stability of AI, ML and GenAI-based solutions.

We are looking for a professional with experience in software testing or data-driven systems, who understands the specifics of ML/LLM models and can evaluate their outputs in terms of quality, compliance with requirements, security and usability.


Responsibilities:

  • Preparing test scenarios for AI, ML and GenAI solutions,
  • Designing question sets, edge cases and reference data for model evaluation,
  • Testing the quality of model outputs and the stability of AI system behaviour,
  • Performing regression testing after changes to the model, prompts, source data or configuration,
  • Reporting defects, anomalies and quality-related risks,
  • Collaborating with AI Engineers, analysts, business and security teams during solution acceptance,
  • Documenting test results and preparing recommendations regarding the quality of AI systems.

Benefity

  • Karta Multisport
  • Prywatna opieka medyczna

Benefits

  • Multisport card
  • Private medical care

Wymagane doświadczenie

  • minimum 3 lata doświadczenia w testowaniu oprogramowania, systemów analitycznych lub rozwiązań opartych na danych,
  • praktyczna znajomość tworzenia przypadków i scenariuszy testowych oraz raportowania defektów,
  • znajomość podstaw działania modeli ML lub LLM oraz specyfiki testowania systemów niedeterministycznych,
  • umiejętność projektowania zestawów testowych do oceny jakości odpowiedzi modeli, klasyfikacji i ekstrakcji informacji,
  • znajomość SQL, Postman oraz narzędzi do testowania API,
  • umiejętność oceny wyników modeli pod kątem trafności, kompletności, zgodności ze źródłem, bezpieczeństwa i użyteczności.

Mile widziane:

  • doświadczenie w testowaniu systemów RAG, chatbotów, asystentów AI lub modeli predykcyjnych,
  • znajomość narzędzi do automatycznej ewaluacji LLM oraz testów regresji promptów,
  • doświadczenie w testach bezpieczeństwa rozwiązań GenAI, w tym prompt injection i jailbreak,
  • znajomość wymagań dotyczących dostępności, UX lub prostego języka,
  • znajomość języka angielskiego umożliwiająca swobodne korzystanie z dokumentacji technicznej.

Experience required

  • Minimum 3 years of experience in software testing, analytical systems or data-driven solutions,
  • Practical knowledge of creating test cases, test scenarios and defect reports,
  • Basic understanding of ML or LLM models and the specifics of testing non-deterministic systems,
  • Ability to design test suites for evaluating model output quality, classification and information extraction,
  • Knowledge of SQL, Postman and API testing tools,
  • Ability to evaluate model outputs based on accuracy, completeness, source consistency, security and usability.

Nice to have:

  • Experience testing RAG systems, chatbots, AI assistants or predictive models,
  • Knowledge of automated LLM evaluation tools and prompt regression testing,
  • Experience in GenAI security testing, including prompt injection and jailbreak testing,
  • Knowledge of accessibility, UX or plain-language requirements,
  • English proficiency sufficient for analysing technical documentation.
ID: 309 job_post.published_on: 08/10/2026
announcement.apply