Baza wiedzy/Case study/Sprzeczne rekomendacje AI w Meta Ads
CS Case study

Sprzeczne rekomendacje AI w Meta Ads

To samo konto reklamowe oceniliśmy dwa razy tego samego dnia: raz czystym modelem AI podłączonym wprost do Meta Ads, raz silnikiem OWLI. Model kazał skalować 6 z 7 kampanii. Silnik: zwiększyć 3, zmniejszyć 3, przy jednej odmówić decyzji. Oto dlaczego się rozeszły.

Jedno konto, jeden dzień, dwie sprzeczne decyzje

Wzięliśmy jedno realne konto reklamowe Meta Ads - czyli Facebook Ads i Instagram - sklep internetowy, siedem aktywnych kampanii, i oceniliśmy je dwa razy tego samego dnia. Wejście było identyczne: to samo konto, ten sam dzień, te same liczby prosto ze źródła.

To dobry przykład, jak łatwo o sprzeczne rekomendacje AI dla Meta Ads (Facebook Ads) - dwa narzędzia AI potrafią na tych samych danych doradzić coś dokładnie odwrotnego.

Raz analizę zrobił czysty model językowy AI (LLM) podłączony wprost do systemu reklamowego. Raz - silnik diagnostyczny OWLI. Werdykty się rozjechały:

  • Czysty LLM: zwiększyć budżet w 6 z 7 kampanii.
  • Silnik OWLI: zwiększyć 3, zmniejszyć 3, przy jednej odmówić decyzji.

Te same dane, a decyzje sprzeczne co do kierunku - nie o niuans, tylko o to, czy dolewać pieniędzy, czy je zabierać. Poniżej pokazujemy, gdzie dokładnie ścieżki się rozeszły i dlaczego.

Skróty, które padną w tym wpisie

  • LLM (duży model językowy) - model AI, który rozumie i tworzy tekst. Świetnie streszcza tabelę i pisze rekomendację po ludzku, ale sam z siebie nie liczy testów statystycznych.
  • zwrot z wydatków (ROAS) - ile przychodu przypada na złotówkę wydaną na reklamę. „29×" znaczy 29 zł przychodu z każdej wydanej złotówki.
  • okno czasowe - okres, z którego liczona jest ocena (7, 14, 28 czy 30 dni). To, które okno wybierzesz, potrafi odwrócić wynik.

Uczciwie o danych

To realne konto, ale nazwy kampanii i wartości liczbowe zostały zmienione. Zachowane są proporcje, kierunki i wnioski - czyli to, co w tym przypadku faktycznie się liczy.

Ścieżka A: czysty LLM podłączony do Meta

Model dostał dostęp do konta i policzył tak, jak liczy większość „AI do reklam":

  1. Pobrał zestawienie za 30 dni - jedną tabelę, wszystko zsumowane.
  2. Porównał kampanie między sobą - kto ma wyższy zwrot z wydatku.
  3. Nałożył wiedzę ogólną o rynku - „skaluj zwycięzców", „krok 20-30%".
  4. Sformułował rekomendację - w jednym kroku rozumowania.

Efekt: prawie wszystko na koncie ma wysoki zwrot w skali miesiąca, więc skaluj prawie wszystko. Rekomendacja brzmi sensownie i jest napisana przekonująco. Problem w tym, że stoi na jednej liczbie na kampanię - średniej z 30 dni - i nie wie, co ta średnia ukrywa.

Ścieżka B: silnik diagnostyczny OWLI

OWLI nie ocenia konta jedną tabelą. Zanim model napisze cokolwiek po polsku, w chmurze liczy się właściwa diagnostyka:

  1. Dane dzienne trafiają do własnej bazy - suma dni sprawdzona ze źródłem.
  2. Trzy rozłączne okna: 7 / 14 / 28 dni - i tu pada pierwszy sygnał: przychód w oknie 28 dni -38% wobec poprzedniego okresu.
  3. Testy istotności - test Z dla proporcji i test t Welcha na danych dziennych, żeby odróżnić realną zmianę od szumu.
  4. Korekta wielokrotnych testów (Benjamini-Hochberg) - odrzuca pozorne „odkrycia", które przy wielu kampaniach zawsze się trafiają.
  5. Bramka wolumenu - „stop, 5 zamówień to za mało", zanim ktoś oprze decyzję na garstce zdarzeń.
  6. Próg opłacalności uzgodniony z klientem - to on odwrócił decyzję dla dwóch kampanii.
  7. Sprawdzenie, skąd wzięła się zmiana - czy to budżet, czy inna ingerencja w koncie.
  8. Limit kroku 20% na kampanię - większy skok resetuje uczenie się kampanii w Meta.
  9. Zejście na zestawy i reklamy - co konkretnie zwiększyć, co wyłączyć, co wymienić.

Dopiero po tym wszystkim model opisuje wynik po polsku. Werdykt jest inny, bo oparty na trendzie i istotności, a nie na jednej uśrednionej liczbie.

Gdzie dokładnie rekomendacje się rozeszły

Ta sama siódemka kampanii, dwie kolumny decyzji. Różnica bierze się z okna: LLM patrzył na zwrot z 30 dni, silnik na to, co dzieje się w ostatnich 14.

KampaniaZwrot 30 dniCzysty LLMZwrot 14 dniSilnik OWLI
Kampania A41×zwiększyć32×zwiększyć
Kampania B62×zwiększyć30×zwiększyć
Katalog 217×zwiększyć22×zwiększyć
Katalog29×zwiększyć7,4×zmniejszyć
Kampania C37×zwiększyć8,8×zmniejszyć
Remarketing51×zwiększyć ostrożnie44×bez decyzji
Promocje9×zmniejszyć1,8×zmniejszyć

Przy czterech kampaniach oba podejścia zgodziły się co do kierunku. Rozjazd jest w trzech pogrubionych wierszach - i to one decydują, czy dolejesz budżet tam, gdzie akurat trzeba go zabrać.

Trzy rzeczy, które zadecydowały

29× w miesiącu, 7,4× w ostatnich dwóch tygodniach

Ta sama kampania „Katalog": średnia z 30 dni pokazuje 29×, ostatnie 14 dni - 7,4×. Miesięczna średnia podtrzymywała wynik z pierwszej połowy okresu, choć kampania od dwóch tygodni schodziła w dół. LLM widział tylko średnią i kazał skalować. Silnik zobaczył trend i kazał ciąć.

5 zamówień stoi za zwrotem 44×

Remarketing miał efektowny zwrot 44×, ale za tą liczbą stało tylko pięć zamówień. Jedno więcej albo mniej zmienia wynik o dziesiątki procent. Przy takiej próbce „zwiększ ostrożnie" to nadal zwiększenie - a silnik wie, że tu po prostu nie ma jeszcze na czym oprzeć decyzji.

„Nie wiem

Silnik ma prawo odmówić rekomendacji i z tego korzysta. Narzędzie, które na każde pytanie ma gotową odpowiedź, nigdy nie powie ci, kiedy jej nie ma - a wtedy dostajesz zgadywanie w przekonującym opakowaniu. Przy Remarketingu OWLI świadomie nie wydał decyzji, zamiast zgadywać na pięciu zamówieniach.

Dlaczego średnia z 30 dni myli

Samo konto na poziomie ogólnym wyglądało zdrowo - dopóki nie rozłożyło się okien. Właśnie ten rozkład jest sednem różnicy między ścieżką A i B.

› Zdiagnozuj to konto - zwrot rośnie czy spada?OWLI: W oknie 7 dni zwrot 19,4× (poprzednio 16,8×) - wygląda na wzrost. Ale w oknie 14 dni: 17,9× (poprzednio 27,5×), przychód -18%, zamówienia -27%. W oknie 28 dni: 22,1× (poprzednio 28,4×), przychód -38%, zamówienia -35%. Konto się osuwa - ostatni tydzień to odbicie, nie trend.

Gdybyś patrzył tylko na jedno okno, wyszedłby zupełnie inny wniosek. Krótkie okno mówi „rośnie", miesięczne „stabilnie", a dopiero zestawienie rozłącznych okien pokazuje osuwanie się przychodu. LLM domyślnie bierze jedną liczbę i na niej buduje decyzję. Silnik porównuje okna między sobą i sprawdza testem, czy różnica jest realna, czy to szum.

To ta sama logika, co w silniku OWLI

Nie jest to trik na jeden przypadek. Tak silnik ocenia każde konto: poziom (czy przy celu) i kierunek (trend), z testami istotności i progiem opłacalności ustawionym pod klienta. Rozłożyliśmy to w osobnym wpisie: Jak działa silnik diagnostyczny OWLI.

Pięć pytań do każdego narzędzia AI od reklam

Zanim zaufasz rekomendacji - obojętnie, czy to OWLI, czy inne narzędzie - zadaj mu pięć pytań. Jeśli nie zna odpowiedzi, wiesz, na czym stoi jego rada:

  1. Na jakim okresie liczona jest ta rekomendacja? Jedno okno czy porównanie kilku?
  2. Ile zdarzeń (zamówień, konwersji) stoi za tą liczbą? Pięć czy pięćset?
  3. Czy zmiana jest potwierdzona testem, czy tylko zauważona na wykresie?
  4. Na jakim poziomie zapada decyzja - całego konta, kampanii, czy zestawu reklam?
  5. Czy da się ją cofnąć, jeśli za tydzień dane pokażą co innego?

W skrócie

Czysty LLM pobrał średnią z 30 dni i kazał skalować 6 z 7 kampanii. Silnik OWLI rozłożył dane na okna 7 / 14 / 28 dni, sprawdził istotność i wolumen, uwzględnił próg klienta - i wydał inny werdykt: zwiększyć 3, zmniejszyć 3, przy jednej odmówić decyzji. Różnica nie brała się z „lepszego AI", tylko z metody: trend zamiast średniej, test zamiast wrażenia, i odwaga, żeby powiedzieć „nie wiem".

Czy zwykły ChatGPT albo Claude podłączony do Meta Ads wystarczy do analizy kampanii?

Do streszczenia danych i napisania rekomendacji po ludzku - tak. Do decyzji budżetowej - nie sam z siebie. Model językowy bierze zwykle jedną uśrednioną tabelę i nie liczy testów istotności ani wolumenu, więc łatwo każe skalować kampanię, która od dwóch tygodni się osuwa.

Dlaczego ta sama kampania ma zwrot 29× i 7,4× naraz?

Bo to dwa różne okna. 29× to średnia z 30 dni, 7,4× to ostatnie 14 dni. Miesięczna średnia podtrzymuje wynik z pierwszej połowy okresu i ukrywa świeży spadek. Dlatego decyzję budżetową opiera się na trendzie, a nie na jednej uśrednionej liczbie.

Dlaczego OWLI czasem nie daje żadnej rekomendacji?

Bo za wynikiem stoi za mało zdarzeń, żeby ocenie ufać - w tym przypadku pięć zamówień za zwrotem 44×. Silnik woli odmówić decyzji, niż zgadywać na próbce, która za tydzień może pokazać co innego. Każde takie wyciszenie ma podany powód.

Czym różni się silnik OWLI od czystego modelu AI?

Model AI rozmawia i opisuje. Silnik OWLI liczy: dane dzienne do własnej bazy, trzy rozłączne okna, testy istotności z korektą wielokrotnych testów, bramka wolumenu i próg opłacalności klienta. Dopiero na koniec model opisuje ten wynik po polsku.

Co dalej

Nie masz jeszcze OWLI? Zacznij od wpisu Instalacja OWLI - od aplikacji Meta do pierwszej diagnozy w terminalu.

Gotowy na wlasna diagnoze?

OWLI analizuje Twoje konto reklamowe i daje konkretne liczby - nie opinie.

Kup OWLI >