Sprzeczne rekomendacje AI w Meta Ads
To samo konto reklamowe oceniliśmy dwa razy tego samego dnia: raz czystym modelem AI podłączonym wprost do Meta Ads, raz silnikiem OWLI. Model kazał skalować 6 z 7 kampanii. Silnik: zwiększyć 3, zmniejszyć 3, przy jednej odmówić decyzji. Oto dlaczego się rozeszły.
Jedno konto, jeden dzień, dwie sprzeczne decyzje
Wzięliśmy jedno realne konto reklamowe Meta Ads - czyli Facebook Ads i Instagram - sklep internetowy, siedem aktywnych kampanii, i oceniliśmy je dwa razy tego samego dnia. Wejście było identyczne: to samo konto, ten sam dzień, te same liczby prosto ze źródła.
To dobry przykład, jak łatwo o sprzeczne rekomendacje AI dla Meta Ads (Facebook Ads) - dwa narzędzia AI potrafią na tych samych danych doradzić coś dokładnie odwrotnego.
Raz analizę zrobił czysty model językowy AI (LLM) podłączony wprost do systemu reklamowego. Raz - silnik diagnostyczny OWLI. Werdykty się rozjechały:
- Czysty LLM: zwiększyć budżet w 6 z 7 kampanii.
- Silnik OWLI: zwiększyć 3, zmniejszyć 3, przy jednej odmówić decyzji.
Te same dane, a decyzje sprzeczne co do kierunku - nie o niuans, tylko o to, czy dolewać pieniędzy, czy je zabierać. Poniżej pokazujemy, gdzie dokładnie ścieżki się rozeszły i dlaczego.
Skróty, które padną w tym wpisie
- LLM (duży model językowy) - model AI, który rozumie i tworzy tekst. Świetnie streszcza tabelę i pisze rekomendację po ludzku, ale sam z siebie nie liczy testów statystycznych.
- zwrot z wydatków (ROAS) - ile przychodu przypada na złotówkę wydaną na reklamę. „29×" znaczy 29 zł przychodu z każdej wydanej złotówki.
- okno czasowe - okres, z którego liczona jest ocena (7, 14, 28 czy 30 dni). To, które okno wybierzesz, potrafi odwrócić wynik.
Uczciwie o danych
To realne konto, ale nazwy kampanii i wartości liczbowe zostały zmienione. Zachowane są proporcje, kierunki i wnioski - czyli to, co w tym przypadku faktycznie się liczy.
Ścieżka A: czysty LLM podłączony do Meta
Model dostał dostęp do konta i policzył tak, jak liczy większość „AI do reklam":
- Pobrał zestawienie za 30 dni - jedną tabelę, wszystko zsumowane.
- Porównał kampanie między sobą - kto ma wyższy zwrot z wydatku.
- Nałożył wiedzę ogólną o rynku - „skaluj zwycięzców", „krok 20-30%".
- Sformułował rekomendację - w jednym kroku rozumowania.
Efekt: prawie wszystko na koncie ma wysoki zwrot w skali miesiąca, więc skaluj prawie wszystko. Rekomendacja brzmi sensownie i jest napisana przekonująco. Problem w tym, że stoi na jednej liczbie na kampanię - średniej z 30 dni - i nie wie, co ta średnia ukrywa.
Ścieżka B: silnik diagnostyczny OWLI
OWLI nie ocenia konta jedną tabelą. Zanim model napisze cokolwiek po polsku, w chmurze liczy się właściwa diagnostyka:
- Dane dzienne trafiają do własnej bazy - suma dni sprawdzona ze źródłem.
- Trzy rozłączne okna: 7 / 14 / 28 dni - i tu pada pierwszy sygnał: przychód w oknie 28 dni -38% wobec poprzedniego okresu.
- Testy istotności - test Z dla proporcji i test t Welcha na danych dziennych, żeby odróżnić realną zmianę od szumu.
- Korekta wielokrotnych testów (Benjamini-Hochberg) - odrzuca pozorne „odkrycia", które przy wielu kampaniach zawsze się trafiają.
- Bramka wolumenu - „stop, 5 zamówień to za mało", zanim ktoś oprze decyzję na garstce zdarzeń.
- Próg opłacalności uzgodniony z klientem - to on odwrócił decyzję dla dwóch kampanii.
- Sprawdzenie, skąd wzięła się zmiana - czy to budżet, czy inna ingerencja w koncie.
- Limit kroku 20% na kampanię - większy skok resetuje uczenie się kampanii w Meta.
- Zejście na zestawy i reklamy - co konkretnie zwiększyć, co wyłączyć, co wymienić.
Dopiero po tym wszystkim model opisuje wynik po polsku. Werdykt jest inny, bo oparty na trendzie i istotności, a nie na jednej uśrednionej liczbie.
Gdzie dokładnie rekomendacje się rozeszły
Ta sama siódemka kampanii, dwie kolumny decyzji. Różnica bierze się z okna: LLM patrzył na zwrot z 30 dni, silnik na to, co dzieje się w ostatnich 14.
| Kampania | Zwrot 30 dni | Czysty LLM | Zwrot 14 dni | Silnik OWLI |
|---|---|---|---|---|
| Kampania A | 41× | zwiększyć | 32× | zwiększyć |
| Kampania B | 62× | zwiększyć | 30× | zwiększyć |
| Katalog 2 | 17× | zwiększyć | 22× | zwiększyć |
| Katalog | 29× | zwiększyć | 7,4× | zmniejszyć |
| Kampania C | 37× | zwiększyć | 8,8× | zmniejszyć |
| Remarketing | 51× | zwiększyć ostrożnie | 44× | bez decyzji |
| Promocje | 9× | zmniejszyć | 1,8× | zmniejszyć |
Przy czterech kampaniach oba podejścia zgodziły się co do kierunku. Rozjazd jest w trzech pogrubionych wierszach - i to one decydują, czy dolejesz budżet tam, gdzie akurat trzeba go zabrać.
Trzy rzeczy, które zadecydowały
29× w miesiącu, 7,4× w ostatnich dwóch tygodniach
Ta sama kampania „Katalog": średnia z 30 dni pokazuje 29×, ostatnie 14 dni - 7,4×. Miesięczna średnia podtrzymywała wynik z pierwszej połowy okresu, choć kampania od dwóch tygodni schodziła w dół. LLM widział tylko średnią i kazał skalować. Silnik zobaczył trend i kazał ciąć.
5 zamówień stoi za zwrotem 44×
Remarketing miał efektowny zwrot 44×, ale za tą liczbą stało tylko pięć zamówień. Jedno więcej albo mniej zmienia wynik o dziesiątki procent. Przy takiej próbce „zwiększ ostrożnie" to nadal zwiększenie - a silnik wie, że tu po prostu nie ma jeszcze na czym oprzeć decyzji.
„Nie wiem
Silnik ma prawo odmówić rekomendacji i z tego korzysta. Narzędzie, które na każde pytanie ma gotową odpowiedź, nigdy nie powie ci, kiedy jej nie ma - a wtedy dostajesz zgadywanie w przekonującym opakowaniu. Przy Remarketingu OWLI świadomie nie wydał decyzji, zamiast zgadywać na pięciu zamówieniach.
Dlaczego średnia z 30 dni myli
Samo konto na poziomie ogólnym wyglądało zdrowo - dopóki nie rozłożyło się okien. Właśnie ten rozkład jest sednem różnicy między ścieżką A i B.
› Zdiagnozuj to konto - zwrot rośnie czy spada?OWLI: W oknie 7 dni zwrot 19,4× (poprzednio 16,8×) - wygląda na wzrost. Ale w oknie 14 dni: 17,9× (poprzednio 27,5×), przychód -18%, zamówienia -27%. W oknie 28 dni: 22,1× (poprzednio 28,4×), przychód -38%, zamówienia -35%. Konto się osuwa - ostatni tydzień to odbicie, nie trend.
Gdybyś patrzył tylko na jedno okno, wyszedłby zupełnie inny wniosek. Krótkie okno mówi „rośnie", miesięczne „stabilnie", a dopiero zestawienie rozłącznych okien pokazuje osuwanie się przychodu. LLM domyślnie bierze jedną liczbę i na niej buduje decyzję. Silnik porównuje okna między sobą i sprawdza testem, czy różnica jest realna, czy to szum.
To ta sama logika, co w silniku OWLI
Nie jest to trik na jeden przypadek. Tak silnik ocenia każde konto: poziom (czy przy celu) i kierunek (trend), z testami istotności i progiem opłacalności ustawionym pod klienta. Rozłożyliśmy to w osobnym wpisie: Jak działa silnik diagnostyczny OWLI.
Pięć pytań do każdego narzędzia AI od reklam
Zanim zaufasz rekomendacji - obojętnie, czy to OWLI, czy inne narzędzie - zadaj mu pięć pytań. Jeśli nie zna odpowiedzi, wiesz, na czym stoi jego rada:
- Na jakim okresie liczona jest ta rekomendacja? Jedno okno czy porównanie kilku?
- Ile zdarzeń (zamówień, konwersji) stoi za tą liczbą? Pięć czy pięćset?
- Czy zmiana jest potwierdzona testem, czy tylko zauważona na wykresie?
- Na jakim poziomie zapada decyzja - całego konta, kampanii, czy zestawu reklam?
- Czy da się ją cofnąć, jeśli za tydzień dane pokażą co innego?
W skrócie
Czysty LLM pobrał średnią z 30 dni i kazał skalować 6 z 7 kampanii. Silnik OWLI rozłożył dane na okna 7 / 14 / 28 dni, sprawdził istotność i wolumen, uwzględnił próg klienta - i wydał inny werdykt: zwiększyć 3, zmniejszyć 3, przy jednej odmówić decyzji. Różnica nie brała się z „lepszego AI", tylko z metody: trend zamiast średniej, test zamiast wrażenia, i odwaga, żeby powiedzieć „nie wiem".
Czy zwykły ChatGPT albo Claude podłączony do Meta Ads wystarczy do analizy kampanii?
Do streszczenia danych i napisania rekomendacji po ludzku - tak. Do decyzji budżetowej - nie sam z siebie. Model językowy bierze zwykle jedną uśrednioną tabelę i nie liczy testów istotności ani wolumenu, więc łatwo każe skalować kampanię, która od dwóch tygodni się osuwa.
Dlaczego ta sama kampania ma zwrot 29× i 7,4× naraz?
Bo to dwa różne okna. 29× to średnia z 30 dni, 7,4× to ostatnie 14 dni. Miesięczna średnia podtrzymuje wynik z pierwszej połowy okresu i ukrywa świeży spadek. Dlatego decyzję budżetową opiera się na trendzie, a nie na jednej uśrednionej liczbie.
Dlaczego OWLI czasem nie daje żadnej rekomendacji?
Bo za wynikiem stoi za mało zdarzeń, żeby ocenie ufać - w tym przypadku pięć zamówień za zwrotem 44×. Silnik woli odmówić decyzji, niż zgadywać na próbce, która za tydzień może pokazać co innego. Każde takie wyciszenie ma podany powód.
Czym różni się silnik OWLI od czystego modelu AI?
Model AI rozmawia i opisuje. Silnik OWLI liczy: dane dzienne do własnej bazy, trzy rozłączne okna, testy istotności z korektą wielokrotnych testów, bramka wolumenu i próg opłacalności klienta. Dopiero na koniec model opisuje ten wynik po polsku.
Co dalej
- Jak działa silnik diagnostyczny OWLI - dwie osie oceny, cztery zalecenia, pewność danych i dlaczego silnik czasem milczy.
- Podstawowe polecenia OWLI - od czego zacząć rozmowę z kontem i jak poprosić o diagnozę.
- Dodawanie i kalibracja klienta - jak ustawić cel i progi, żeby oceny dotyczyły Twojego konta, a nie średniej.
Nie masz jeszcze OWLI? Zacznij od wpisu Instalacja OWLI - od aplikacji Meta do pierwszej diagnozy w terminalu.