#include <sys/cdefs.h>
__KERNEL_RCSID(0, "$NetBSD: uvm_pdaemon.c,v 1.139 2026/05/03 16:02:37 thorpej Exp $");
#include "opt_uvmhist.h"
#include "opt_readahead.h"
#define __RWLOCK_PRIVATE
#include <sys/param.h>
#include <sys/proc.h>
#include <sys/systm.h>
#include <sys/kernel.h>
#include <sys/pool.h>
#include <sys/buf.h>
#include <sys/module.h>
#include <sys/atomic.h>
#include <sys/kthread.h>
#include <uvm/uvm.h>
#include <uvm/uvm_pdpolicy.h>
#include <uvm/uvm_pgflcache.h>
#ifdef UVMHIST
#ifndef UVMHIST_PDHIST_SIZE
#define UVMHIST_PDHIST_SIZE 100
#endif
static struct kern_history_ent pdhistbuf[UVMHIST_PDHIST_SIZE];
UVMHIST_DEFINE(pdhist) = UVMHIST_INITIALIZER(pdhisthist, pdhistbuf);
#endif
#define UVMPD_NUMDIRTYREACTS 16
static void uvmpd_scan(void);
static void uvmpd_scan_queue(void);
static void uvmpd_tune(void);
static void uvmpd_pool_drain_thread(void *);
static void uvmpd_pool_drain_wakeup(void);
static unsigned int uvm_pagedaemon_waiters;
static kmutex_t uvmpd_lock __cacheline_aligned;
static kcondvar_t uvmpd_pool_drain_cv;
static bool uvmpd_pool_drain_run = false;
u_int uvm_extrapages;
void
uvm_wait(const char *wmsg)
{
int timo = 0;
if (uvm_lwp_is_pagedaemon(curlwp))
panic("out of memory before the pagedaemon thread exists");
mutex_spin_enter(&uvmpd_lock);
if (uvm_lwp_is_pagedaemon(curlwp) && uvmexp.paging == 0) {
printf("pagedaemon: deadlock detected!\n");
timo = hz >> 3;
#if defined(DEBUG)
panic("pagedaemon deadlock");
#endif
}
uvm_pagedaemon_waiters++;
wakeup(&uvm.pagedaemon);
UVM_UNLOCK_AND_WAIT(&uvmexp.free, &uvmpd_lock, false, wmsg, timo);
}
void
uvm_kick_pdaemon(void)
{
int fpages = uvm_availmem(false);
if (fpages + uvmexp.paging < uvmexp.freemin ||
(fpages + uvmexp.paging < uvmexp.freetarg &&
uvmpdpol_needsscan_p()) ||
uvm_km_va_starved_p()) {
mutex_spin_enter(&uvmpd_lock);
wakeup(&uvm.pagedaemon);
mutex_spin_exit(&uvmpd_lock);
}
}
bool
_uvm_lwp_is_pagedaemon(struct lwp *l)
{
return _uvm_lwp_is_pagedaemon_test(l);
}
static void
uvmpd_tune(void)
{
int val;
UVMHIST_FUNC(__func__); UVMHIST_CALLED(pdhist);
val = uvmexp.npages / 200;
val = MAX(val, (128*1024) >> PAGE_SHIFT);
val = MIN(val, (1024*1024) >> PAGE_SHIFT);
val *= ncpu;
if (val < uvmexp.reserve_kernel + 1)
val = uvmexp.reserve_kernel + 1;
uvmexp.freemin = val;
val = (uvmexp.freemin * 4) / 3;
if (val <= uvmexp.freemin)
val = uvmexp.freemin + 1;
uvmexp.freetarg = val + atomic_swap_uint(&uvm_extrapages, 0);
uvmexp.wiredmax = uvmexp.npages / 3;
UVMHIST_LOG(pdhist, "<- done, freemin=%jd, freetarg=%jd, wiredmax=%jd",
uvmexp.freemin, uvmexp.freetarg, uvmexp.wiredmax, 0);
}
void
uvm_pageout(void *arg)
{
int npages = 0;
int extrapages = 0;
int fpages;
UVMHIST_FUNC(__func__); UVMHIST_CALLED(pdhist);
UVMHIST_LOG(pdhist,"<starting uvm pagedaemon>", 0, 0, 0, 0);
mutex_init(&uvmpd_lock, MUTEX_DEFAULT, IPL_VM);
cv_init(&uvmpd_pool_drain_cv, "pooldrain");
if (kthread_create(PRI_VM, KTHREAD_MPSAFE, NULL,
uvmpd_pool_drain_thread, NULL, NULL, "pooldrain"))
panic("fork pooldrain");
uvm.pagedaemon_lwp = curlwp;
npages = uvmexp.npages;
uvmpd_tune();
for (;;) {
bool needsscan, needsfree, kmem_va_starved;
kmem_va_starved = uvm_km_va_starved_p();
mutex_spin_enter(&uvmpd_lock);
if ((uvm_pagedaemon_waiters == 0 || uvmexp.paging > 0) &&
!kmem_va_starved) {
UVMHIST_LOG(pdhist," <<SLEEPING>>",0,0,0,0);
UVM_UNLOCK_AND_WAIT(&uvm.pagedaemon,
&uvmpd_lock, false, "pgdaemon", 0);
uvmexp.pdwoke++;
UVMHIST_LOG(pdhist," <<WOKE UP>>",0,0,0,0);
} else {
mutex_spin_exit(&uvmpd_lock);
}
if (npages != uvmexp.npages || extrapages != uvm_extrapages) {
npages = uvmexp.npages;
extrapages = uvm_extrapages;
uvmpd_tune();
}
uvmpdpol_tune();
fpages = uvm_availmem(false);
UVMHIST_LOG(pdhist," free/ftarg=%jd/%jd",
fpages, uvmexp.freetarg, 0,0);
needsfree = fpages + uvmexp.paging < uvmexp.freetarg;
needsscan = needsfree || uvmpdpol_needsscan_p();
if (needsscan) {
uvmpd_scan();
}
if (uvm_availmem(false) > uvmexp.reserve_kernel ||
uvmexp.paging == 0) {
mutex_spin_enter(&uvmpd_lock);
wakeup(&uvmexp.free);
uvm_pagedaemon_waiters = 0;
mutex_spin_exit(&uvmpd_lock);
}
if (!needsfree && !kmem_va_starved)
continue;
uvmpd_pool_drain_wakeup();
}
}
void
uvm_pageout_start(int npages)
{
atomic_add_int(&uvmexp.paging, npages);
}
void
uvm_pageout_done(int npages)
{
KASSERT(atomic_load_relaxed(&uvmexp.paging) >= npages);
if (npages == 0) {
return;
}
atomic_add_int(&uvmexp.paging, -npages);
mutex_spin_enter(&uvmpd_lock);
if (uvm_availmem(false) <= uvmexp.reserve_kernel) {
wakeup(&uvm.pagedaemon);
} else if (uvm_pagedaemon_waiters != 0) {
wakeup(&uvmexp.free);
uvm_pagedaemon_waiters = 0;
}
mutex_spin_exit(&uvmpd_lock);
}
static krwlock_t *
uvmpd_page_owner_lock(struct vm_page *pg)
{
struct uvm_object *uobj = pg->uobject;
struct vm_anon *anon = pg->uanon;
krwlock_t *slock;
KASSERT(mutex_owned(&pg->interlock));
#ifdef DEBUG
if (uobj == (void *)0xdeadbeef || anon == (void *)0xdeadbeef) {
return NULL;
}
#endif
if (uobj != NULL) {
slock = uobj->vmobjlock;
KASSERTMSG(slock != NULL, "pg %p uobj %p, NULL lock", pg, uobj);
} else if (anon != NULL) {
slock = anon->an_lock;
KASSERTMSG(slock != NULL, "pg %p anon %p, NULL lock", pg, anon);
} else {
slock = NULL;
}
return slock;
}
krwlock_t *
uvmpd_trylockowner(struct vm_page *pg)
{
krwlock_t *slock, *heldslock = NULL;
KASSERT(mutex_owned(&pg->interlock));
slock = uvmpd_page_owner_lock(pg);
if (slock == NULL) {
mutex_exit(&pg->interlock);
return NULL;
}
if (rw_tryenter(slock, RW_WRITER)) {
goto success;
}
rw_obj_hold(slock);
mutex_exit(&pg->interlock);
rw_enter(slock, RW_WRITER);
heldslock = slock;
mutex_enter(&pg->interlock);
slock = uvmpd_page_owner_lock(pg);
if (heldslock != slock) {
rw_exit(heldslock);
slock = NULL;
} else {
success:
if (pg->uobject == NULL && (pg->flags & PG_ANON) == 0) {
KASSERT(pg->loan_count > 0);
pg->loan_count--;
pg->flags |= PG_ANON;
}
}
mutex_exit(&pg->interlock);
if (heldslock != NULL) {
rw_obj_free(heldslock);
}
return slock;
}
#if defined(VMSWAP)
struct swapcluster {
int swc_slot;
int swc_nallocated;
int swc_nused;
struct vm_page *swc_pages[howmany(MAXPHYS, MIN_PAGE_SIZE)];
};
static void
swapcluster_init(struct swapcluster *swc)
{
swc->swc_slot = 0;
swc->swc_nused = 0;
}
static int
swapcluster_allocslots(struct swapcluster *swc)
{
int slot;
int npages;
if (swc->swc_slot != 0) {
return 0;
}
npages = MAXPHYS >> PAGE_SHIFT;
slot = uvm_swap_alloc(&npages, true);
if (slot == 0) {
return ENOMEM;
}
swc->swc_slot = slot;
swc->swc_nallocated = npages;
swc->swc_nused = 0;
return 0;
}
static int
swapcluster_add(struct swapcluster *swc, struct vm_page *pg)
{
int slot;
struct uvm_object *uobj;
KASSERT(swc->swc_slot != 0);
KASSERT(swc->swc_nused < swc->swc_nallocated);
KASSERT((pg->flags & PG_SWAPBACKED) != 0);
slot = swc->swc_slot + swc->swc_nused;
uobj = pg->uobject;
if (uobj == NULL) {
KASSERT(rw_write_held(pg->uanon->an_lock));
pg->uanon->an_swslot = slot;
} else {
int result;
KASSERT(rw_write_held(uobj->vmobjlock));
result = uao_set_swslot(uobj, pg->offset >> PAGE_SHIFT, slot);
if (result == -1) {
return ENOMEM;
}
}
swc->swc_pages[swc->swc_nused] = pg;
swc->swc_nused++;
return 0;
}
static void
swapcluster_flush(struct swapcluster *swc, bool now)
{
int slot;
int nused;
int nallocated;
int error __diagused;
if (swc->swc_slot == 0) {
return;
}
KASSERT(swc->swc_nused <= swc->swc_nallocated);
slot = swc->swc_slot;
nused = swc->swc_nused;
nallocated = swc->swc_nallocated;
if (nused < nallocated) {
if (!now) {
return;
}
uvm_swap_free(slot + nused, nallocated - nused);
}
if (nused > 0) {
uvmexp.pdpageouts++;
uvm_pageout_start(nused);
error = uvm_swap_put(slot, swc->swc_pages, nused, 0);
KASSERT(error == 0 || error == ENOMEM);
}
swc->swc_slot = 0;
swc->swc_nused = 0;
}
static int
swapcluster_nused(struct swapcluster *swc)
{
return swc->swc_nused;
}
bool
uvmpd_dropswap(struct vm_page *pg)
{
bool result = false;
struct vm_anon *anon = pg->uanon;
if ((pg->flags & PG_ANON) && anon->an_swslot) {
uvm_swap_free(anon->an_swslot, 1);
anon->an_swslot = 0;
uvm_pagemarkdirty(pg, UVM_PAGE_STATUS_DIRTY);
result = true;
} else if (pg->flags & PG_AOBJ) {
int slot = uao_set_swslot(pg->uobject,
pg->offset >> PAGE_SHIFT, 0);
if (slot) {
uvm_swap_free(slot, 1);
uvm_pagemarkdirty(pg, UVM_PAGE_STATUS_DIRTY);
result = true;
}
}
return result;
}
#endif
static void
uvmpd_scan_queue(void)
{
struct vm_page *p;
struct uvm_object *uobj;
struct vm_anon *anon;
#if defined(VMSWAP)
struct swapcluster swc;
#endif
int dirtyreacts;
krwlock_t *slock;
UVMHIST_FUNC(__func__); UVMHIST_CALLED(pdhist);
#if defined(VMSWAP)
swapcluster_init(&swc);
#endif
dirtyreacts = 0;
uvmpdpol_scaninit();
while ( 1) {
if (uvm_availmem(false) + uvmexp.paging
#if defined(VMSWAP)
+ swapcluster_nused(&swc)
#endif
>= uvmexp.freetarg << 2 ||
dirtyreacts == UVMPD_NUMDIRTYREACTS) {
UVMHIST_LOG(pdhist," met free target: "
"exit loop", 0, 0, 0, 0);
break;
}
p = uvmpdpol_selectvictim(&slock);
if (p == NULL) {
break;
}
KASSERT(uvmpdpol_pageisqueued_p(p));
KASSERT(uvm_page_owner_locked_p(p, true));
KASSERT(p->wire_count == 0);
anon = p->uanon;
uobj = p->uobject;
if (p->flags & PG_BUSY) {
rw_exit(slock);
uvmexp.pdbusy++;
continue;
}
if (uobj != NULL) {
uvmexp.pdobscan++;
} else {
#if defined(VMSWAP)
KASSERT(anon != NULL);
uvmexp.pdanscan++;
#else
panic("%s: anon", __func__);
#endif
}
#if defined(READAHEAD_STATS)
if ((p->flags & PG_READAHEAD) != 0) {
p->flags &= ~PG_READAHEAD;
uvm_ra_miss.ev_count++;
}
#endif
if ((p->flags & PG_SWAPBACKED) == 0) {
KASSERT(uobj != NULL);
(void) (uobj->pgops->pgo_put)(uobj, p->offset,
p->offset + PAGE_SIZE, PGO_CLEANIT|PGO_FREE);
continue;
}
pmap_page_protect(p, VM_PROT_NONE);
if (uvm_pagegetdirty(p) == UVM_PAGE_STATUS_UNKNOWN) {
if (pmap_clear_modify(p)) {
uvm_pagemarkdirty(p, UVM_PAGE_STATUS_DIRTY);
} else {
uvm_pagemarkdirty(p, UVM_PAGE_STATUS_CLEAN);
}
}
if (uvm_pagegetdirty(p) != UVM_PAGE_STATUS_DIRTY) {
int slot;
int pageidx;
pageidx = p->offset >> PAGE_SHIFT;
uvm_pagefree(p);
atomic_inc_uint(&uvmexp.pdfreed);
if (anon) {
KASSERT(anon->an_swslot != 0);
anon->an_page = NULL;
slot = anon->an_swslot;
} else {
slot = uao_find_swslot(uobj, pageidx);
}
if (slot > 0) {
atomic_inc_uint(&uvmexp.swpgonly);
}
rw_exit(slock);
continue;
}
#if defined(VMSWAP)
if (uvm_availmem(false) + uvmexp.paging >
uvmexp.freetarg << 2) {
rw_exit(slock);
continue;
}
uvmpd_dropswap(p);
if (swapcluster_allocslots(&swc)) {
dirtyreacts++;
uvm_pagelock(p);
uvm_pageactivate(p);
uvm_pageunlock(p);
rw_exit(slock);
continue;
}
p->flags |= PG_BUSY;
UVM_PAGE_OWN(p, "scan_queue");
p->flags |= PG_PAGEOUT;
uvmexp.pgswapout++;
uvm_pagelock(p);
uvm_pagedequeue(p);
uvm_pageunlock(p);
if (swapcluster_add(&swc, p)) {
p->flags &= ~(PG_BUSY|PG_PAGEOUT);
UVM_PAGE_OWN(p, NULL);
dirtyreacts++;
uvm_pagelock(p);
uvm_pageactivate(p);
uvm_pageunlock(p);
rw_exit(slock);
continue;
}
rw_exit(slock);
swapcluster_flush(&swc, false);
#else
uvm_pagelock(p);
uvm_pageactivate(p);
uvm_pageunlock(p);
rw_exit(slock);
#endif
}
uvmpdpol_scanfini();
#if defined(VMSWAP)
swapcluster_flush(&swc, true);
#endif
}
static void
uvmpd_scan(void)
{
int swap_shortage, pages_freed, fpages;
UVMHIST_FUNC(__func__); UVMHIST_CALLED(pdhist);
uvmexp.pdrevs++;
UVMHIST_LOG(pdhist, " starting 'free' loop",0,0,0,0);
pages_freed = uvmexp.pdfreed;
uvmpd_scan_queue();
pages_freed = uvmexp.pdfreed - pages_freed;
swap_shortage = 0;
fpages = uvm_availmem(false);
if (fpages < uvmexp.freetarg &&
uvmexp.swpginuse >= uvmexp.swpgavail &&
!uvm_swapisfull() &&
pages_freed == 0) {
swap_shortage = uvmexp.freetarg - fpages;
}
uvmpdpol_balancequeue(swap_shortage);
if (uvm_availmem(false) < uvmexp.freemin) {
module_thread_kick();
}
}
bool
uvm_reclaimable(void)
{
int filepages;
int active, inactive;
if (!uvm_swapisfull()) {
return true;
}
cpu_count_sync(false);
filepages = (int)(cpu_count_get(CPU_COUNT_FILECLEAN) +
cpu_count_get(CPU_COUNT_FILEUNKNOWN) +
cpu_count_get(CPU_COUNT_FILEDIRTY) - uvmexp.wired);
uvm_estimatepageable(&active, &inactive);
if (filepages >= MIN((active + inactive) >> 4,
5 * 1024 * 1024 >> PAGE_SHIFT)) {
return true;
}
return false;
}
void
uvm_estimatepageable(int *active, int *inactive)
{
uvmpdpol_estimatepageable(active, inactive);
}
static void
uvmpd_pool_drain_thread(void *arg)
{
struct pool *firstpool, *curpool;
int bufcnt, lastslept;
bool cycled;
firstpool = NULL;
cycled = true;
for (;;) {
mutex_enter(&uvmpd_lock);
if (!uvmpd_pool_drain_run) {
lastslept = getticks();
cv_wait(&uvmpd_pool_drain_cv, &uvmpd_lock);
if (getticks() != lastslept) {
cycled = false;
firstpool = NULL;
}
}
uvmpd_pool_drain_run = false;
mutex_exit(&uvmpd_lock);
if (cycled) {
kpause("uvmpdlmt", false, 1, NULL);
cycled = false;
firstpool = NULL;
}
uvm_pgflcache_pause();
bufcnt = uvmexp.freetarg - uvm_availmem(false);
if (bufcnt < 0)
bufcnt = 0;
mutex_enter(&bufcache_lock);
buf_drain(bufcnt << PAGE_SHIFT);
mutex_exit(&bufcache_lock);
(void)pool_drain(&curpool);
KASSERT(curpool != NULL);
if (firstpool == NULL) {
firstpool = curpool;
} else if (firstpool == curpool) {
cycled = true;
}
uvm_pgflcache_resume();
}
}
static void
uvmpd_pool_drain_wakeup(void)
{
mutex_enter(&uvmpd_lock);
uvmpd_pool_drain_run = true;
cv_signal(&uvmpd_pool_drain_cv);
mutex_exit(&uvmpd_lock);
}