#include <sys/cdefs.h>
__KERNEL_RCSID(0, "$NetBSD: spec_vnops.c,v 1.219 2025/01/06 09:45:49 mlelstv Exp $");
#ifdef _KERNEL_OPT
#include "opt_ddb.h"
#endif
#include <sys/param.h>
#include <sys/proc.h>
#include <sys/systm.h>
#include <sys/kernel.h>
#include <sys/conf.h>
#include <sys/buf.h>
#include <sys/mount.h>
#include <sys/namei.h>
#include <sys/vnode_impl.h>
#include <sys/stat.h>
#include <sys/errno.h>
#include <sys/ioctl.h>
#include <sys/poll.h>
#include <sys/file.h>
#include <sys/disklabel.h>
#include <sys/disk.h>
#include <sys/lockf.h>
#include <sys/tty.h>
#include <sys/kauth.h>
#include <sys/fstrans.h>
#include <sys/module.h>
#include <sys/atomic.h>
#include <miscfs/genfs/genfs.h>
#include <miscfs/specfs/specdev.h>
#ifdef DDB
#include <ddb/ddb.h>
#endif
const char devopn[] = "devopn";
const char devio[] = "devio";
const char devwait[] = "devwait";
const char devin[] = "devin";
const char devout[] = "devout";
const char devioc[] = "devioc";
const char devcls[] = "devcls";
#define SPECHSZ 64
#if ((SPECHSZ&(SPECHSZ-1)) == 0)
#define SPECHASH(rdev) (((rdev>>5)+(rdev))&(SPECHSZ-1))
#else
#define SPECHASH(rdev) (((unsigned)((rdev>>5)+(rdev)))%SPECHSZ)
#endif
static vnode_t *specfs_hash[SPECHSZ];
extern struct mount *dead_rootmount;
int (**spec_vnodeop_p)(void *);
const struct vnodeopv_entry_desc spec_vnodeop_entries[] = {
{ &vop_default_desc, vn_default_error },
{ &vop_parsepath_desc, genfs_parsepath },
{ &vop_lookup_desc, spec_lookup },
{ &vop_create_desc, genfs_badop },
{ &vop_mknod_desc, genfs_badop },
{ &vop_open_desc, spec_open },
{ &vop_close_desc, spec_close },
{ &vop_access_desc, genfs_ebadf },
{ &vop_accessx_desc, genfs_ebadf },
{ &vop_getattr_desc, genfs_ebadf },
{ &vop_setattr_desc, genfs_ebadf },
{ &vop_read_desc, spec_read },
{ &vop_write_desc, spec_write },
{ &vop_fallocate_desc, genfs_eopnotsupp },
{ &vop_fdiscard_desc, spec_fdiscard },
{ &vop_fcntl_desc, genfs_fcntl },
{ &vop_ioctl_desc, spec_ioctl },
{ &vop_poll_desc, spec_poll },
{ &vop_kqfilter_desc, spec_kqfilter },
{ &vop_revoke_desc, genfs_revoke },
{ &vop_mmap_desc, spec_mmap },
{ &vop_fsync_desc, spec_fsync },
{ &vop_seek_desc, spec_seek },
{ &vop_remove_desc, genfs_badop },
{ &vop_link_desc, genfs_badop },
{ &vop_rename_desc, genfs_badop },
{ &vop_mkdir_desc, genfs_badop },
{ &vop_rmdir_desc, genfs_badop },
{ &vop_symlink_desc, genfs_badop },
{ &vop_readdir_desc, genfs_badop },
{ &vop_readlink_desc, genfs_badop },
{ &vop_abortop_desc, genfs_badop },
{ &vop_inactive_desc, spec_inactive },
{ &vop_reclaim_desc, spec_reclaim },
{ &vop_lock_desc, genfs_lock },
{ &vop_unlock_desc, genfs_unlock },
{ &vop_bmap_desc, spec_bmap },
{ &vop_strategy_desc, spec_strategy },
{ &vop_print_desc, spec_print },
{ &vop_islocked_desc, genfs_islocked },
{ &vop_pathconf_desc, spec_pathconf },
{ &vop_advlock_desc, spec_advlock },
{ &vop_bwrite_desc, vn_bwrite },
{ &vop_getpages_desc, genfs_getpages },
{ &vop_putpages_desc, genfs_putpages },
{ NULL, NULL }
};
const struct vnodeopv_desc spec_vnodeop_opv_desc =
{ &spec_vnodeop_p, spec_vnodeop_entries };
static kauth_listener_t rawio_listener;
static struct kcondvar specfs_iocv;
bool
iskmemvp(struct vnode *vp)
{
return ((vp->v_type == VCHR) && iskmemdev(vp->v_rdev));
}
int
iskmemdev(dev_t dev)
{
extern const int mem_no;
return (major(dev) == mem_no && (minor(dev) < 2 || minor(dev) == 14));
}
static int
rawio_listener_cb(kauth_cred_t cred, kauth_action_t action, void *cookie,
void *arg0, void *arg1, void *arg2, void *arg3)
{
int result;
result = KAUTH_RESULT_DEFER;
if ((action != KAUTH_DEVICE_RAWIO_SPEC) &&
(action != KAUTH_DEVICE_RAWIO_PASSTHRU))
return result;
result = KAUTH_RESULT_ALLOW;
return result;
}
void
spec_init(void)
{
rawio_listener = kauth_listen_scope(KAUTH_SCOPE_DEVICE,
rawio_listener_cb, NULL);
cv_init(&specfs_iocv, "specio");
}
static int
spec_io_enter(struct vnode *vp, struct specnode **snp, dev_t *devp)
{
dev_t dev;
struct specnode *sn;
unsigned iocnt;
int error = 0;
mutex_enter(vp->v_interlock);
if (vdead_check(vp, VDEAD_NOWAIT) != 0 ||
(sn = vp->v_specnode) == NULL ||
(dev = vp->v_rdev) == NODEV) {
error = ENXIO;
goto out;
}
do {
iocnt = atomic_load_relaxed(&sn->sn_dev->sd_iocnt);
if (__predict_false(iocnt == UINT_MAX)) {
error = EBUSY;
goto out;
}
} while (atomic_cas_uint(&sn->sn_dev->sd_iocnt, iocnt, iocnt + 1)
!= iocnt);
*snp = sn;
*devp = dev;
error = 0;
out: mutex_exit(vp->v_interlock);
return error;
}
static void
spec_io_exit(struct vnode *vp, struct specnode *sn)
{
struct specdev *sd = sn->sn_dev;
unsigned iocnt;
KASSERT(vp->v_specnode == sn);
do {
iocnt = atomic_load_relaxed(&sd->sd_iocnt);
KASSERT(iocnt > 0);
if (iocnt == 1) {
mutex_enter(&device_lock);
if (atomic_dec_uint_nv(&sd->sd_iocnt) == 0)
cv_broadcast(&specfs_iocv);
mutex_exit(&device_lock);
break;
}
} while (atomic_cas_uint(&sd->sd_iocnt, iocnt, iocnt - 1) != iocnt);
}
static void
spec_io_drain(struct specdev *sd)
{
if (__predict_true(atomic_load_relaxed(&sd->sd_iocnt) == 0))
return;
mutex_enter(&device_lock);
while (atomic_load_relaxed(&sd->sd_iocnt) > 0)
cv_wait(&specfs_iocv, &device_lock);
mutex_exit(&device_lock);
}
void
spec_node_init(vnode_t *vp, dev_t rdev)
{
specnode_t *sn;
specdev_t *sd;
vnode_t *vp2;
vnode_t **vpp;
KASSERT(vp->v_type == VBLK || vp->v_type == VCHR);
KASSERT(vp->v_specnode == NULL);
sn = kmem_alloc(sizeof(*sn), KM_SLEEP);
sd = kmem_alloc(sizeof(*sd), KM_SLEEP);
mutex_enter(&device_lock);
vpp = &specfs_hash[SPECHASH(rdev)];
for (vp2 = *vpp; vp2 != NULL; vp2 = vp2->v_specnext) {
KASSERT(vp2->v_specnode != NULL);
if (rdev == vp2->v_rdev && vp->v_type == vp2->v_type) {
break;
}
}
if (vp2 == NULL) {
sd->sd_mountpoint = NULL;
sd->sd_lockf = NULL;
sd->sd_refcnt = 1;
sd->sd_opencnt = 0;
sd->sd_bdevvp = NULL;
sd->sd_iocnt = 0;
sd->sd_opened = false;
sd->sd_closing = false;
sn->sn_dev = sd;
sd = NULL;
} else {
sn->sn_dev = vp2->v_specnode->sn_dev;
sn->sn_dev->sd_refcnt++;
}
sn->sn_opencnt = 0;
sn->sn_rdev = rdev;
sn->sn_gone = false;
vp->v_specnode = sn;
vp->v_specnext = *vpp;
*vpp = vp;
mutex_exit(&device_lock);
if (sd != NULL) {
kmem_free(sd, sizeof(*sd));
}
}
int
spec_node_lookup_by_dev(enum vtype type, dev_t dev, int flags, vnode_t **vpp)
{
int error;
vnode_t *vp;
top: mutex_enter(&device_lock);
for (vp = specfs_hash[SPECHASH(dev)]; vp; vp = vp->v_specnext) {
if (type == vp->v_type && dev == vp->v_rdev) {
mutex_enter(vp->v_interlock);
if (vdead_check(vp, VDEAD_NOWAIT) == 0)
break;
if ((flags & VDEAD_NOWAIT) == 0) {
mutex_exit(&device_lock);
error = vcache_vget(vp);
KASSERT(error);
goto top;
}
mutex_exit(vp->v_interlock);
}
}
KASSERT(vp == NULL || mutex_owned(vp->v_interlock));
if (vp == NULL) {
mutex_exit(&device_lock);
return ENOENT;
}
if (type == VBLK && vp->v_specnode->sn_dev->sd_bdevvp != NULL) {
mutex_exit(vp->v_interlock);
vp = vp->v_specnode->sn_dev->sd_bdevvp;
mutex_enter(vp->v_interlock);
}
mutex_exit(&device_lock);
error = vcache_vget(vp);
if (error)
return error;
*vpp = vp;
return 0;
}
int
spec_node_lookup_by_mount(struct mount *mp, vnode_t **vpp)
{
int i, error;
vnode_t *vp, *vq;
mutex_enter(&device_lock);
for (i = 0, vq = NULL; i < SPECHSZ && vq == NULL; i++) {
for (vp = specfs_hash[i]; vp; vp = vp->v_specnext) {
if (vp->v_type != VBLK)
continue;
vq = vp->v_specnode->sn_dev->sd_bdevvp;
if (vq != NULL &&
vq->v_specnode->sn_dev->sd_mountpoint == mp)
break;
vq = NULL;
}
}
if (vq == NULL) {
mutex_exit(&device_lock);
return ENOENT;
}
mutex_enter(vq->v_interlock);
mutex_exit(&device_lock);
error = vcache_vget(vq);
if (error)
return error;
*vpp = vq;
return 0;
}
struct mount *
spec_node_getmountedfs(vnode_t *devvp)
{
struct mount *mp;
KASSERT(devvp->v_type == VBLK);
mp = devvp->v_specnode->sn_dev->sd_mountpoint;
return mp;
}
void
spec_node_setmountedfs(vnode_t *devvp, struct mount *mp)
{
struct dkwedge_info dkw;
struct specnode *sn;
dev_t dev;
int error;
KASSERT(devvp->v_type == VBLK);
error = spec_io_enter(devvp, &sn, &dev);
if (error)
return;
KASSERT(sn->sn_dev->sd_mountpoint == NULL || mp == NULL);
sn->sn_dev->sd_mountpoint = mp;
if (mp == NULL)
goto out;
error = bdev_ioctl(dev, DIOCGWEDGEINFO, &dkw, FREAD, curlwp);
if (error)
goto out;
strlcpy(mp->mnt_stat.f_mntfromlabel, dkw.dkw_wname,
sizeof(mp->mnt_stat.f_mntfromlabel));
out: spec_io_exit(devvp, sn);
}
void
spec_node_revoke(vnode_t *vp)
{
specnode_t *sn;
specdev_t *sd;
struct vnode **vpp;
KASSERT(VOP_ISLOCKED(vp) == LK_EXCLUSIVE);
sn = vp->v_specnode;
sd = sn->sn_dev;
KASSERT(vp->v_type == VBLK || vp->v_type == VCHR);
KASSERT(vp->v_specnode != NULL);
KASSERT(sn->sn_gone == false);
mutex_enter(&device_lock);
KASSERTMSG(sn->sn_opencnt <= sd->sd_opencnt,
"sn_opencnt=%u > sd_opencnt=%u",
sn->sn_opencnt, sd->sd_opencnt);
sn->sn_gone = true;
if (sn->sn_opencnt != 0) {
sd->sd_opencnt -= (sn->sn_opencnt - 1);
sn->sn_opencnt = 1;
mutex_exit(&device_lock);
VOP_CLOSE(vp, FNONBLOCK, NOCRED);
mutex_enter(&device_lock);
KASSERT(sn->sn_opencnt == 0);
}
while (sd->sd_closing)
cv_wait(&specfs_iocv, &device_lock);
KASSERT(sn->sn_gone);
KASSERT(sn->sn_opencnt == 0);
for (vpp = &specfs_hash[SPECHASH(vp->v_rdev)];;
vpp = &(*vpp)->v_specnext) {
if (*vpp == vp) {
*vpp = vp->v_specnext;
vp->v_specnext = NULL;
break;
}
}
mutex_exit(&device_lock);
}
void
spec_node_destroy(vnode_t *vp)
{
specnode_t *sn;
specdev_t *sd;
int refcnt;
sn = vp->v_specnode;
sd = sn->sn_dev;
KASSERT(vp->v_type == VBLK || vp->v_type == VCHR);
KASSERT(vp->v_specnode != NULL);
KASSERT(sn->sn_opencnt == 0);
mutex_enter(&device_lock);
sn = vp->v_specnode;
vp->v_specnode = NULL;
refcnt = sd->sd_refcnt--;
KASSERT(refcnt > 0);
mutex_exit(&device_lock);
if (refcnt == 1) {
KASSERT(sd->sd_iocnt == 0);
KASSERT(sd->sd_opencnt == 0);
KASSERT(sd->sd_bdevvp == NULL);
kmem_free(sd, sizeof(*sd));
}
kmem_free(sn, sizeof(*sn));
}
int
spec_lookup(void *v)
{
struct vop_lookup_v2_args
*ap = v;
*ap->a_vpp = NULL;
return ENOTDIR;
}
typedef int (*spec_ioctl_t)(dev_t, u_long, void *, int, struct lwp *);
int
spec_open(void *v)
{
struct vop_open_args
*ap = v;
struct lwp *l = curlwp;
struct vnode *vp = ap->a_vp;
dev_t dev, dev1;
int error;
enum kauth_device_req req;
specnode_t *sn, *sn1;
specdev_t *sd;
int dtype;
spec_ioctl_t ioctl;
u_int gen = 0;
const char *name = NULL;
bool needclose = false;
KASSERT(VOP_ISLOCKED(vp) == LK_EXCLUSIVE);
KASSERTMSG(vp->v_type == VBLK || vp->v_type == VCHR, "type=%d",
vp->v_type);
dev = vp->v_rdev;
sn = vp->v_specnode;
sd = sn->sn_dev;
if (vp->v_mount && (vp->v_mount->mnt_flag & MNT_NODEV))
return ENXIO;
switch (ap->a_mode & (FREAD | FWRITE)) {
case FREAD | FWRITE:
req = KAUTH_REQ_DEVICE_RAWIO_SPEC_RW;
break;
case FWRITE:
req = KAUTH_REQ_DEVICE_RAWIO_SPEC_WRITE;
break;
default:
req = KAUTH_REQ_DEVICE_RAWIO_SPEC_READ;
break;
}
error = kauth_authorize_device_spec(ap->a_cred, req, vp);
if (error)
return error;
mutex_enter(&device_lock);
KASSERT(!sn->sn_gone);
switch (vp->v_type) {
case VCHR:
while (sd->sd_closing) {
error = cv_wait_sig(&specfs_iocv, &device_lock);
if (error)
break;
}
if (error)
break;
sd->sd_opencnt++;
sn->sn_opencnt++;
KASSERTMSG(sn->sn_opencnt <= sd->sd_opencnt,
"sn_opencnt=%u > sd_opencnt=%u",
sn->sn_opencnt, sd->sd_opencnt);
break;
case VBLK:
if (sd->sd_opencnt != 0 ||
sd->sd_mountpoint != NULL ||
sd->sd_closing) {
error = EBUSY;
break;
}
KASSERTMSG(sn->sn_opencnt == 0, "sn_opencnt=%u",
sn->sn_opencnt);
sn->sn_opencnt = 1;
sd->sd_opencnt = 1;
sd->sd_bdevvp = vp;
break;
default:
panic("invalid specfs vnode type: %d", vp->v_type);
}
mutex_exit(&device_lock);
if (error)
return error;
if (vp->v_type == VCHR) {
if (cdev_type(dev) == D_TTY)
vp->v_vflag |= VV_ISTTY;
}
VOP_UNLOCK(vp);
error = spec_io_enter(vp, &sn1, &dev1);
if (error) {
vn_lock(vp, LK_EXCLUSIVE | LK_RETRY);
return error;
}
KASSERT(sn1 == sn);
KASSERT(dev1 == dev);
switch (vp->v_type) {
case VCHR:
do {
const struct cdevsw *cdev;
gen = module_gen;
error = cdev_open(dev, ap->a_mode, S_IFCHR, l);
if (error != ENXIO)
break;
mutex_enter(&device_lock);
cdev = cdevsw_lookup(dev);
mutex_exit(&device_lock);
if (cdev != NULL)
break;
if ((name = cdevsw_getname(major(dev))) == NULL)
break;
(void)module_autoload(name, MODULE_CLASS_DRIVER);
} while (gen != module_gen);
break;
case VBLK:
do {
const struct bdevsw *bdev;
gen = module_gen;
error = bdev_open(dev, ap->a_mode, S_IFBLK, l);
if (error != ENXIO)
break;
mutex_enter(&device_lock);
bdev = bdevsw_lookup(dev);
mutex_exit(&device_lock);
if (bdev != NULL)
break;
if ((name = bdevsw_getname(major(dev))) == NULL)
break;
(void)module_autoload(name, MODULE_CLASS_DRIVER);
} while (gen != module_gen);
break;
default:
__unreachable();
}
spec_io_exit(vp, sn);
vn_lock(vp, LK_EXCLUSIVE | LK_RETRY);
KASSERT(vp->v_specnode == sn);
mutex_enter(&device_lock);
if (sn->sn_gone) {
if (error == 0)
error = EBADF;
} else if (error == 0) {
KASSERT(sd->sd_opencnt);
KASSERT(sn->sn_opencnt);
KASSERTMSG(sn->sn_opencnt <= sd->sd_opencnt,
"sn_opencnt=%u > sd_opencnt=%u",
sn->sn_opencnt, sd->sd_opencnt);
KASSERT(!sd->sd_closing);
sd->sd_opened = true;
} else if (sd->sd_opencnt == 1 && sd->sd_opened) {
KASSERT(sn->sn_opencnt == 1);
needclose = true;
} else {
KASSERT(sd->sd_opencnt);
KASSERT(sn->sn_opencnt);
KASSERTMSG(sn->sn_opencnt <= sd->sd_opencnt,
"sn_opencnt=%u > sd_opencnt=%u",
sn->sn_opencnt, sd->sd_opencnt);
sd->sd_opencnt--;
sn->sn_opencnt--;
if (vp->v_type == VBLK)
sd->sd_bdevvp = NULL;
}
mutex_exit(&device_lock);
if (needclose) {
KASSERT(error);
VOP_CLOSE(vp, FNONBLOCK, NOCRED);
}
if (error)
return error;
switch (vp->v_type) {
case VCHR:
ioctl = cdev_ioctl;
dtype = cdev_type(dev);
break;
default:
ioctl = bdev_ioctl;
dtype = bdev_type(dev);
break;
}
if (dtype == D_DISK) {
struct partinfo pi;
off_t sz;
error = (*ioctl)(dev, DIOCGPARTINFO, &pi, FREAD, curlwp);
if (error == 0)
sz = (off_t)pi.pi_size * pi.pi_secsize;
else if (error == ENOTTY)
error = (*ioctl)(dev, DIOCGMEDIASIZE, &sz, FREAD, curlwp);
if (error == 0)
uvm_vnp_setsize(vp, (voff_t)sz);
}
return 0;
}
int
spec_read(void *v)
{
struct vop_read_args
*ap = v;
struct vnode *vp = ap->a_vp;
struct uio *uio = ap->a_uio;
struct lwp *l = curlwp;
struct specnode *sn;
dev_t dev;
struct buf *bp;
daddr_t bn;
int bsize, bscale;
struct partinfo pi;
int n, on;
int error = 0;
int i, nra;
daddr_t lastbn, *rablks;
int *rasizes;
int nrablks, ratogo;
KASSERT(uio->uio_rw == UIO_READ);
KASSERTMSG((VMSPACE_IS_KERNEL_P(uio->uio_vmspace) ||
uio->uio_vmspace == curproc->p_vmspace),
"vmspace belongs to neither kernel nor curproc");
if (uio->uio_resid == 0)
return 0;
switch (vp->v_type) {
case VCHR:
VOP_UNLOCK(vp);
error = spec_io_enter(vp, &sn, &dev);
if (error)
goto out;
error = cdev_read(dev, uio, ap->a_ioflag);
spec_io_exit(vp, sn);
out:
vn_lock(vp, LK_SHARED | LK_RETRY);
return error;
case VBLK:
KASSERT(vp == vp->v_specnode->sn_dev->sd_bdevvp);
if (uio->uio_offset < 0)
return EINVAL;
if (bdev_ioctl(vp->v_rdev, DIOCGPARTINFO, &pi, FREAD, l) == 0)
bsize = imin(imax(pi.pi_bsize, DEV_BSIZE), MAXBSIZE);
else
bsize = BLKDEV_IOSIZE;
bscale = bsize >> DEV_BSHIFT;
nra = uimax(16 * MAXPHYS / bsize - 1, 511);
rablks = kmem_alloc(nra * sizeof(*rablks), KM_SLEEP);
rasizes = kmem_alloc(nra * sizeof(*rasizes), KM_SLEEP);
lastbn = ((uio->uio_offset + uio->uio_resid - 1) >> DEV_BSHIFT)
&~ (bscale - 1);
nrablks = ratogo = 0;
do {
bn = (uio->uio_offset >> DEV_BSHIFT) &~ (bscale - 1);
on = uio->uio_offset % bsize;
n = uimin((unsigned)(bsize - on), uio->uio_resid);
if (ratogo == 0) {
nrablks = uimin((lastbn - bn) / bscale, nra);
ratogo = nrablks;
for (i = 0; i < nrablks; ++i) {
rablks[i] = bn + (i+1) * bscale;
rasizes[i] = bsize;
}
error = breadn(vp, bn, bsize,
rablks, rasizes, nrablks,
0, &bp);
} else {
if (ratogo > 0)
--ratogo;
error = bread(vp, bn, bsize, 0, &bp);
}
if (error)
break;
n = uimin(n, bsize - bp->b_resid);
error = uiomove((char *)bp->b_data + on, n, uio);
brelse(bp, 0);
} while (error == 0 && uio->uio_resid > 0 && n != 0);
kmem_free(rablks, nra * sizeof(*rablks));
kmem_free(rasizes, nra * sizeof(*rasizes));
return error;
default:
panic("spec_read type");
}
}
int
spec_write(void *v)
{
struct vop_write_args
*ap = v;
struct vnode *vp = ap->a_vp;
struct uio *uio = ap->a_uio;
struct lwp *l = curlwp;
struct specnode *sn;
dev_t dev;
struct buf *bp;
daddr_t bn;
int bsize, bscale;
struct partinfo pi;
int n, on;
int error = 0;
KASSERT(uio->uio_rw == UIO_WRITE);
KASSERTMSG((VMSPACE_IS_KERNEL_P(uio->uio_vmspace) ||
uio->uio_vmspace == curproc->p_vmspace),
"vmspace belongs to neither kernel nor curproc");
switch (vp->v_type) {
case VCHR:
VOP_UNLOCK(vp);
error = spec_io_enter(vp, &sn, &dev);
if (error)
goto out;
error = cdev_write(dev, uio, ap->a_ioflag);
spec_io_exit(vp, sn);
out: vn_lock(vp, LK_EXCLUSIVE | LK_RETRY);
return error;
case VBLK:
KASSERT(vp == vp->v_specnode->sn_dev->sd_bdevvp);
if (uio->uio_resid == 0)
return 0;
if (uio->uio_offset < 0)
return EINVAL;
if (bdev_ioctl(vp->v_rdev, DIOCGPARTINFO, &pi, FREAD, l) == 0)
bsize = imin(imax(pi.pi_bsize, DEV_BSIZE), MAXBSIZE);
else
bsize = BLKDEV_IOSIZE;
bscale = bsize >> DEV_BSHIFT;
do {
bn = (uio->uio_offset >> DEV_BSHIFT) &~ (bscale - 1);
on = uio->uio_offset % bsize;
n = uimin((unsigned)(bsize - on), uio->uio_resid);
if (n == bsize)
bp = getblk(vp, bn, bsize, 0, 0);
else
error = bread(vp, bn, bsize, B_MODIFY, &bp);
if (error) {
return error;
}
n = uimin(n, bsize - bp->b_resid);
error = uiomove((char *)bp->b_data + on, n, uio);
if (error)
brelse(bp, 0);
else {
if (n + on == bsize)
bawrite(bp);
else
bdwrite(bp);
error = bp->b_error;
}
} while (error == 0 && uio->uio_resid > 0 && n != 0);
return error;
default:
panic("spec_write type");
}
}
int
spec_fdiscard(void *v)
{
struct vop_fdiscard_args
*ap = v;
struct vnode *vp = ap->a_vp;
dev_t dev;
KASSERT(VOP_ISLOCKED(vp) == LK_EXCLUSIVE);
dev = vp->v_rdev;
switch (vp->v_type) {
case VCHR:
#if 0
KASSERT(vp == vp->v_specnode->sn_dev->sd_cdevvp);
#endif
return cdev_discard(dev, ap->a_pos, ap->a_len);
case VBLK:
KASSERT(vp == vp->v_specnode->sn_dev->sd_bdevvp);
return bdev_discard(dev, ap->a_pos, ap->a_len);
default:
panic("spec_fdiscard: not a device\n");
}
}
int
spec_ioctl(void *v)
{
struct vop_ioctl_args
*ap = v;
struct vnode *vp = ap->a_vp;
struct specnode *sn;
dev_t dev;
int error;
error = spec_io_enter(vp, &sn, &dev);
if (error)
return error;
switch (vp->v_type) {
case VCHR:
error = cdev_ioctl(dev, ap->a_command, ap->a_data,
ap->a_fflag, curlwp);
break;
case VBLK:
KASSERT(vp == vp->v_specnode->sn_dev->sd_bdevvp);
error = bdev_ioctl(dev, ap->a_command, ap->a_data,
ap->a_fflag, curlwp);
break;
default:
panic("spec_ioctl");
}
spec_io_exit(vp, sn);
return error;
}
int
spec_poll(void *v)
{
struct vop_poll_args
*ap = v;
struct vnode *vp = ap->a_vp;
struct specnode *sn;
dev_t dev;
int revents;
if (spec_io_enter(vp, &sn, &dev) != 0)
return POLLERR;
switch (vp->v_type) {
case VCHR:
revents = cdev_poll(dev, ap->a_events, curlwp);
break;
default:
revents = genfs_poll(v);
break;
}
spec_io_exit(vp, sn);
return revents;
}
int
spec_kqfilter(void *v)
{
struct vop_kqfilter_args
*ap = v;
struct vnode *vp = ap->a_vp;
struct specnode *sn;
dev_t dev;
int error;
error = spec_io_enter(vp, &sn, &dev);
if (error)
return error;
switch (vp->v_type) {
case VCHR:
error = cdev_kqfilter(dev, ap->a_kn);
break;
default:
error = EOPNOTSUPP;
break;
}
spec_io_exit(vp, sn);
return error;
}
int
spec_mmap(void *v)
{
struct vop_mmap_args
*ap = v;
struct vnode *vp = ap->a_vp;
struct specnode *sn;
dev_t dev;
int error;
KASSERT(vp->v_type == VBLK);
error = spec_io_enter(vp, &sn, &dev);
if (error)
return error;
error = bdev_type(dev) == D_DISK ? 0 : EINVAL;
spec_io_exit(vp, sn);
return 0;
}
int
spec_fsync(void *v)
{
struct vop_fsync_args
*ap = v;
struct vnode *vp = ap->a_vp;
struct mount *mp;
int error;
if (vp->v_type == VBLK) {
if ((mp = spec_node_getmountedfs(vp)) != NULL) {
error = VFS_FSYNC(mp, vp, ap->a_flags);
if (error != EOPNOTSUPP)
return error;
}
return vflushbuf(vp, ap->a_flags);
}
return 0;
}
int
spec_strategy(void *v)
{
struct vop_strategy_args
*ap = v;
struct vnode *vp = ap->a_vp;
struct buf *bp = ap->a_bp;
struct specnode *sn = NULL;
dev_t dev;
int error;
error = spec_io_enter(vp, &sn, &dev);
if (error)
goto out;
bp->b_dev = dev;
if (!(bp->b_flags & B_READ)) {
#ifdef DIAGNOSTIC
if (bp->b_vp && bp->b_vp->v_type == VBLK) {
struct mount *mp = spec_node_getmountedfs(bp->b_vp);
if (mp && (mp->mnt_flag & MNT_RDONLY)) {
printf("%s blk %"PRId64" written while ro!\n",
mp->mnt_stat.f_mntonname, bp->b_blkno);
#ifdef DDB
db_stacktrace();
#endif
}
}
#endif
error = fscow_run(bp, false);
if (error)
goto out;
}
bdev_strategy(bp);
error = 0;
out: if (sn)
spec_io_exit(vp, sn);
if (error) {
bp->b_error = error;
bp->b_resid = bp->b_bcount;
biodone(bp);
}
return error;
}
int
spec_inactive(void *v)
{
struct vop_inactive_v2_args
*ap = v;
KASSERT(ap->a_vp->v_mount == dead_rootmount);
*ap->a_recycle = true;
return 0;
}
int
spec_reclaim(void *v)
{
struct vop_reclaim_v2_args
*ap = v;
struct vnode *vp = ap->a_vp;
KASSERT(vp->v_specnode->sn_opencnt == 0);
VOP_UNLOCK(vp);
KASSERT(vp->v_mount == dead_rootmount);
return 0;
}
int
spec_bmap(void *v)
{
struct vop_bmap_args
*ap = v;
if (ap->a_vpp != NULL)
*ap->a_vpp = ap->a_vp;
if (ap->a_bnp != NULL)
*ap->a_bnp = ap->a_bn;
if (ap->a_runp != NULL)
*ap->a_runp = (MAXBSIZE >> DEV_BSHIFT) - 1;
return 0;
}
int
spec_close(void *v)
{
struct vop_close_args
*ap = v;
struct vnode *vp = ap->a_vp;
struct session *sess;
dev_t dev;
int flags = ap->a_fflag;
int mode, error, count;
specnode_t *sn;
specdev_t *sd;
KASSERT(VOP_ISLOCKED(vp) == LK_EXCLUSIVE);
mutex_enter(vp->v_interlock);
sn = vp->v_specnode;
dev = vp->v_rdev;
sd = sn->sn_dev;
if (vdead_check(vp, VDEAD_NOWAIT) != 0)
flags |= FNONBLOCK;
mutex_exit(vp->v_interlock);
switch (vp->v_type) {
case VCHR:
mutex_enter(&proc_lock);
sess = curlwp->l_proc->p_session;
if (sn->sn_opencnt == 1 && vp == sess->s_ttyvp) {
mutex_spin_enter(&tty_lock);
sess->s_ttyvp = NULL;
if (sess->s_ttyp->t_session != NULL) {
sess->s_ttyp->t_pgrp = NULL;
sess->s_ttyp->t_session = NULL;
mutex_spin_exit(&tty_lock);
proc_sessrele(sess);
} else {
mutex_spin_exit(&tty_lock);
if (sess->s_ttyp->t_pgrp != NULL)
panic("spec_close: spurious pgrp ref");
mutex_exit(&proc_lock);
}
vrele(vp);
} else
mutex_exit(&proc_lock);
mode = S_IFCHR;
break;
case VBLK:
KASSERT(vp == vp->v_specnode->sn_dev->sd_bdevvp);
error = vinvalbuf(vp, V_SAVE, ap->a_cred, curlwp, 0, 0);
if (error)
return error;
mode = S_IFBLK;
break;
default:
panic("spec_close: not special");
}
mutex_enter(&device_lock);
KASSERT(sn->sn_opencnt);
KASSERT(sd->sd_opencnt);
KASSERTMSG(sn->sn_opencnt <= sd->sd_opencnt,
"sn_opencnt=%u > sd_opencnt=%u",
sn->sn_opencnt, sd->sd_opencnt);
sn->sn_opencnt--;
count = --sd->sd_opencnt;
if (vp->v_type == VBLK) {
KASSERTMSG(count == 0, "block device with %u opens",
count + 1);
sd->sd_bdevvp = NULL;
}
if (count == 0) {
KASSERTMSG(sn->sn_opencnt == 0, "sn_opencnt=%u",
sn->sn_opencnt);
KASSERT(!sd->sd_closing);
sd->sd_opened = false;
sd->sd_closing = true;
}
mutex_exit(&device_lock);
if (count != 0)
return 0;
if (!(flags & FNONBLOCK))
VOP_UNLOCK(vp);
if (vp->v_type == VBLK)
error = bdev_cancel(dev, flags, mode, curlwp);
else
error = cdev_cancel(dev, flags, mode, curlwp);
if (error == 0)
spec_io_drain(sd);
else
KASSERTMSG(error == ENODEV, "cancel dev=0x%lx failed with %d",
(unsigned long)dev, error);
if (vp->v_type == VBLK)
error = bdev_close(dev, flags, mode, curlwp);
else
error = cdev_close(dev, flags, mode, curlwp);
spec_io_drain(sd);
mutex_enter(&device_lock);
KASSERT(!sd->sd_opened);
KASSERT(sd->sd_closing);
sd->sd_closing = false;
cv_broadcast(&specfs_iocv);
mutex_exit(&device_lock);
if (!(flags & FNONBLOCK))
vn_lock(vp, LK_EXCLUSIVE | LK_RETRY);
return error;
}
int
spec_print(void *v)
{
struct vop_print_args
*ap = v;
printf("dev %llu, %llu\n", (unsigned long long)major(ap->a_vp->v_rdev),
(unsigned long long)minor(ap->a_vp->v_rdev));
return 0;
}
int
spec_pathconf(void *v)
{
struct vop_pathconf_args
*ap = v;
switch (ap->a_name) {
case _PC_LINK_MAX:
*ap->a_retval = LINK_MAX;
return 0;
case _PC_MAX_CANON:
*ap->a_retval = MAX_CANON;
return 0;
case _PC_MAX_INPUT:
*ap->a_retval = MAX_INPUT;
return 0;
case _PC_PIPE_BUF:
*ap->a_retval = PIPE_BUF;
return 0;
case _PC_CHOWN_RESTRICTED:
*ap->a_retval = 1;
return 0;
case _PC_VDISABLE:
*ap->a_retval = _POSIX_VDISABLE;
return 0;
case _PC_SYNC_IO:
*ap->a_retval = 1;
return 0;
default:
return genfs_pathconf(ap);
}
}
int
spec_advlock(void *v)
{
struct vop_advlock_args
*ap = v;
struct vnode *vp = ap->a_vp;
return lf_advlock(ap, &vp->v_speclockf, (off_t)0);
}